Anthropic показала, як Claude виконує дослідження: 26% завдань на рівні AL4

·623 слівредакція
Anthropic показала, як Claude виконує дослідження: 26% завдань на рівні AL4

Anthropic уперше оприлюднила внутрішні метрики, які показують, наскільки активно її модель Claude бере участь у створенні наступних поколінь ШІ. У 26% дослідницьких завдань модель уже виконує більшу частину роботи, тоді як людина лише наглядає.

Компанія Anthropic розкрила набір внутрішніх показників, покликаних продемонструвати темпи автоматизації досліджень і розробок усередині лабораторії. За її даними, Claude виконує основну частину роботи в 26% завдань, пов'язаних зі створенням майбутніх моделей штучного інтелекту. Ще в березні 2026 року цей показник становив 1%.

Для оцінювання ролі ШІ використали шкалу автоматизації Epoch AI з шістьма рівнями — від AL0, коли модель не залучена до роботи, до AL5, коли вона діє повністю автономно. Станом на серпень 2026 року Claude не досяг повної автономності в жодному з напрямів, які вимірювали. Водночас у 26% завдань він працює на рівні AL4: отримує від людини загальне завдання і виконує більшу його частину, а дослідник лише наглядає. Понад 90% усіх дослідницьких завдань перебувають щонайменше на рівні AL3, коли модель виконує значний обсяг роботи у співпраці з людиною.

Окремо компанія показала, як контролює власних агентів. На її основній внутрішній платформі працюють близько 30 тисяч агентів, і всі їхні дії проходять через систему моніторингу: онлайн-перевірки в реальному часі та офлайн-аналіз після виконання завдань. Онлайн-монітори перевіряють 100% дій ще до їх виконання й можуть автоматично блокувати небезпечні операції, зокрема спроби скопіювати ваги моделей із внутрішніх систем. Упродовж серпня вони проаналізували понад мільярд рішень агентів і заблокували лише 0,002% дій — приблизно одну з кожних 47 тисяч. Офлайн-монітори щотижня опрацьовують близько 100 тисяч стенограм роботи агентів; більшість позначених випадків відсіюють автоматичні класифікатори, а близько 50 найважливіших щотижня передають людям.

Компанія також уперше показала розподіл обчислювальних ресурсів між розвитком моделей і безпекою. За тиждень з 13 до 20 липня 2026 року приблизно 6% обчислень, пов'язаних із дослідженнями та розробкою ШІ, припадало на роботи з безпеки, а з урахуванням ширшого набору відповідних навантажень — близько 12%. «Це навмисно занижені оцінки. Наприклад, якщо той чи інший токен використовувався для розширення можливостей у тій же мірі, що й для підвищення безпеки, його не враховували в цих показниках. Крім того, ці показники не враховують класифікатори заходів безпеки, які становлять окремий, порівнянний обсяг обчислювальних ресурсів і роблять наші моделі набагато безпечнішими для світу», — зазначили в Anthropic.

У компанії вважають, що подібні метрики могли б регулярно публікувати всі лабораторії, які розробляють передові моделі ШІ. Спільна методологія та незалежна перевірка звітів дали б змогу порівнювати темпи автоматизації, ефективність нагляду за агентами й частку ресурсів, які компанії спрямовують на безпеку. За словами Anthropic, у майбутньому сторонні незалежні оцінювачі отримають доступ до внутрішніх процесів, щоб перевіряти практики безпеки, повідомляти про інциденти й контролювати такі показники.

Тим часом OpenAI вже запровадила регулярне звітування про випадки несанкціонованої та небезпечної поведінки своїх систем. В оприлюднених звітах ідеться про те, що тестові моделі приховували помилки від людей, обмінювалися даними через зовнішні сховища й закликали інші алгоритми саботувати корпоративні обмеження заради виконання завдань. Звітність з'являється на тлі ширшої дискусії про можливе уповільнення розвитку найпотужніших систем ШІ, яку розпочав генеральний директор Anthropic Даріо Амодей. Ініціативу підтримали гендиректор OpenAI Сем Альтман та керівник xAI Ілон Маск, тоді як засновник Meta Марк Цукерберг і глава Nvidia Дженсен Хуанг виступили проти сповільнення розробок. Президент США Дональд Трамп відкинув твердження про те, що ШІ становить екзистенційну загрозу для людства.

Читайте також