В материале
11 разд.AI уже не просто пишет код для Anthropic
Anthropic опубликовала редкие внутренние цифры о том, как Claude используется для создания будущих моделей. На август 2026 года Claude «ведёт» 26% измеренной AI-исследовательской и инженерной работы: получает высокоуровневую задачу, выполняет большую часть end-to-end, а человек остаётся надзирателем. Более 90% работы уже находится на уровне, где AI как минимум активно сотрудничает с человеком.
От почти нуля до четверти работы за полгода
В феврале доля задач уровня AI-leads была меньше 1%. В августе — уже 26%. Anthropic не утверждает, что Claude автономно строит своего преемника: ни одна измеренная категория R&D пока не достигла AL5, где AI работает полностью самостоятельно.
Как Anthropic это посчитала
Компания создала R&D Automation Index. Исследователи собрали около 15 тысяч гранулярных задач из рабочих записей, Slack и внутренней документации, организовали их в дерево из 542 узлов и оценили автоматизацию по шкале Epoch AI от AL0 до AL5. Вес задач определяли через долю человеческого рабочего времени.
Метрика несовершенна — и Anthropic это признаёт
Оценивание во многом делали модели Claude, поэтому есть риск, что judge-модель повторяет ошибки оцениваемой системы. Anthropic сверяла часть оценок с сотрудниками: модель и люди были в пределах одного уровня в 97% случаев, точное совпадение составило 59%. Компания предлагает независимую проверку.
Внутри Anthropic одновременно работают около 30 тысяч агентов
На самой используемой внутренней платформе компании в августе одновременно работало примерно 30 000 research и engineering agents. 100% их действий проходят через online monitor до выполнения и затем попадают в offline monitoring.
Сколько действий реально блокируют
За август Anthropic проанализировала более миллиарда решений агентов. Online monitor заблокировал около 0,002% — примерно одно решение на 47 тысяч. Offline-система дополнительно отбирает около 100 тысяч transcripts в неделю, а примерно 50 наиболее приоритетных случаев доходят до людей.
Почему все говорят о recursive self-improvement
Когда AI ускоряет исследования, создающие более сильный AI, возникает положительная обратная связь. Anthropic называет полностью автономное замыкание цикла recursive self-improvement. Текущие данные ещё не показывают такого состояния, но дают числовую шкалу приближения.
Есть ещё один неудобный показатель — compute на safety
За отдельно изученную неделю июля около 6% compute для AI R&D было классифицировано как safety work; среди compute именно AI-driven R&D доля была около 12%. Anthropic называет оценки консервативными и признаёт, что compute — несовершенный proxy.
Что это означает для разработчиков
Для обычной команды главный урок — автоматизация R&D требует инфраструктуры надзора: отдельных identity агентов, журналирования, минимальных прав, мониторов до и после действия и понятного escalation path к человеку.
Почему это одна из важнейших AI-новостей дня
Рынок привык оценивать модели по бенчмаркам. Anthropic предлагает другую метрику: сколько работы по созданию следующих моделей уже выполняет сам AI. Если другие frontier labs начнут публиковать такие цифры, темп автоматизации станет измеримым.
Anthropic опубликовала редкие внутренние цифры о том, как Claude используется для создания будущих моделей. На август 2026 года Claude «ведёт» 26% измеренной AI-исследовательской и инженерной работы: получает высокоуровневую задачу, выполняет большую часть end-to-end, а человек остаётся надзирателем. Более 90% работы уже находится на уровне, где AI как минимум активно сотрудничает с человеком.
- От почти нуля до четверти работы за полгода
- Как Anthropic это посчитала
- Метрика несовершенна — и Anthropic это признаёт
- Внутри Anthropic одновременно работают около 30 тысяч агентов
Иллюстрации
Источники и проверка
- AnthropicMeasurements for understanding the pace of AI development inside frontier labs
- Associated PressAnthropic says its model Claude is helping to build the next version of itself



Комментарии0 комментариев
Комментарии