The Anthropic Economic Index report: Economic Primitives (Рубрика AI)
В январе вышел интересный отчет от Anthropic, в котором они не только рассказали про то, как Claude помогает всем эффективнее работать, но и поделились новым подходом с экономическими примитивами. Собственно, авторы взяли 1 млн разговоров Claude.ai и 1 млн записей 1P API за 13-20 ноября 2025 и прогнали их через набор простых economic primitives - базовых координат того, как модель используется. Это позволило им уйти от одного большого индекса к нескольким сигналам, что позволяют рассуждать про принятие технологии (adoption), автоматизацию (automation), подверженность работы AI (job exposure) и продуктивности. Авторы выбирали примитивы по экономической релевантности, комплементарности и способности Claude классифицировать их автоматически при помощи простых промптов.
Новых примитивов пять, но фактически это девять классификаторов (приложил их вместе с промптами в качестве картинок) 1) Task complexity: сколько часов заняла бы задача у человека без AI, сколько минут ушло с AI, и есть ли multitasking. 2) Human and AI skills: смог бы человек сделать это без Claude, сколько лет образования нужно, чтобы понять prompt, и сколько - чтобы понять ответ. 3) Use case: work / coursework / personal. 4) AI autonomy: сколько решений реально делегировали модели по шкале 1-5. 5) Task success: справился ли Claude с задачей. И это идет поверх старого измерения automation vs augmentation: например, “переведи абзац на французский” - automation высокая, а autonomy низкая, потому что решать там почти нечего. Инженерная деталь: они пробовали и более сложные classifier’ы, и CoT-подсказки; в итоге CoT оставили только там, где оно реально улучшало качество - для human time, human+AI time и AI autonomy.
Такая классификация позволяет уйти от грубой метрики “AI встретился в задаче” к многофакторной модели: насколько задача сложная, требует ли она редкого человеческого капитала, это работа или учеба, насколько человек уже отдал управление машине, и есть ли вообще шанс, что автоматизация сработает не только красиво в демке, но и в проде. Правда, это не внешняя оценка, а суждение самого Claude.
Для инженеров полезно посмотреть а как эти примитивы позволяют отделить“AI для реальной работы” от “AI как удобная мелочь”. В пользовательской выборке Claude.ai software запросы тянут на 13.8 года необходимого образования и имеют success rate 61%, а вопросы про персональный менеджмен - тянут всего на 9.4 года и имеют 78% success rate. При этом в среднем по Claude.ai выборке задача без AI заняла бы 3.1 часа, с AI - 15.4 минуты; 46% использования —-это work. То есть LLM уже сидят не только в “простых” бытовых сценариях, а занимают значительное место в работе белых воротничков.
Интересно, что чем сложнее и “образованнее” задача (требует больше лет образование), тем больше ускорение, но тем ниже надежность (success rate). В Claude.ai задачи примерно на уровне 12 лет образования дают около 9x ускорения, а на уровне 16 лет - уже около 12x. Но success rate при росте сложности падает: для менее сложных задач он около 70%, а для сценариев уровня колледжа - около 66%. На API ускорение еще выше, но и падение успеха с ростом сложности заметнее.
Ну и последний интересный инсайт, о котором я хотел рассказать - это горизонт времени задачи, на котором она дает 50% успех. Если смотреть на связь success rate и времени, которое человеку понадобилось бы на задачу без AI, то
- у API линия 50% success пересекается примерно на 3.5 часа
- у Claude.ai - примерно на 19 часах. Авторы честно пишут, что это не чистая capability-метрика, а смесь возможностей модели и поведения пользователя; вероятно, multi-turn диалог помогает дробить длинную работу на управляемые шаги. Но для технических руководителей это знак того, что оркестрация, циклы обратной связи и человек-в-контуре (human in the loop) могут менять экономику AI не меньше, чем новый бенчмарк модели.
#AI #Economics #Metrics #Software #Engineering