К основному содержимому
#AI4SDLC

[2/2] Claude Code и экспертиза: почему успешность сессии ещё не признак продуктивности (Рубрика AI4SDLC)

#AI4SDLC #AI #Research #Engineering #Agents #Metrics #DevEx

Продолжаю разбор исследлования Anthropic "Agentic coding and persistent returns to expertise" про использование Claude Code. В первой части мы поговорили про методологию и результаты самого исследования, а теперь хотелось бы понять как их стоит интерпретировать и как оценивать вес приведенных в исследовании доказательств. Я бы их разложил по такой шкале

1️⃣ Высокая уверенность в описании выбранного трафика Claude Code Какие режимы работы встречались, сколько внутренних действий запускал запрос пользователя и как внутри сессий делились планирование и исполнение. 2️⃣ Средняя уверенность в связи между оценённой экспертизой и исходом Разница сохраняется после статистических контролей и во внутренней проверке Anthropic, где код из сессий с более высокой expertise чаще попадал в main. Но это наблюдение, не эксперимент. 3️⃣ Низкая уверенность в выводах о причинности Речь идет о производительности команд, качестве или рынке труда. Эти результаты исследование просто не измеряло.

Главная методологическая проблема исследования - это распространённое смещение методов (CMB, common-method bias). Суть в том, что и экспертиза человека, и успех сессии извлекаются моделью из одного транскрипта. Причём определение экспертизы включает точную постановку задачи, адресную проверку и способность исправить Claude. А успех включает прошедшие тесты, commits и подтверждение пользователя. Получается частичное пересечение конструкций. Человек, который умеет запросить хорошую проверку и ясно сообщить результат, одновременно выглядит для классификатора и более компетентным, и более успешным.

На 198 SWE-chat-сессиях классификаторы сравнили с Mythos Preview. Для порядковых метрик точное совпадение составило 53–68%, а с допуском соседнего уровня - 78–99%; для categorical - 78–98%. Человек проверил лишь 15 расхождений, которые модель-судья сочла существенными. Это согласие с сильной моделью (strong-model agreement), а не эталонные данные, размеченные человеком (human ground truth).

Второй интересный момент - то верифицированный успех (verified success), который требует явное подтверждение результата. Но исследователи не видят, был ли код принят командой, развёрнут, безопасен и полезен пользователю. Именно поэтому успех сессии нельзя незаметно переименовать в продуктивность работы.

Третий интересный момент - это «экономическая ценность». Anthropic сообщает, что модельная стоимость средней задачи выросла на 27%. Но цена строится через превращение сессии в условный freelance job и сопоставление с объявлениями. В приложении у оценщика log R² ≈ 0,38: маленькие задачи он переоценивает примерно в 2,4 раза, крупнейшие недооценивает примерно в 7 раз. Корректный вывод скромнее: менялся оценочный состав задач, а не измеренная экономическая ценность.

Чтобы понять последствия для влияния AI на процессы разработки, одного источника мало. Рядом полезно поставить отдельный рандомизированный эксперимент Anthropic "How AI Impacts Skill Formation" (от 28 января 2026 года). Там 52 разработчика изучали незнакомую Python-библиотеку Trio с GPT-4o или без AI, а затем проходили одинаковый тест без помощника. Группа с AI закончила примерно на две минуты быстрее, но разница не была статистически значимой. В тесте она набрала в среднем 50% против 67% у группы без AI; самый большой разрыв был в отладке. В качественном анализе объяснения и самостоятельная попытка были связаны с лучшим обучением, чем полное делегирование.

Эти исследования нельзя просто сравнивать в лоб, так как

  • Первое наблюдает опыт, проявленный в реальных Claude Code-сессиях
  • Второе экспериментально проверяет краткосрочное формирование нового навыка на маленькой выборке Вместе они создают организационный парадокс: более высокая экспертиза в задачах связана с большей активностью агента и успехом сессий, а полное делегирование в узком контролируемом эксперименте - с более слабым освоением навыка.

#AI #AI4SDLC #Research #Engineering #Agents #Metrics #DevEx