К основному содержимому
#AI4SDLC

[1/2] Claude Code и экспертиза: что показали 398 тысяч сессий (Рубрика AI4SDLC)

#AI4SDLC #AI #Research #Engineering #Agents #Metrics #DevEx

Добавлял в корпус мета-исследования AI4SDLC 2026 свежую работу (16 июня 2026) Anthropic "Agentic coding and persistent returns to expertise", в заголовок которой вынесен вывод о том, что кодинговые агенты не отменяют экспертизу. Но для меня здесь интереснее другое - подход авторов к измерению разделению труда между человеком и Claude Code на реальных рабочих сессиях. Это большой, но не экспериментальный источник. Anthropic взяла случайную выборку из 398 198 интерактивных сессий 234 751 пользователя с октября 2025 по апрель 2026 года. В выборку вошли Claude Code в CLI, Claude.ai и desktop-приложение. Внутренние сессии сотрудников Anthropic, сторонние IDE, SDK и headless-запуски исключили. Это сильные наблюдательные данные одного продукта, а не независимое исследование всей разработки ПО.

Метод устроен интересно. Модельные классификаторы читали транскрипты с сохранением приватности и размечали:

  • какой вид работы выполнялся;
  • кто принимал решения о планировании и исполнении;
  • какую предметную компетентность показывал пользователь;
  • чем закончилась сессия.

Часть классификации авторы сверяли с независимой телеметрией: числом обращений к модели и инструментам, объёмом вывода, добавленными и удалёнными строками. А commits, tests и подтверждение пользователя искал уже отдельный transcript-классификатор успеха. Исследователи не читали отдельные приватные транскрипты, а публиковали только агрегаты.

Под экспертизой авторы понимали компетентность пользователей в текущей задачи (а не грейд, стаж или название должности). Для оценки экспертизы авторы использовали классификатор оценки компетентности в рамках задачи по пяти уровням: насколько точно он задаёт рамку, понимает терминологию, просит проверить конкретные риски и исправляет Claude по существу. Senior-разработчик, впервые пишущий на Rust, может оказаться начинающим в задаче на Rust кодинг. Бухгалтер без опыта Python, который точно задаёт правила сверки и ловит ошибку в обработке закрытия месяца, - это эксперт в бухгалтерской задачи. Итого: исследование не сравнивает junior и senior engineers.

Результаты получились интересными

1️⃣ Разделение труда уже заметно В типичной сессии человек принимал около 70% решений о том, что делать, но только 20% решений о том, как именно это выполнить. Иными словами, пользователь в основном удерживал цель и критерии, а Claude - выбор файлов, команд и деталей реализации. Это хорошо ложится на цепочку, о которой я писал в State of AI4SDLC: intent → context → plan → tasks → implementation → verification. Анализ Anthropic не доказывает, что весь SDLC уже перестроился, но показывает похожий паттерн внутри интерактивной работы с агентом.

2️⃣ Различные по уровню компетенции сессии приводили к разному уровню делегирования В сессиях, размеченных как novice, один запрос запускал примерно 5 действий Claude и 600 слов вывода, а в expert-сессиях - около 12 действий и 3 200 слов. Связь сохранялась после учёта work mode, task value, месяца, профессии и model family. Но «больше действий и текста» ещё не значит «больше полезной работы». Длинная цепочка может быть автономным исполнением, а может - лишними итерациями и переделками. Пока это мера делегирования, не productivity.

3️⃣ Более высокая оценка expertise была связана с более частым `verified success` После статистической корректировки этот показатель рос с 14,5% у novice до 20,9% у beginner, 28,3% у intermediate, 29,5% у advanced и 32,9% у expert. Основной скачок происходит между novice и intermediate; между intermediate и expert прирост заметно меньше. Verified success здесь означает, что классификатор счёл цель достигнутой и нашёл хотя бы один сигнал: прошедший тест или команду, подходящий commit/PR либо явное подтверждение пользователя. Это строже простого модельного вердикта, но ещё не означает, что изменение дошло до production и принесло пользу.

Я уже разбирал Anthropic Agentic Coding Trends и переход от написания кода к управлению агентами. Новая работа добавляет к этой линии наблюдаемый паттерн: агент забирает большую часть исполнения, а task-specific expertise связана с более частым успехом сессии.

А в следующей части разберу неприятный вопрос: насколько надёжно здесь измерены expertise и success, почему корреляция ещё не причинность и что отдельный рандомизированный эксперимент говорит о формировании навыков.

#AI #AI4SDLC #Research #Engineering #Agents #Metrics #DevEx