К основному содержимому
все выпуски
Research Insights Made Simple · выпуск 21

Как измерять coding agents в диалоге с Алексеем Литвиновым

1:04:37
TelegramLinkedIn
Содержание

Что обсудили голосом

Александр Поломодов и Алексей Литвинов сравнивают SWE-Together и SWE-INTERACT: они проверяют coding agents в диалоге с постепенно раскрываемыми требованиями. Обычный benchmark видит финальный репозиторий, но не показывает, удерживает ли агент контекст и сколько внимания требует ошибочная траектория.

SWE-Together превращает реальные сессии в 109 задач и использует реактивного симулятора. SWE-INTERACT берёт 75 готовых задач, сохраняет исходные проверки и выдаёт скрытые требования порциями от лица senior-инженера. Первый ближе к практике, второй чище измеряет разрыв между полной спецификацией и диалогом.

В SWE-Together число пользовательских поправок связано с pass@1 на уровне Pearson −0,92. В SWE-INTERACT resolve rate GPT-5.5 падает с 48,0 до 24,7%, Opus 4.8 — с 50,7 до 26,7%, а шаги и стоимость GPT-5.5 растут до 3,9 и 3,5 раза. Частая причина — забытые ранние требования.

Это не универсальный рейтинг: SWE-Together сохранил лишь 0,97% сессий и использует LLM как симулятора и судью, а SWE-INTERACT зависит от одной persona и конкретных harnesses. Внутренний scorecard должен измерять итог, число поправок и multi-turn gap; ledger требований, план и независимую проверку стоит проверять через A/B eval.

AI в SDLCDeveloper productivityМетодология исследований