Как измерять coding agents в диалоге с Алексеем Литвиновым
Участники выпуска
Что обсудили голосом
Александр Поломодов и Алексей Литвинов сравнивают SWE-Together и SWE-INTERACT: они проверяют coding agents в диалоге с постепенно раскрываемыми требованиями. Обычный benchmark видит финальный репозиторий, но не показывает, удерживает ли агент контекст и сколько внимания требует ошибочная траектория.
SWE-Together превращает реальные сессии в 109 задач и использует реактивного симулятора. SWE-INTERACT берёт 75 готовых задач, сохраняет исходные проверки и выдаёт скрытые требования порциями от лица senior-инженера. Первый ближе к практике, второй чище измеряет разрыв между полной спецификацией и диалогом.
В SWE-Together число пользовательских поправок связано с pass@1 на уровне Pearson −0,92. В SWE-INTERACT resolve rate GPT-5.5 падает с 48,0 до 24,7%, Opus 4.8 — с 50,7 до 26,7%, а шаги и стоимость GPT-5.5 растут до 3,9 и 3,5 раза. Частая причина — забытые ранние требования.
Это не универсальный рейтинг: SWE-Together сохранил лишь 0,97% сессий и использует LLM как симулятора и судью, а SWE-INTERACT зависит от одной persona и конкретных harnesses. Внутренний scorecard должен измерять итог, число поправок и multi-turn gap; ledger требований, план и независимую проверку стоит проверять через A/B eval.