SWE-Interact: сколько стоит интерактивность кодинг-агентам (Рубрика AI4SDLC)
Решил сегодня рассказать про вторую статья про оценку кодинг-агентов в диалоге - "SWE-Interact: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions" от Scale AI. Любопытное совпадение: она вышла на arXiv 29 июня 2026 — в тот же день, что и SWE-Together от Meta (запрещенной в России), который я сегодня разбирал. Две команды практически одновременно пришли к одной мысли: одноходовые бенчмарки перестали отражать реальную работу с агентами, мерить надо диалог. Похоже, multi-turn оценка оформляется в отдельное направление (или Meta и Scale AI как-то связаны ... ||ах точно Meta же выкупила 49% Scale AI за $14 млрд и еще забрала к себе основателя компании||)
Scale собирает бенчмарк с противоположной стороны. Meta идет снизу вверх: из 11,260 реальных сессий восстанавливает 109 задач и якорит симулятор на намерения живых пользователей. Scale идет сверху вниз: берет 75 готовых задач из трех существующих бенчмарков (SWE-bench Pro, SWE Atlas (Refactoring), DeepSWE - первые два, замечу, ее собственные), прячет полную постановку внутрь симулятора пользователя и заставляет раскрывать требования постепенно. Решение при этом проверяет оригинальный верификатор задачи. Ход изящный: та же задача, тот же верификатор - меняется только способ подачи требований. Разница в resolve rate становится почти чистой ценой интерактивности.
И тут цена оказалась реально высокой - лучшие модели решают около 50% задач в одноходовом режиме - и лишь примерно четверть тех же задач в диалоге: GPT-5.5 падает с 48.0% до 24.7%, Opus 4.8 - с 50.7% до 26.7%. При этом шагов обычно в 3–4 раза больше, токенов - до 4.5 раза, а стоимость задачи в 2–3.5 раза выше (у Opus 4.8 - $11.80 против $5.09). Работа с пользователем добавляет отдельную ось сложности задачи.
Симулятор пользователя здесь интереснее, чем у Meta 1️⃣ Авторы создали персону из статистики Для этого они проанализировали реальные сессии из датасета SWE-chat и смоделировали самый частый типаж - дотошный эксперт в режиме vibecoding: senior-разработчик, который пишет коротко и небрежно, кода сам не трогает (по данным SWE-chat, в этом режиме агент пишет более 99% кода), но придирчиво следит за точными сигнатурами API и выдает замечания по одному за раз 2️⃣ Сам симулятор агентный у него есть shell-доступ к рабочей копии агента (git, grep, sed, find), и перед тем как ответить, он сам смотрит диффы и коммиты. У Meta симулятор видит только текст - сводки траектории и выводы инструментов; авторы SWE-Together сами перечисляли это среди ограничений. А тут эксперимент показывает, что дотошная персона - это боль: с ней шаги траекторий у большинства моделей растут на 30–50%, число реплик пользователя почти удваивается, а resolve rate снижается у 4 из 5 моделей по сравнению с нейтральным симулятором, который просто выдает требования по запросу.
В статье приведен и разбор провалов (это аудит 287 неудачных траекторий).
- Некоторые модели умеют хорошо распрашивать и уже по расплывчатому описанию закладывают в план более 80% скрытых целей, а GPT-5.5, Opus 4.8 и Sonnet 4.6 к концу диалога закрывают в среднем более 90%
- Провалы сгруппированы так: -- Технические ошибки реализации (~34% меток) -- Забытые требования (~34%) - когда требование из ранней реплики так и не попало в финальный код -- В ~12% симулятор сам не выдал нужное требование, но это скорее всего false positive самого бенчмарка, о чем авторы и говорят в статье.
Есть у исследования и ограничения
- Задач собрано всего 75 (у Meta 109 задач)
- Персона подобрана всего одна (а интересно было бы промоделировать разных пользователей)
- Одноходовый baseline прогнан один раз
- Результат заметно зависит от модели симулятора: с GPT-5.5 в роли пользователя Opus 4.8 решает 30.7%, с Opus 4.7 - 22.7%
- Агенты работали каждый в своей родной обвязке (harness) - Claude Code, Codex CLI, Kimi CLI, а Gemini в сторонней OpenCode, - так что сравнение моделей смешано со сравнением обвязок, в отличие от SWE-Together с единой обвязкой opencode.
- Scale AI - вендор данных и оценки моделей, продвигающий в том числе собственные бенчмарки (два бенча из четырех, из которых набирались задачи, были от Scale AI)
Если подбивать итоги сразу по двум статьям, то у нас есть сигналы с двух ракурсов
- Meta мерила, сколько корректировок пользователя нужно агенту до результата (сильным - меньше)
- Scale мерила, сколько способности теряется, когда требования приходят по частям (даже у сильных - половина)
Практически это означает: 1️⃣ Выбирая модель под реальную работу с людьми, смотрите на multi-turn разрыв, а не только на автономный resolve rate 2️⃣ Из двух главных режимов провала технические ошибки - вопрос к модели, а вот забытые требования лечатся процессом - файл с планом, явный список требований, коммит и ревью на каждую итерацию. Это уже вопрос не бенчмарка, а вашей обвязки.
#AI #AI4SDLC #Engineering #Agents #Evals #Research