К основному содержимому
Логотип Research Insights Made Simple
Запись · 17 июля 2026#AI4SDLC · Multi-turn evals

SWE-Together × SWE-INTERACT

Два способа измерить реальную работу coding agents с человеком

/ Research Insights Made Simple #21 · Multi-turn evals

Содержание слайдов

  1. 1. SWE-Together × SWE-INTERACT

    Два способа измерить реальную работу coding agents с человеком

  2. 2. Одноходовый benchmark скрывает цену диалога

    Single-turn

    Полная постановка сразу

    Финальный code score

    Steering не измеряется

    Multi-turn

    Требования по частям

    Ревью и коррекции

    Цена диалога измерима

  3. 3. Один день, два исследовательских вопроса

    SWE-Together · Meta*

    Bottom-up: реальные сессии

    Сколько steering требуется?

    109 задач · frozen rubric

    SWE-INTERACT · Scale AI

    Top-down: готовые задачи

    Что теряется в диалоге?

    75 задач · original verifier

  4. 4. 109 задач остаются после жёсткого отбора

  5. 5. Из сессии получается воспроизводимая задача

    Схема SWE-Together: три стадии преобразования реальной сессии в воспроизводимую benchmark-задачу

    Raghavendra et al. · SWE-Together · Figure 2 · PDF с. 3 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано

  6. 6. Симулятор реагирует на живую траекторию

    Три контекста

    Intent anchors сессии

    Последний ход агента

    Память симулятора

    Одно действие

    Промолчать · спросить

    Перенаправить · добавить требование

    Проверить внешний артефакт

  7. 7. Каждый ответ опирается на три контекста

    Схема контекста SWE-Together user simulator: anchors, текущий ход, память и структурированное действие

    Raghavendra et al. · SWE-Together · Figure 4 · PDF с. 5 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано

  8. 8. Успех и steering — разные оси

  9. 9. Сильным моделям нужно меньше поправок

    Графики SWE-Together: обратная связь между capability моделей и User Correction

    Raghavendra et al. · SWE-Together · Figure 6 · PDF с. 9 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано

  10. 10. Реализм куплен жёстким отбором

    109 из 11 260 · 0,97%

    LLM-симулятор + LLM-судья

    Два прогона на задачу

    Только текст, без прерываний

  11. 11. 75 задач превращаются в диалог

  12. 12. Меняется подача, verifier остаётся прежним

    Схема SWE-INTERACT: переход от автономной задачи к интерактивному workflow с постепенным раскрытием требований

    Wu et al. · SWE-INTERACT · Figure 1 · PDF с. 2 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано

  13. 13. Expert Nitpicker может проверить workspace

  14. 14. Shell привязывает feedback к реальному workspace

    Архитектура SWE-INTERACT: отдельные контейнеры агента и user simulator с shell-доступом к workspace

    Wu et al. · SWE-INTERACT · Figure 2 · PDF с. 4 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано

  15. 15. Диалог почти вдвое снижает resolve rate

  16. 16. Интерактивность дороже по всем ресурсам

    Таблица SWE-INTERACT со сравнением single-turn и multi-turn по resolve rate, шагам, токенам и стоимости

    Wu et al. · SWE-INTERACT · Table 1 · PDF с. 5 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано

  17. 17. 68% меток — ошибки реализации и забытые требования

  18. 18. Раскрытое требование может исчезнуть к финалу

    Диаграмма SWE-INTERACT с распределением пяти failure modes и их определениями

    Wu et al. · SWE-INTERACT · Figure 5 · PDF с. 8 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано

  19. 19. Один сигнал получен двумя методами

    SWE-Together

    109 real sessions · opencode

    Text replay · frozen rubric

    U-Corr · natural, selective

    SWE-INTERACT

    75 benchmark tasks · native harness

    Shell user · original verifier

    Gap · controlled, persona-bound

  20. 20. Eval должен считать результат и steering

    Success / verifier reward

    User Correction

    Single-turn → multi-turn gap

    Requirement ledger

    Commit + review каждой итерации

    Рекомендация, не отчёт о внутреннем эксперименте

  21. 21. Выводы пока не покрывают весь production

    Open-ended ambiguity

    Другие user personas

    Production toolchains

    Чистое model-only сравнение

  22. 22. Multi-turn — отдельная ось способности

    Книжный куб

    Ссылки на papers и новые инженерные разборы — в канале

    Александр Поломодов, Technical Director & Fellow, Т-Технологии

    @Book_Cube