
SWE-Together × SWE-INTERACT
Два способа измерить реальную работу coding agents с человеком

Два способа измерить реальную работу coding agents с человеком
Два способа измерить реальную работу coding agents с человеком
Single-turn
Полная постановка сразу
Финальный code score
Steering не измеряется
Multi-turn
Требования по частям
Ревью и коррекции
Цена диалога измерима
SWE-Together · Meta*
Bottom-up: реальные сессии
Сколько steering требуется?
109 задач · frozen rubric
SWE-INTERACT · Scale AI
Top-down: готовые задачи
Что теряется в диалоге?
75 задач · original verifier
Схема SWE-Together: три стадии преобразования реальной сессии в воспроизводимую benchmark-задачу
Raghavendra et al. · SWE-Together · Figure 2 · PDF с. 3 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано
Три контекста
Intent anchors сессии
Последний ход агента
Память симулятора
Одно действие
Промолчать · спросить
Перенаправить · добавить требование
Проверить внешний артефакт
Схема контекста SWE-Together user simulator: anchors, текущий ход, память и структурированное действие
Raghavendra et al. · SWE-Together · Figure 4 · PDF с. 5 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано
Графики SWE-Together: обратная связь между capability моделей и User Correction
Raghavendra et al. · SWE-Together · Figure 6 · PDF с. 9 · arXiv:2606.29957v1 · CC BY 4.0 · кадрировано
109 из 11 260 · 0,97%
LLM-симулятор + LLM-судья
Два прогона на задачу
Только текст, без прерываний
Схема SWE-INTERACT: переход от автономной задачи к интерактивному workflow с постепенным раскрытием требований
Wu et al. · SWE-INTERACT · Figure 1 · PDF с. 2 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано
Архитектура SWE-INTERACT: отдельные контейнеры агента и user simulator с shell-доступом к workspace
Wu et al. · SWE-INTERACT · Figure 2 · PDF с. 4 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано
Таблица SWE-INTERACT со сравнением single-turn и multi-turn по resolve rate, шагам, токенам и стоимости
Wu et al. · SWE-INTERACT · Table 1 · PDF с. 5 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано
Диаграмма SWE-INTERACT с распределением пяти failure modes и их определениями
Wu et al. · SWE-INTERACT · Figure 5 · PDF с. 8 · arXiv:2606.30573v1 · CC BY 4.0 · кадрировано
SWE-Together
109 real sessions · opencode
Text replay · frozen rubric
U-Corr · natural, selective
SWE-INTERACT
75 benchmark tasks · native harness
Shell user · original verifier
Gap · controlled, persona-bound
Success / verifier reward
User Correction
Single-turn → multi-turn gap
Requirement ledger
Commit + review каждой итерации
Рекомендация, не отчёт о внутреннем эксперименте
Open-ended ambiguity
Другие user personas
Production toolchains
Чистое model-only сравнение
Книжный куб
Ссылки на papers и новые инженерные разборы — в канале
Александр Поломодов, Technical Director & Fellow, Т-Технологии
@Book_Cube