Воспроизводимый эпизод
- Один коммит или снимок
- Те же данные и сервисы
- Будущее решение скрыто
- Разрешённые инструменты и сеть
- Чтение, запись, согласование
- Попытки, время, бюджет
- Код: скрытые тесты и политики
- Процесс: вызовы и аргументы
- Данные: состояние и инварианты
- Выбран правильный инструмент
- Аргументы соответствуют контракту
- Нет опасных побочных действий
- Принято или нет
- По доказательству, а не убедительности
- Одна планка для всех версий
- Static holdout — гейт регрессии
- Rolling live set — свежие задачи
Минимальная единица оценки агента — не вопрос из бенчмарка, а воспроизводимый эпизод: маленькая копия реальной работы. Для кода исходное состояние — коммит до пул-реквеста, для инцидента — система в момент T0, для данных — снимок данных, каталога и происхождения.
Эпизод собирается из пяти звеньев: замороженное исходное состояние, контракт агента, скрытая проверка, разбор траектории и критерий выпуска. Без контракта сравниваются не агенты, а случайные наборы привилегий и контекста, а верный финал не оправдывает опасный путь.
Два правила достраивают модель до рабочей. Надёжность измеряется серией запусков: pass^k, разброс траекторий и цена устойчивого успеха вместо одного удачного прогона. Свежесть держится на двух наборах — неизменном holdout для регрессии и обновляемом наборе живых задач. Практический старт — каталог из 30–50 эпизодов собственной истории.
Возьмите завершённую работу из своей истории и заморозьте исходное состояние так, чтобы будущее решение было скрыто.
Опишите контракт агента: доступные инструменты и сеть, права на чтение и запись, лимиты попыток, времени и бюджета.
Сделайте проверку исполняемой, засчитывайте траекторию наравне с результатом и запускайте серию, а не один прогон.