
Как строить работающие evals
Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health

Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health
Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health
Верный результат, опасный путь
Опасный diff проходит тесты
Будущее решение утекло в контекст
Повтор меняет траекторию
Верный SQL, неверный grain
Модель — только один элемент агентного контура
что — Outcome — Реальный результат задачи
как — Trace — Инструменты и действия
сколько — Operations — Цена и стабильность
Заморозить работу, ограничения, проверку и критерий релиза
Start state → contract → hidden judge → trace → release gate
Иначе сравниваются разные среды и разные полномочия
Frozen start state
Один коммит или снимок состояния
Одинаковые данные и сервисы
Будущее решение скрыто
Agent contract
Разрешённые tools и сеть
Read, write, approve
Попытки, время, бюджет
Текстовая убедительность не является доказательством
Код: hidden tests и policies
Workflow: tool calls и arguments
Данные: state и инварианты
Review: findings превращаются в checks
Верный итог не оправдывает вред
Выбран правильный инструмент
Аргументы соответствуют контракту
Нет опасных побочных действий
Нет лишних циклов и retries
Серия запусков важнее лучшего прогона
k runs — Pass^k — Успех в серии
σ — Variance — Разброс траекторий
₽ / task — Budget — Цена устойчивого успеха
Регрессия требует holdout, реальность — свежих задач
Static holdout
Неизменный regression gate
Сравнение версий агента
Закрытые решения
Rolling live set
Свежие PR и incidents
Новые data-запросы
Меняющаяся рабочая среда
От бизнес-брифа до инцидента и архитектурного решения
Requirements → code → review → tests → operations
PRD должен выдержать реализацию
Traceability от брифа к AC
Полнота функциональных требований
NFR и ограничения сохранены
Галлюцинации не попали в scope
Одинаковый pass rate скрывает разные типы риска
Feature coding
Spec + pre-PR commit
Hidden integration tests
Полный suite и policy
Bug fixing
Тикет и проблемный коммит
Тест падает до исправления, проходит после
Соседние сценарии целы
Комментарии и coverage сами по себе ничего не гарантируют
Code review
Severity-weighted recall
False positives ограничены
Finding принят или исполнен
Test generation
Fail before, pass after
Branch и mutation coverage
Стабильность без flakiness
Один вопрос «что случилось?» не является eval
Alert, topology и telemetry
Runbooks и допустимые действия
Triage, RCA, mitigation
Безопасный handoff человеку
Архитектура и data platform не имеют одного gold answer
Hard constraints → completeness → downstream executability
Аналитический ответ и pipeline требуют разных доказательств
Outcome, trace, operations, safety и human acceptance
Веса меняются по доменам, safety остаётся gate
Опасное действие останавливает выпуск
Safety stop
Лишние права и PII
Опасный write или remediation
Нет rollback path
Human acceptance
PR действительно принят
RCA помог on-call
Решение пригодно команде
Scenario family × input × judge × metrics × gate
Input bundle восстанавливает работу
Hidden judge доказывает outcome
Scorecard объясняет поведение
Release gate принимает решение
Артефакт → frozen state → contract → judge → release gate
Что забрать в свою инженерную систему
Оценивайте replayable episodes
Проверяйте outcome и trace
Повторяйте прогоны
Держите safety стоп-критерием
Обновляйте rolling live set
Модели меняются. Собственный каталог эпизодов остаётся.
Код, инструменты, SRE, архитектура и data platform
SWE-bench · FEA-Bench · τ-bench
SWE-PRBench · TestExplora · AIOpsLab
R2ABench · ArchBench · DAB · BLADE
ELT-Bench · DataGovBench · coSTAR
Production-grade agent evals
Полный лонгрид, источники и следующие разборы — на polomodov.tech и в «Книжном кубе»
Александр Поломодов, Technical Director & Fellow, Т-Технологии
@book_cube