
Как строить работающие evals
Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health
Содержание слайдов
1. Как строить работающие evals
Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health
2. Pass rate не гарантирует качество
Верный результат, опасный путь
Опасный diff проходит тесты
Будущее решение утекло в контекст
Повтор меняет траекторию
Верный SQL, неверный grain
3. Оценивайте систему, а не модель
Модель — только один элемент агентного контура
что — Outcome — Реальный результат задачи
как — Trace — Инструменты и действия
сколько — Operations — Цена и стабильность
4. 01. Воспроизводимый эпизод
Заморозить работу, ограничения, проверку и критерий релиза
5. Эпизод фиксирует весь рабочий контур
Start state → contract → hidden judge → trace → release gate
6. Контракт фиксирует границы оценки
Иначе сравниваются разные среды и разные полномочия
Frozen start state
Один коммит или снимок состояния
Одинаковые данные и сервисы
Будущее решение скрыто
Agent contract
Разрешённые tools и сеть
Read, write, approve
Попытки, время, бюджет
7. Judge должен исполняться
Текстовая убедительность не является доказательством
Код: hidden tests и policies
Workflow: tool calls и arguments
Данные: state и инварианты
Review: findings превращаются в checks
8. Путь — часть результата
Верный итог не оправдывает вред
Выбран правильный инструмент
Аргументы соответствуют контракту
Нет опасных побочных действий
Нет лишних циклов и retries
9. Один успех не означает надёжность
Серия запусков важнее лучшего прогона
k runs — Pass^k — Успех в серии
σ — Variance — Разброс траекторий
₽ / task — Budget — Цена устойчивого успеха
10. Статичный набор быстро устаревает
Регрессия требует holdout, реальность — свежих задач
Static holdout
Неизменный regression gate
Сравнение версий агента
Закрытые решения
Rolling live set
Свежие PR и incidents
Новые data-запросы
Меняющаяся рабочая среда
11. 02. Семейства сценариев
От бизнес-брифа до инцидента и архитектурного решения
12. Judges меняются вместе с задачей
Requirements → code → review → tests → operations
13. Следующая работа проверяет требования
PRD должен выдержать реализацию
Traceability от брифа к AC
Полнота функциональных требований
NFR и ограничения сохранены
Галлюцинации не попали в scope
14. Фичам и багам нужны разные oracles
Одинаковый pass rate скрывает разные типы риска
Feature coding
Spec + pre-PR commit
Hidden integration tests
Полный suite и policy
Bug fixing
Тикет и проблемный коммит
Тест падает до исправления, проходит после
Соседние сценарии целы
15. Проверка должна находить реальные дефекты
Комментарии и coverage сами по себе ничего не гарантируют
Code review
Severity-weighted recall
False positives ограничены
Finding принят или исполнен
Test generation
Fail before, pass after
Branch и mutation coverage
Стабильность без flakiness
16. Инцидент требует замороженной среды
Один вопрос «что случилось?» не является eval
Alert, topology и telemetry
Runbooks и допустимые действия
Triage, RCA, mitigation
Безопасный handoff человеку
17. 03. Открытые домены
Архитектура и data platform не имеют одного gold answer
18. Архитектуре нужен не один gold
Hard constraints → completeness → downstream executability
19. Data-агенты решают разные задачи
Аналитический ответ и pipeline требуют разных доказательств
20. 04. Production scorecard
Outcome, trace, operations, safety и human acceptance
21. Scorecard заменяет один общий балл
Веса меняются по доменам, safety остаётся gate
22. Safety — gate, а не штраф
Опасное действие останавливает выпуск
Safety stop
Лишние права и PII
Опасный write или remediation
Нет rollback path
Human acceptance
PR действительно принят
RCA помог on-call
Решение пригодно команде
23. Один контракт связывает все сценарии
Scenario family × input × judge × metrics × gate
Input bundle восстанавливает работу
Hidden judge доказывает outcome
Scorecard объясняет поведение
Release gate принимает решение
24. Пять ошибок ломают результат
25. Начните с истории своей работы
Артефакт → frozen state → contract → judge → release gate
26. Пять решений для production evals
Что забрать в свою инженерную систему
Оценивайте replayable episodes
Проверяйте outcome и trace
Повторяйте прогоны
Держите safety стоп-критерием
Обновляйте rolling live set
Модели меняются. Собственный каталог эпизодов остаётся.
27. Бенчмарки задают разные границы
Код, инструменты, SRE, архитектура и data platform
SWE-bench · FEA-Bench · τ-bench
SWE-PRBench · TestExplora · AIOpsLab
R2ABench · ArchBench · DAB · BLADE
ELT-Bench · DataGovBench · coSTAR
28. Спасибо!
Production-grade agent evals
Полный лонгрид, источники и следующие разборы — на polomodov.tech и в «Книжном кубе»
Александр Поломодов, Technical Director & Fellow, Т-Технологии
@book_cube