К основному содержимому
Логотип Research Insights Made Simple
Подкаст · 31 июля 2026Research Insights Made Simple #26

Как строить работающие evals

Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health

/ Research Insights Made Simple #26 · Работающие evals

Содержание слайдов

  1. 1. Как строить работающие evals

    Воспроизводимые эпизоды, скрытые judges и production scorecard. Вместе с Евгением Сергеевым, Engineering Director в Flo Health

  2. 2. Pass rate не гарантирует качество

    Верный результат, опасный путь

    Опасный diff проходит тесты

    Будущее решение утекло в контекст

    Повтор меняет траекторию

    Верный SQL, неверный grain

  3. 3. Оценивайте систему, а не модель

    Модель — только один элемент агентного контура

    что — Outcome — Реальный результат задачи

    как — Trace — Инструменты и действия

    сколько — Operations — Цена и стабильность

  4. 4. 01. Воспроизводимый эпизод

    Заморозить работу, ограничения, проверку и критерий релиза

  5. 5. Эпизод фиксирует весь рабочий контур

    Start state → contract → hidden judge → trace → release gate

  6. 6. Контракт фиксирует границы оценки

    Иначе сравниваются разные среды и разные полномочия

    Frozen start state

    Один коммит или снимок состояния

    Одинаковые данные и сервисы

    Будущее решение скрыто

    Agent contract

    Разрешённые tools и сеть

    Read, write, approve

    Попытки, время, бюджет

  7. 7. Judge должен исполняться

    Текстовая убедительность не является доказательством

    Код: hidden tests и policies

    Workflow: tool calls и arguments

    Данные: state и инварианты

    Review: findings превращаются в checks

  8. 8. Путь — часть результата

    Верный итог не оправдывает вред

    Выбран правильный инструмент

    Аргументы соответствуют контракту

    Нет опасных побочных действий

    Нет лишних циклов и retries

  9. 9. Один успех не означает надёжность

    Серия запусков важнее лучшего прогона

    k runs — Pass^k — Успех в серии

    σ — Variance — Разброс траекторий

    ₽ / task — Budget — Цена устойчивого успеха

  10. 10. Статичный набор быстро устаревает

    Регрессия требует holdout, реальность — свежих задач

    Static holdout

    Неизменный regression gate

    Сравнение версий агента

    Закрытые решения

    Rolling live set

    Свежие PR и incidents

    Новые data-запросы

    Меняющаяся рабочая среда

  11. 11. 02. Семейства сценариев

    От бизнес-брифа до инцидента и архитектурного решения

  12. 12. Judges меняются вместе с задачей

    Requirements → code → review → tests → operations

  13. 13. Следующая работа проверяет требования

    PRD должен выдержать реализацию

    Traceability от брифа к AC

    Полнота функциональных требований

    NFR и ограничения сохранены

    Галлюцинации не попали в scope

  14. 14. Фичам и багам нужны разные oracles

    Одинаковый pass rate скрывает разные типы риска

    Feature coding

    Spec + pre-PR commit

    Hidden integration tests

    Полный suite и policy

    Bug fixing

    Тикет и проблемный коммит

    Тест падает до исправления, проходит после

    Соседние сценарии целы

  15. 15. Проверка должна находить реальные дефекты

    Комментарии и coverage сами по себе ничего не гарантируют

    Code review

    Severity-weighted recall

    False positives ограничены

    Finding принят или исполнен

    Test generation

    Fail before, pass after

    Branch и mutation coverage

    Стабильность без flakiness

  16. 16. Инцидент требует замороженной среды

    Один вопрос «что случилось?» не является eval

    Alert, topology и telemetry

    Runbooks и допустимые действия

    Triage, RCA, mitigation

    Безопасный handoff человеку

  17. 17. 03. Открытые домены

    Архитектура и data platform не имеют одного gold answer

  18. 18. Архитектуре нужен не один gold

    Hard constraints → completeness → downstream executability

  19. 19. Data-агенты решают разные задачи

    Аналитический ответ и pipeline требуют разных доказательств

  20. 20. 04. Production scorecard

    Outcome, trace, operations, safety и human acceptance

  21. 21. Scorecard заменяет один общий балл

    Веса меняются по доменам, safety остаётся gate

  22. 22. Safety — gate, а не штраф

    Опасное действие останавливает выпуск

    Safety stop

    Лишние права и PII

    Опасный write или remediation

    Нет rollback path

    Human acceptance

    PR действительно принят

    RCA помог on-call

    Решение пригодно команде

  23. 23. Один контракт связывает все сценарии

    Scenario family × input × judge × metrics × gate

    Input bundle восстанавливает работу

    Hidden judge доказывает outcome

    Scorecard объясняет поведение

    Release gate принимает решение

  24. 24. Пять ошибок ломают результат

  25. 25. Начните с истории своей работы

    Артефакт → frozen state → contract → judge → release gate

  26. 26. Пять решений для production evals

    Что забрать в свою инженерную систему

    Оценивайте replayable episodes

    Проверяйте outcome и trace

    Повторяйте прогоны

    Держите safety стоп-критерием

    Обновляйте rolling live set

    Модели меняются. Собственный каталог эпизодов остаётся.

  27. 27. Бенчмарки задают разные границы

    Код, инструменты, SRE, архитектура и data platform

    SWE-bench · FEA-Bench · τ-bench

    SWE-PRBench · TestExplora · AIOpsLab

    R2ABench · ArchBench · DAB · BLADE

    ELT-Bench · DataGovBench · coSTAR

  28. 28. Спасибо!

    Production-grade agent evals

    Полный лонгрид, источники и следующие разборы — на polomodov.tech и в «Книжном кубе»

    Александр Поломодов, Technical Director & Fellow, Т-Технологии

    @book_cube