Оценивать систему, а не отдельную модель
Потребность в evals появляется вместе с ответственностью за результат. Пока эксперт проверяет каждое предложение ассистента, ошибку можно поймать вручную. Автономный агент работает для пользователя, который может не распознать плохой совет, небезопасное изменение или неверный перевод. Особенно заметна цена ошибки в медицинском продукте, где ответ должен одновременно сохранять полезность, юридическую корректность и доверие, а локализация умножает число сочетаний языков и моделей.
Поэтому единицей проверки становится не реплика и не название модели, а воспроизводимый эпизод. Он фиксирует исходное состояние, входные данные, полномочия и бюджет агента, скрытого судью, трейс действий и критерий допуска. Результат показывает, решена ли задача; трейс объясняет путь, лишние вызовы и обход ограничений; эксплуатационные метрики добавляют стоимость, задержку и разброс между повторами. Получается новое поколение тестов для недетерминированной системы.
Четыре источника сигнала и два контура
Евгений выделяет четыре практических типа проверки. Детерминированный код ловит формальные нарушения и вычислимые инварианты. LLM-as-a-judge оценивает то, что трудно выразить формулой, но его reasoning нужно сохранять и калибровать. Предметные эксперты размечают примеры и превращают профессиональное суждение в данные. Production-сигналы — обратная связь, пользовательский путь и технические трейсы — показывают, что происходит после выпуска. Для старта часто достаточно доверенного эксперта и набора меньше ста случаев.
Offline-контур сравнивает версии модели, промпта, контекста и инструментов на фиксированном наборе. Production-контур собирает OpenTelemetry-трейсы, продуктовую аналитику и выборочную ручную разметку, находит новые пограничные случаи и возвращает их в датасет. В Flow Health эту связку удобно строить через MLflow и Databricks, где рядом лежат технический путь агента и пользовательское путешествие. Так промпт признаётся частью бизнес-логики и получает собственный регрессионный цикл.
Зрелость растёт вместе с риском и масштабом
На прототипе допустима проверка на глаз, затем появляется размеченный набор pass/fail и параллельная работа агента с человеком. Следующий уровень встраивает evals в разработку и выпуск, а зрелый продукт замыкает flywheel: production-трейсы обновляют выборку, оценки дают обратную связь, промпты и маршрутизация улучшаются автоматически. Готовые платформы вроде Langfuse, Braintrust и MLflow уже объединяют управление промптами, датасетами, разметкой и наблюдаемостью, поэтому собственную инфраструктуру нужно обосновывать отдельно.
Система остаётся необходимой после удачного запуска. Новая модель может улучшить среднее качество и одновременно ухудшить важный сценарий; поставщик способен вывести используемую версию из эксплуатации; старый skill или инструкция превращаются из поддержки в ограничение. Только собственный каталог эпизодов позволяет безопасно повторить пользовательские пути, сравнить замену и удалить ненужную обвязку. Надежда на бренд модели не заменяет доказательства, а красивое демо не означает близость готового продукта.
Что стоит унести с собой
- 01Evals проверяют модель, промпт, контекст, инструменты, права и среду как одну рабочую систему.
- 02Трасса агента важна не меньше ответа: в ней видны лишние шаги, опасные действия, стоимость и потребность в человеческом управлении.
- 03Начинать можно с небольшого набора, доверенного предметного эксперта и простых детерминированных проверок, расширяя контур по мере риска.
- 04Собственный набор эпизодов делает смену модели, промпта, skill или harness управляемой инженерной миграцией, а не проверкой на глаз.