К основному содержимому
все выпуски
Research Insights Made Simple · выпуск 26

Разбираем построение работающих evals с Евгением Сергеевым

59:44
TelegramLinkedIn
Содержание

Что обсудили голосом

Александр Поломодов и Евгений Сергеев обсуждают переход от удачного ответа к системе качества. Чем автономнее агент и менее экспертен пользователь, тем важнее evals: плохой совет или опасное изменение могут пройти незамеченными. В health-продукте ответ должен быть полезным, юридически корректным и заслуживать доверия.

Единица проверки — воспроизводимый эпизод, не реплика или бренд модели. Он фиксирует start state, вход, полномочия, бюджет, скрытого судью, trace и критерий допуска. Outcome показывает успех, trace объясняет путь и нарушения, метрики добавляют стоимость, latency и variance повторов.

Сигнал дают детерминированный код, откалиброванный LLM-as-a-judge, эксперты и production feedback. Offline-контур сравнивает model, prompt, context и tools на фиксированном наборе, production возвращает новые edge cases в dataset. Для первого набора часто хватает доверенного эксперта и менее ста случаев.

Зрелость идёт от ручной проверки к labeled pass/fail, shadow mode, release gates и flywheel на production-трейсах. Контур нужен постоянно: новая модель может сломать критичный сценарий, provider — снять версию, старый skill — мешать. Собственный каталог эпизодов позволяет воспроизводить пути и безопасно менять обвязку; красивое demo — нет.

AI в SDLCDeveloper productivityМетодология исследований