Philipp Schmid про agent skills: сначала eval, потом публикация (Рубрика AI4SDLC)
Посмотрел короткое выступление Philipp Schmid из Google DeepMind «Don't Ship Skills Without Evals» . Главный тезис простой: skill меняет поведение агента, поэтому выпускать его без проверки - примерно как менять код без тестов.
Schmid предлагает проверять не то, прочитал ли агент SKILL.md, а итог работы. Для этого каждому skill нужен небольшой набор задач: где он должен подключиться, где не должен и какой результат считается правильным. Сначала хватит обычных проверок через скрипты и регулярные выражения; LLM-as-a-judge нужен только там, где результат нельзя проверить детерминированно.
Вот как примерно выглядит алгоритм автора, который можно забрать себе
- Выбрать один часто используемый skill.
- Написать пять тестовых запросов: позитивные, негативные и один реальный проблемный кейс.
- Для каждого задать проверяемый результат, а не обязательную последовательность действий агента.
- Несколько раз прогнать задачи со skill и без него в изолированном окружении.
- Удалить no-op инструкции. Если skill не улучшает результат — удалить и его, а eval оставить для регрессии.
Дальше этот набор стоит расширить до 10–20 кейсов и запускать при каждом изменении skill и обновлении модели.
Итого, SKILL.md - это не документация «на всякий случай», а часть агентной системы. Его ценность определяется не объемом инструкций, а измеримым изменением результата.
#AI #AI4SDLC #Agents #Evals #Engineering