К основному содержимому
#AI4SDLC

Philipp Schmid про agent skills: сначала eval, потом публикация (Рубрика AI4SDLC)

#AI4SDLC #AI #Agents #Evals #Engineering

Посмотрел короткое выступление Philipp Schmid из Google DeepMind «Don't Ship Skills Without Evals» . Главный тезис простой: skill меняет поведение агента, поэтому выпускать его без проверки - примерно как менять код без тестов.

Schmid предлагает проверять не то, прочитал ли агент SKILL.md, а итог работы. Для этого каждому skill нужен небольшой набор задач: где он должен подключиться, где не должен и какой результат считается правильным. Сначала хватит обычных проверок через скрипты и регулярные выражения; LLM-as-a-judge нужен только там, где результат нельзя проверить детерминированно.

Вот как примерно выглядит алгоритм автора, который можно забрать себе

  1. Выбрать один часто используемый skill.
  2. Написать пять тестовых запросов: позитивные, негативные и один реальный проблемный кейс.
  3. Для каждого задать проверяемый результат, а не обязательную последовательность действий агента.
  4. Несколько раз прогнать задачи со skill и без него в изолированном окружении.
  5. Удалить no-op инструкции. Если skill не улучшает результат — удалить и его, а eval оставить для регрессии.

Дальше этот набор стоит расширить до 10–20 кейсов и запускать при каждом изменении skill и обновлении модели.

Итого, SKILL.md - это не документация «на всякий случай», а часть агентной системы. Его ценность определяется не объемом инструкций, а измеримым изменением результата.

#AI #AI4SDLC #Agents #Evals #Engineering