К основному содержимому
#AI

7 Habits of Highly Effective Generative AI Evaluations (Рубрика AI)

#AI

Посмотрел на выходных интересное выступление про evaluations от Джастина Мюллера, Principal Applied AI Architect в Amazon Web Services (AWS). Команда Мюллера в AWS помогает клиентам масштабировать рабочие нагрузки с генеративным ИИ, и за время работы он имел возможность изучить более 100 различных попыток создания фреймворков оценки работы моделей. Это выступление прошло недавно в рамках конференции AI Engineer World's Fair. Ключевой идеей выступление было то, что основная проблема при масштабировани genAI решений в недостаточности оценок (evaluations) качества их работы. Несмотря на то, что многие называют основными проблемами стоимость, галлюцинации, точность и производительность, именно отсутствие подходящих evaluation фреймворков чаще всего препятствует успешному внедрению. Для демонстрации этой идеи Джастин рассказал реальный кейс клиента с проектом обработки документов, где точность составляла всего 22%. После внедрения системы оценки за 6 месяцев удалось достичь 92% точности и запустить проект в массовое производство, сделав его крупнейшим на тот момент по обработке документов на AWS в Северной Америке. Для решения этой проблемы с эффективной оценкой моделей автор предлагает следующие семь привычек ~~высокоэффективных людей~~ высокоэффективных genAI evaluations:

1. Скорость выполения (Fast)

  • Целевое время выполнения оценки — 30 секунд
  • Возможность делать сотни изменений и тестов ежедневно вместо 4-8 в месяц 2. Количественно измеримый (Quantifiable)
  • Оценка должна выражаться в конкретных числовых показателях
  • Стоит применять усреднение по множественным тест-кейсам для устранения случайных колебаний 3. Объяснимость (Explainable)
  • Анализ не только результатов, но и процесса рассуждений модели
  • Важность понимания логики как генерирующей модели, так и оценивающей модели 4. Сегментированность (Segmented)
  • Разбиение сложных промптов на последовательность простых шагов
  • Возможность оценки каждого этапа отдельно и выбора подходящей модели для каждой задачи 5. Разнообразие (Diverse)
  • Покрытие всех сценариев использования
  • Эмпирическое правило: ~100 тестовых примеров для основных случаев использования 6. Традиционность (Traditional)
  • Сохранение использования проверенных методов оценки (из ML)
  • Численные оценки, метрики точности баз данных, измерение стоимости и задержки остаются актуальными 7. Золотые стандарты
  • Критическая важность создания качественного набора золотых стандартов
  • Избегание использования генеративного ИИ для создания золотых стандартов во избежание воспроизведения ошибок

Ключевыми принципами от Джастина являются следующие - Декомпозиция промптов — разбиение сложных многошаговых промптов на цепочку простых, что позволяет точно определить источник ошибок и оптимизировать каждый этап отдельно. - Семантическая маршрутизация — интеллектуальное направление запросов к подходящим моделям в зависимости от сложности задачи, что повышает точность и снижает затраты. - Фокус на выявлении проблем — главная цель оценок не просто измерение качества, а обнаружение конкретных проблем и предложение путей их решения.

В общем, выступления Мюллера - это сборник практических советов о том, как стоит организовывать свой фреймворк оценки GenAI моделей. Эти советы звучат логично, выглядят доступно, а также проверены на опыте работы с крупнейшими рабочими нагрузками в Северной Америке.