Review of AI Engineering · выпуск 03
Методология оценки и оценка AI-систем
1:54:48
Ведущие выпуска
Что обсудили
Третий выпуск объединяет главы об evaluation methodology и практической оценке AI-систем.
Обсуждаем ограничения бенчмарков, энтропию, cross-entropy, KL divergence, perplexity, семантическую близость и функциональную корректность.
Затем собираем процесс валидации: AI as a judge, попарные сравнения, фактчекинг, доверенные источники, разметка и человеческий baseline.
EvaluationМетрики моделейAI as a judgeВалидация