К основному содержимому
все выпуски
Review of AI Engineering · выпуск 02

Как устроены фундаментальные модели

1:55:37
TelegramLinkedIn
Содержание

Что обсудили голосом

Второй выпуск ведёт от данных к поведению foundation model. Представленность языка в корпусе влияет на качество, а доменные знания не всегда входят в универсальную модель. Решения вроде Med-PaLM показывают компромисс широты, точности и цены; мультимодальные модели добавляют к тексту изображения и другие сигналы.

История архитектур проходит от RNN и seq2seq к трансформеру. Ведущие собирают его из embeddings, positional encoding, attention и MLP-блоков, объясняют параметры и контекстное окно. Attention Is All You Need и параллельная обработка последовательности показывают, почему архитектура смогла масштабироваться.

Размер модели ограничивают вычисления, память, время и деньги. После pre-training идут SFT и RLHF: примеры учат следовать инструкциям, а человеческие предпочтения и попарные сравнения формируют reward model. Выравнивание поведения оказывается отдельной инженерной системой, а не малой настройкой весов.

Модель выбирает следующий токен из распределения, поэтому temperature, top-k и top-p меняют повторяемость и разнообразие. Галлюцинации возникали ещё у seq2seq-моделей, но их точная природа до конца не объяснена. Стратегия зависит от цены ошибки: фактам нужны ограничения и проверка, а история или изображение могут выиграть от творческой вариативности.

ТрансформерыОбучение моделейSFT и RLHFГаллюцинации