Как устроены фундаментальные модели
Что обсудили голосом
Второй выпуск ведёт от данных к поведению foundation model. Представленность языка в корпусе влияет на качество, а доменные знания не всегда входят в универсальную модель. Решения вроде Med-PaLM показывают компромисс широты, точности и цены; мультимодальные модели добавляют к тексту изображения и другие сигналы.
История архитектур проходит от RNN и seq2seq к трансформеру. Ведущие собирают его из embeddings, positional encoding, attention и MLP-блоков, объясняют параметры и контекстное окно. Attention Is All You Need и параллельная обработка последовательности показывают, почему архитектура смогла масштабироваться.
Размер модели ограничивают вычисления, память, время и деньги. После pre-training идут SFT и RLHF: примеры учат следовать инструкциям, а человеческие предпочтения и попарные сравнения формируют reward model. Выравнивание поведения оказывается отдельной инженерной системой, а не малой настройкой весов.
Модель выбирает следующий токен из распределения, поэтому temperature, top-k и top-p меняют повторяемость и разнообразие. Галлюцинации возникали ещё у seq2seq-моделей, но их точная природа до конца не объяснена. Стратегия зависит от цены ошибки: фактам нужны ограничения и проверка, а история или изображение могут выиграть от творческой вариативности.