К основному содержимому
к выпуску
краткая расшифровка выпуска2025Fellow

Как устроены фундаментальные модели

Второй выпуск разбирает самую техническую главу книги: от состава обучающих данных до выбора следующего токена. Александр Поломодов и Евгений Сергеев объясняют, почему язык и домен меняют качество, как attention вытеснил последовательные архитектуры, зачем pre-trained модели проходят post-training и как temperature, top-k, top-p и несколько генераций превращаются в продуктовые рычаги.

Review of AI Engineering · выпуск 26 минут

Конспект подготовлен по полной YouTube-записи и локальному снимку русских автоматических субтитров, покрывающих видео до 1:55:37. Субтитры не различают говорящих и искажают имена, формулы и англоязычные технические термины; спорные числовые детали опущены. Это сокращённый редакционный пересказ, а не дословная стенограмма.

Основная линия материала
01

Данные определяют границы модели

Качество foundation model начинается с корпуса. Английский доминирует в веб-данных, поэтому на менее представленных языках модель обычно отвечает хуже, а токенизация может сделать тот же запрос дороже. Перевод запроса на английский помогает не всегда: смысл и культурный контекст теряются, а слабые данные ухудшают и сам перевод. Аналогичное ограничение действует по доменам. Общедоступные темы модель усваивает из интернета, но медицинские изображения, внутренние документы и другие закрытые данные требуют специализированного набора, fine-tuning или контекста во время запроса.

Мультимодальность добавляет ещё один практический выбор представления. В приведённом примере классификация сайта по скриншоту оказалась точнее анализа извлечённого текста, хотя работала та же модель. Поэтому для реального сценария стоит сравнивать текст, изображение и их комбинацию, а не считать текст естественно лучшим входом. Одновременно синтетические данные становятся способом расширять дефицитный корпус, но создают риск замкнутого цикла: если машинный контент без контроля возвращается в обучение, объём растёт быстрее качества и модель может постепенно деградировать.

02

От sequence-to-sequence к post-training

Рекуррентные sequence-to-sequence-модели последовательно сжимали вход в скрытое состояние и так же последовательно строили выход, теряя детали и ограничивая параллелизм. Transformer обрабатывает токены параллельно, а attention назначает контексту разные веса через query, key и value. Внутри блока к механизму внимания добавляется feed-forward MLP; глубина, размер скрытого представления, словарь и контекстное окно задают возможности и стоимость модели. Альтернативным архитектурам трудно конкурировать не только по идее, но и с годами оптимизации трансформеров, библиотек и железа.

Масштаб модели нужно согласовывать с объёмом обучения и доступными вычислениями: больше параметров без достаточного числа токенов не гарантирует лучший результат, а размер напрямую влияет на память и стоимость инференса. Но pre-training учит прежде всего продолжать текст. Supervised fine-tuning превращает это умение в ответы на инструкции, а обучение на человеческих предпочтениях настраивает полезность и приемлемое поведение. Такие данные дороги и зависят от компетенции и культуры разметчиков; сравнить два ответа обычно проще, чем написать идеальный, поэтому ранжирование становится важным источником обратной связи.

03

Sampling управляет вариативностью, но не истиной

На выходе модель имеет logits для словаря и превращает их в распределение вероятностей. Temperature сглаживает или заостряет его: низкое значение повышает повторяемость, высокое — разнообразие. Top-k ограничивает выбор фиксированным числом кандидатов, а top-p набирает динамический набор токенов до заданной суммарной вероятности, лучше приспосабливаясь к простым и открытым вопросам. Можно потратить больше вычислений, сгенерировать несколько ответов и выбрать лучший; смысл этого приёма зависит от устойчивости модели и наличия надёжного оценщика.

Ограниченное декодирование помогает получать допустимую структуру, но формат тоже влияет на надёжность: в практическом примере переход от JSON к YAML уменьшил обрывы длинного ответа. Ни эта техника, ни низкая temperature не устраняют галлюцинации. Ошибочное первое предположение может вызвать последовательность убедительных, но неверных выводов, а preference tuning иногда делает ответ более привлекательным ценой фактической точности. Поэтому параметры генерации выбирают по цене ошибки: творческому сценарию полезна вариативность, медицинскому, финансовому или юридическому нужны ограничения, проверка и человеческая ответственность.

Выводы

Что стоит унести с собой

  1. 01Языковое и доменное покрытие обучающих данных определяет не только качество ответа, но также стоимость токенов и предел возможного приложения.
  2. 02Transformer сочетает параллельную обработку с attention, однако его практическое преимущество поддерживается всей оптимизированной экосистемой железа и программных библиотек.
  3. 03Post-training делает продолжатель текста полезным ассистентом, но переносит в модель предпочтения, ограничения и ошибки разметчиков.
  4. 04Temperature и стратегии sampling управляют разнообразием и стоимостью генерации, но фактическую надёжность обеспечивают только контекст, evals и проверки.

Источники

Поделиться
TelegramLinkedIn