Данные определяют границы модели
Качество foundation model начинается с корпуса. Английский доминирует в веб-данных, поэтому на менее представленных языках модель обычно отвечает хуже, а токенизация может сделать тот же запрос дороже. Перевод запроса на английский помогает не всегда: смысл и культурный контекст теряются, а слабые данные ухудшают и сам перевод. Аналогичное ограничение действует по доменам. Общедоступные темы модель усваивает из интернета, но медицинские изображения, внутренние документы и другие закрытые данные требуют специализированного набора, fine-tuning или контекста во время запроса.
Мультимодальность добавляет ещё один практический выбор представления. В приведённом примере классификация сайта по скриншоту оказалась точнее анализа извлечённого текста, хотя работала та же модель. Поэтому для реального сценария стоит сравнивать текст, изображение и их комбинацию, а не считать текст естественно лучшим входом. Одновременно синтетические данные становятся способом расширять дефицитный корпус, но создают риск замкнутого цикла: если машинный контент без контроля возвращается в обучение, объём растёт быстрее качества и модель может постепенно деградировать.
От sequence-to-sequence к post-training
Рекуррентные sequence-to-sequence-модели последовательно сжимали вход в скрытое состояние и так же последовательно строили выход, теряя детали и ограничивая параллелизм. Transformer обрабатывает токены параллельно, а attention назначает контексту разные веса через query, key и value. Внутри блока к механизму внимания добавляется feed-forward MLP; глубина, размер скрытого представления, словарь и контекстное окно задают возможности и стоимость модели. Альтернативным архитектурам трудно конкурировать не только по идее, но и с годами оптимизации трансформеров, библиотек и железа.
Масштаб модели нужно согласовывать с объёмом обучения и доступными вычислениями: больше параметров без достаточного числа токенов не гарантирует лучший результат, а размер напрямую влияет на память и стоимость инференса. Но pre-training учит прежде всего продолжать текст. Supervised fine-tuning превращает это умение в ответы на инструкции, а обучение на человеческих предпочтениях настраивает полезность и приемлемое поведение. Такие данные дороги и зависят от компетенции и культуры разметчиков; сравнить два ответа обычно проще, чем написать идеальный, поэтому ранжирование становится важным источником обратной связи.
Sampling управляет вариативностью, но не истиной
На выходе модель имеет logits для словаря и превращает их в распределение вероятностей. Temperature сглаживает или заостряет его: низкое значение повышает повторяемость, высокое — разнообразие. Top-k ограничивает выбор фиксированным числом кандидатов, а top-p набирает динамический набор токенов до заданной суммарной вероятности, лучше приспосабливаясь к простым и открытым вопросам. Можно потратить больше вычислений, сгенерировать несколько ответов и выбрать лучший; смысл этого приёма зависит от устойчивости модели и наличия надёжного оценщика.
Ограниченное декодирование помогает получать допустимую структуру, но формат тоже влияет на надёжность: в практическом примере переход от JSON к YAML уменьшил обрывы длинного ответа. Ни эта техника, ни низкая temperature не устраняют галлюцинации. Ошибочное первое предположение может вызвать последовательность убедительных, но неверных выводов, а preference tuning иногда делает ответ более привлекательным ценой фактической точности. Поэтому параметры генерации выбирают по цене ошибки: творческому сценарию полезна вариативность, медицинскому, финансовому или юридическому нужны ограничения, проверка и человеческая ответственность.
Что стоит унести с собой
- 01Языковое и доменное покрытие обучающих данных определяет не только качество ответа, но также стоимость токенов и предел возможного приложения.
- 02Transformer сочетает параллельную обработку с attention, однако его практическое преимущество поддерживается всей оптимизированной экосистемой железа и программных библиотек.
- 03Post-training делает продолжатель текста полезным ассистентом, но переносит в модель предпочтения, ограничения и ошибки разметчиков.
- 04Temperature и стратегии sampling управляют разнообразием и стоимостью генерации, но фактическую надёжность обеспечивают только контекст, evals и проверки.
Источники
- Локальный снимок русских автоматических субтитров YouTube
- Запись выпуска на YouTube