Модели T-lite и T-pro: training report
Интересный отчет от моих коллег о том, как проходили тренировки моделей T-lite и T-pro.
- Зачем адаптировать модели на русский язык - тут ребята объясняют, а зачем всем этим заниматься, если есть зарубежные open source модели
- Стадии обучения языковой модели - здесь кратко идет речь про Parameter Efficient Fine-Tuning, Supervised Fine Tuning, General Post-Training и главное Continual Pretraining, который применяют ребята. Кратко суть подхода в том, чтобы
Дообучать уже сильные открытые модели, тратя на обучение на порядки меньше ресурсов, чем создатели текущих моделей лидеров индустрии.
А затем авторы разбираю каждый этап в деталях и это действительно интересное чтиво для интересующихся современными подходами к созданию LLM. Рекомендую.
#AI #ML #Software #Engineering