К основному содержимому
#AI

Модели T-lite и T-pro: training report

#AI #ML #Software #Engineering

Интересный отчет от моих коллег о том, как проходили тренировки моделей T-lite и T-pro.

  • Зачем адаптировать модели на русский язык - тут ребята объясняют, а зачем всем этим заниматься, если есть зарубежные open source модели
  • Стадии обучения языковой модели - здесь кратко идет речь про Parameter Efficient Fine-Tuning, Supervised Fine Tuning, General Post-Training и главное Continual Pretraining, который применяют ребята. Кратко суть подхода в том, чтобы

Дообучать уже сильные открытые модели, тратя на обучение на порядки меньше ресурсов, чем создатели текущих моделей лидеров индустрии.

А затем авторы разбираю каждый этап в деталях и это действительно интересное чтиво для интересующихся современными подходами к созданию LLM. Рекомендую.

#AI #ML #Software #Engineering