Everything I Learned Training Frontier Small Models - Maxime Labonne, Liquid AI (Рубрика AI)
Посмотрел этот короткий доклад Maxime Labonne, Head of Post-Training " Liquid AI, где Максим рассказывает, как Liquid AI проектирует и обучает edge-модели от архитектуры до reinforcement learning. Главная мысль доклада в том, что маленькие модели нельзя воспринимать как уменьшенные версии больших моделей. У них другая физика продукта: они живут на телефонах, ноутбуках, машинах, IoT и embedded-устройствах; они упираются в память, latency и качество конкретных задач, а не в универсальную способность работать в режиме чата.
Основные идеи этого выступления следующие
1️⃣ Маленькая модель должна быть специализированной Большая frontier-модель может быть "средне хорошей во всем": код, текст, рассуждения, поиск, креатив, длинный контекст. Маленькая модель так не работает. У нее мало параметров, мало "памяти" для фактов и меньше пространства для самокоррекции. Поэтому хороший use case для small model - это закрыть узкий повторяемый workflow: extraction, structured outputs, function calling, tool use, приватная обработка пользовательских данных на устройстве. Liquid AI в посте про LFM2.5-350M прямо пишет про границы ее применимости.
2️⃣ Параметры могут быть потрачены не туда В слайдах Максим показывает, что у некоторых маленьких моделей embedding layer может занимать огромную долю параметров: например, 63% у Gemma 3 270M и 29% у Qwen3.5-0.8B. Для маленькой модели это очень дорого: формально параметров много, но "полезная емкость" модели оказывается сильно меньше. В LFM2.5-350M у Liquid AI embedding layer занимает 19% параметров, а effective size указан как 287M и это напрямую влияяет на latency, память и качество.
3️⃣ Считать FLOPs недостаточно - надо профилировать на целевом железе В докладе важный акцент сделан на on-device profiling. Liquid AI проектирует архитектуру не в вакууме, а смотрит, какие операции реально быстрые на целевых устройствах вроде Galaxy S24 Ultra и Ryzen HX 370. В общем, если вы строите AI-фичу под мобильное устройство, браузер, ноутбук или embedded, нельзя выбирать модель только по leaderboard. Надо мерить prefill, decode, memory footprint, quantization impact, cold start, battery и стабильность tool-calling именно на вашем runtime.
4️⃣ Больше pre-training может работать даже на маленьком масштабе Интуитивно кажется, что 350M-модель быстро "насытится" данными (про это даже есть Chinchilla scale of law). Но Liquid AI показывает обратную сторону: LFM2.5-350M получила дополнительный pre-training с 10T до 28T токенов и large-scale reinforcement learning. В официальном посте Liquid AI говорится, что модель превосходит более чем вдвое большие модели на ряде бенчей по знаниям, следованию инструкциям и использованию инструментов.
5️⃣ Doom looping - отдельный failure mode маленьких reasoning-моделей Очень интересная часть - про doom looping: когда модель застревает в повторении текста вместо того, чтобы дойти до ответа. Это особенно неприятно для маленьких reasoning-моделей и agentic-сценариев: пользователь ждет ответ, tool call или действие, а модель начинает повторять куски рассуждения. Liquid AI описывает свой способ борьбы с этим, что снизил doom loop с 15.74% до 0.36%. В итоге, оценивать надо не только accuracy, но и "поведенческие" ошибки типа зацикливания, пустых ответов и так далее.
6️⃣ Маленькие модели особенно интересны в agentic-системах Будущее не обязательно выглядит как “одна огромная модель отвечает на все”. Более реалистичная архитектура - router + набор специализированных моделей + инструменты + evals + fallback на большую модель. Большая модель может планировать, рассуждать, разбирать сложные случаи. Маленькая локальная модель может быстро и дешево исполнять планы.
#AI #LLM #SmallModels #EdgeAI #Architecture #Engineering #ML #Agents #DevEx #Management