Trends Across the AI Frontier (Рубрика AI)
Посмотрел недавно короткое выступление George Cameron, соучредителя и CPO компании Artificial Analysis, независимой компании по бенчмаркингу ИИ, основанной в октябре 2023 года. Ребята специализируются на независимом тестировании более 150 различных моделей ИИ по широкому спектру метрик, включая интеллект, производительность, стоимость и скорость, публикуя результаты на сайте artificialanalysis.ai. Сам доклад был коротким, но насыщенным аналитикой и прогнозами, а ключевые идеи представлены ниже
1. Множественность границ в ИИ Георг подчеркивает центральную идею своего выступления: в ИИ существует не одна, а несколько границ (frontiers), и разработчики не всегда должны использовать самую интеллектуальную модель. Доклад исследует четыре ключевые границы:
- Модели рассуждения (Reasoning Models)
- Открытые веса (Open Weights)
- Стоимость (Cost)
- Скорость (Speed)
2. Граница моделей рассуждения: компромиссы производительности Георг показывает аналитику с резличиями на порядок между обычными и reasoning-моделями:
- Вербальность моделей -- GPT-4.1: 7 миллионов токенов для запуска индекса интеллекта -- O4 Mini High: 72 миллиона токенов (в 10 раз больше) -- Gemini 2.5 Pro: 130 миллионов токенов
- Задержка ответа -- GPT-4.1: 4,7 секунды для полного ответа -- O4 Mini High: более 40 секунд Это критично для агентных систем, где 30 последовательных запросов могут занять 5 минут вместо 30 секунд.
3. Граница открытых весов: сокращение разрыва Георг демонстрирует драматическое сокращение разрыва между открытыми и проприетарными моделями. Особую роль играют китайские лаборатории ИИ:
- DeepSeek лидирует как в reasoning, так и в non-reasoning моделях
- Alibaba с серией Qwen 3 занимает второе место в reasoning
- Meta и Nvidia также конкурируют с моделями на базе Llama DeepSeek R1, выпущенная в январе 2025 года, показывает производительность, сравнимую с лидирующими проприетарными моделями, достигая 79.8% на AIME 2024 против 79.2% у O1.
4. Граница стоимости: драматическое снижение Порядковые изменения в стоимости:
- O3: $2,000 для запуска их бенча индекса интеллекта
- 4.1: в ~30 раз дешевле O1 Стоимость доступа к новому уровню интеллекта снижается вдвое за несколько месяцев (так стоимость доступа к уровню интеллекта GPT-4 упала более чем в 100 раз с середины 2023 года). По данным исследований, стоимость обучения frontier-моделей растет в 2,4 раза в год с 2016 года.
5. Граница скорости: значительный рост производительности Рост скорости вывода токенов: GPT-4 в 2023 году: ~40 токенов в секунду. Тот же уровень интеллекта сейчас: более 300 токенов в секунду. Такие изменения скорости завязаны на технологические улучшения
- Mixture of Experts (MoE) модели - активируют только часть параметров при инференсе
- Дистилляция - создание более интеллектуальных моделей меньшего размера
- Оптимизация софта - flash attention, speculative decoding
- Улучшения аппаратуры - B200 достигает более 1000 токенов в секунду
Главные выводы
- Несмотря на повышение эффективности и снижение стоимости, Камерон прогнозирует продолжение роста спроса на вычисления:
- Более крупные модели - DeepSeek имеет более 600 миллиардов параметров
- Ненасытный спрос на интеллект
- "Болтливые" reasoning-модели требуют больше вычислений при инференсе
- Агенты с 20-30-100+ последовательными запросами
- Стратегические рекомендации
- Измеряйте tradeoffs в своих приложениях, а не полагайтесь только на цену за токен
- Стройте с учетом будущего снижения стоимости - что невозможно сегодня, может стать доступным через 6 месяцев
- Учитывайте структуру затрат приложения при выборе моделей
В общем, Георг показывает интересные результаты бенчмарков, по которым видны интересные тренды. А я лично после выступления еще с интересом потыкал другие исследования с сайта Artificial Analysis.
#AI #Software #Engineering #Management #Metrics #ML #Leadership