К основному содержимому
#AI

Trends Across the AI Frontier (Рубрика AI)

#AI #Software #Engineering #Management #Metrics #ML #Leadership

Посмотрел недавно короткое выступление George Cameron, соучредителя и CPO компании Artificial Analysis, независимой компании по бенчмаркингу ИИ, основанной в октябре 2023 года. Ребята специализируются на независимом тестировании более 150 различных моделей ИИ по широкому спектру метрик, включая интеллект, производительность, стоимость и скорость, публикуя результаты на сайте artificialanalysis.ai. Сам доклад был коротким, но насыщенным аналитикой и прогнозами, а ключевые идеи представлены ниже

1. Множественность границ в ИИ Георг подчеркивает центральную идею своего выступления: в ИИ существует не одна, а несколько границ (frontiers), и разработчики не всегда должны использовать самую интеллектуальную модель. Доклад исследует четыре ключевые границы:

  • Модели рассуждения (Reasoning Models)
  • Открытые веса (Open Weights)
  • Стоимость (Cost)
  • Скорость (Speed)

2. Граница моделей рассуждения: компромиссы производительности Георг показывает аналитику с резличиями на порядок между обычными и reasoning-моделями:

  • Вербальность моделей -- GPT-4.1: 7 миллионов токенов для запуска индекса интеллекта -- O4 Mini High: 72 миллиона токенов (в 10 раз больше) -- Gemini 2.5 Pro: 130 миллионов токенов
  • Задержка ответа -- GPT-4.1: 4,7 секунды для полного ответа -- O4 Mini High: более 40 секунд Это критично для агентных систем, где 30 последовательных запросов могут занять 5 минут вместо 30 секунд.

3. Граница открытых весов: сокращение разрыва Георг демонстрирует драматическое сокращение разрыва между открытыми и проприетарными моделями. Особую роль играют китайские лаборатории ИИ:

  • DeepSeek лидирует как в reasoning, так и в non-reasoning моделях
  • Alibaba с серией Qwen 3 занимает второе место в reasoning
  • Meta и Nvidia также конкурируют с моделями на базе Llama DeepSeek R1, выпущенная в январе 2025 года, показывает производительность, сравнимую с лидирующими проприетарными моделями, достигая 79.8% на AIME 2024 против 79.2% у O1.

4. Граница стоимости: драматическое снижение Порядковые изменения в стоимости:

  • O3: $2,000 для запуска их бенча индекса интеллекта
  • 4.1: в ~30 раз дешевле O1 Стоимость доступа к новому уровню интеллекта снижается вдвое за несколько месяцев (так стоимость доступа к уровню интеллекта GPT-4 упала более чем в 100 раз с середины 2023 года). По данным исследований, стоимость обучения frontier-моделей растет в 2,4 раза в год с 2016 года.

5. Граница скорости: значительный рост производительности Рост скорости вывода токенов: GPT-4 в 2023 году: ~40 токенов в секунду. Тот же уровень интеллекта сейчас: более 300 токенов в секунду. Такие изменения скорости завязаны на технологические улучшения

  • Mixture of Experts (MoE) модели - активируют только часть параметров при инференсе
  • Дистилляция - создание более интеллектуальных моделей меньшего размера
  • Оптимизация софта - flash attention, speculative decoding
  • Улучшения аппаратуры - B200 достигает более 1000 токенов в секунду

Главные выводы

  1. Несмотря на повышение эффективности и снижение стоимости, Камерон прогнозирует продолжение роста спроса на вычисления:
  • Более крупные модели - DeepSeek имеет более 600 миллиардов параметров
  • Ненасытный спрос на интеллект
  • "Болтливые" reasoning-модели требуют больше вычислений при инференсе
  • Агенты с 20-30-100+ последовательными запросами
  1. Стратегические рекомендации
  • Измеряйте tradeoffs в своих приложениях, а не полагайтесь только на цену за токен
  • Стройте с учетом будущего снижения стоимости - что невозможно сегодня, может стать доступным через 6 месяцев
  • Учитывайте структуру затрат приложения при выборе моделей

В общем, Георг показывает интересные результаты бенчмарков, по которым видны интересные тренды. А я лично после выступления еще с интересом потыкал другие исследования с сайта Artificial Analysis.

#AI #Software #Engineering #Management #Metrics #ML #Leadership