Ollama: как агенты меняют экономику открытых моделей (Рубрика #AI4SDLC)
Этот выпуск YC Lightcone с сооснователем Ollama Джеффом Морганом хорошо собирает несколько тем, которые в канале до этого жили отдельно: экономику токенов, локальные модели, routing и быстро меняющуюся агентную обвязку. Ценность разговора для меня в том, что знакомая архитектурная схема уже превращается в устройство рынка.
Тезис Моргана такой: агенты резко увеличивают потребление токенов, поэтому использовать дорогую frontier-модель для каждого промежуточного шага становится бессмысленно. Большой объём работы заберут дешёвые открытые модели, а самые сильные закрытые останутся для сложных решений и эскалации.
В выпуске прозвучали несколько оценок Ollama 1️⃣ С начала 2026 года общий объём токенов в Ollama Cloud, по данным компании, вырос примерно в 150 раз. Это внутренняя метрика Ollama, а не независимый замер эффективности. 2️⃣ Морган прогнозирует, что открытые модели смогут выполнять 80–90% корпоративных токенов, получая лишь 10–20% общего AI-бюджета. Пока это гипотеза участника рынка, но асимметрия интересная: массовая работа и основная маржа могут оказаться в разных слоях. 3️⃣ Архитектура будет гибридной: простые и чувствительные задачи можно исполнять локально, тяжёлые — отправлять в облако, сохраняя общий интерфейс.
Многое здесь подтверждает то, о чём я писал раньше. [Цена токена плохо описывает экономику агента: считать нужно завершённую и принятую задачу вместе с проверкой, повторами и последствиями ошибки. Сам рост token volume тоже нельзя путать с ростом ценности — в разборе данных OpenCode я отдельно показывал, как на объём влияют длина сессий, кеш и небольшая группа тяжёлых пользователей.
Routing тоже уже перестал быть красивой схемой на слайде. AT&T описывает 45 млрд токенов в день, cache-aware router и экономию до 90% на своих сценариях. А в истории OpenCode мы видели ту же продуктовую ставку: агрегировать спрос, проверять связки «модель + провайдер» и давать приложению переключаться между моделями.
Что для меня здесь новое
1️⃣ К приватности и суверенности как причинам выбирать открытые модели добавляется агентная экономика. Когда один запрос превращается в сотни model calls, дешёвый исполнитель нужен уже для масштабирования самого цикла.
2️⃣ Ollama хочет зарабатывать на самом скоропортящемся месте стека — совместимости модели, inference engine, железа, облачной ёмкости и agent harness в день релиза. Я недавно писал, что generic harness разумно арендовать, оставляя своими задачу, контекст и evals. Ollama пробует стать поставщиком похожего изменчивого слоя этажом ниже.
3️⃣ Яснее разошлись роли знакомых инструментов. LM Studio тяготеет к персональной рабочей среде, vLLM — к производительному serving engine, а Ollama претендует на слой дистрибуции и совместимости между локальным запуском, облаком и агентными приложениями. Поэтому её сравнение с Docker здесь содержательнее обычного «ещё один способ запустить LLM».
Но open weights не делают систему автоматически локальной, дешёвой или безопасной. В разборе конфигураций агентного стека я разделял модель, harness, инструменты, identity и границы исполнения. А локальная модель просто переносит расходы из API в GPU, эксплуатацию и риск недозагрузки.
Если ставка Ollama сработает, открытые модели не уничтожат платформы. Они создадут новый класс платформ поверх взаимозаменяемых весов. И тогда компании полезно владеть не каждым компонентом, а теми слоями, где находится её реальная ценность: контрактом задачи, состоянием, полномочиями, воспроизводимыми эпизодами и outcome-evals. Остальные слои можно арендовать — но [перепроверять после каждого заметного сдвига модели и обвязки.
#AI4SDLC #AI #Agents #Architecture #PlatformEngineering #FinOps
Публичные источники
- YC Lightcone: Open Models Change The Economics of AI
- Ollama: All aboard open models
- AT&T: маршрутизация моделей и экономика токенов
- Книжный куб: считать не токены, а принятый результат
- Книжный куб: OpenCode как открытый рынок моделей
- Книжный куб: как читать статистику использования OpenCode
- Книжный куб: harness становится инфраструктурой
- polomodov.tech: конфигурации агентного стека
- polomodov.tech: совместная эволюция AI-стека