К основному содержимому
к странице архива
#AI4SDLC

Ollama: как агенты меняют экономику открытых моделей (Рубрика #AI4SDLC)

Этот выпуск YC Lightcone с сооснователем Ollama Джеффом Морганом хорошо собирает несколько тем, которые в канале до этого жили отдельно: экономику токенов, локальные модели, routing и быстро меняющуюся агентную обвязку. Ценность разговора для меня в том, что знакомая архитектурная схема уже превращается в устройство рынка.

Тезис Моргана такой: агенты резко увеличивают потребление токенов, поэтому использовать дорогую frontier-модель для каждого промежуточного шага становится бессмысленно. Большой объём работы заберут дешёвые открытые модели, а самые сильные закрытые останутся для сложных решений и эскалации.

В выпуске прозвучали несколько оценок Ollama 1️⃣ С начала 2026 года общий объём токенов в Ollama Cloud, по данным компании, вырос примерно в 150 раз. Это внутренняя метрика Ollama, а не независимый замер эффективности. 2️⃣ Морган прогнозирует, что открытые модели смогут выполнять 80–90% корпоративных токенов, получая лишь 10–20% общего AI-бюджета. Пока это гипотеза участника рынка, но асимметрия интересная: массовая работа и основная маржа могут оказаться в разных слоях. 3️⃣ Архитектура будет гибридной: простые и чувствительные задачи можно исполнять локально, тяжёлые — отправлять в облако, сохраняя общий интерфейс.

Многое здесь подтверждает то, о чём я писал раньше. [Цена токена плохо описывает экономику агента: считать нужно завершённую и принятую задачу вместе с проверкой, повторами и последствиями ошибки. Сам рост token volume тоже нельзя путать с ростом ценности — в разборе данных OpenCode я отдельно показывал, как на объём влияют длина сессий, кеш и небольшая группа тяжёлых пользователей.

Routing тоже уже перестал быть красивой схемой на слайде. AT&T описывает 45 млрд токенов в день, cache-aware router и экономию до 90% на своих сценариях. А в истории OpenCode мы видели ту же продуктовую ставку: агрегировать спрос, проверять связки «модель + провайдер» и давать приложению переключаться между моделями.

Что для меня здесь новое

1️⃣ К приватности и суверенности как причинам выбирать открытые модели добавляется агентная экономика. Когда один запрос превращается в сотни model calls, дешёвый исполнитель нужен уже для масштабирования самого цикла.

2️⃣ Ollama хочет зарабатывать на самом скоропортящемся месте стека — совместимости модели, inference engine, железа, облачной ёмкости и agent harness в день релиза. Я недавно писал, что generic harness разумно арендовать, оставляя своими задачу, контекст и evals. Ollama пробует стать поставщиком похожего изменчивого слоя этажом ниже.

3️⃣ Яснее разошлись роли знакомых инструментов. LM Studio тяготеет к персональной рабочей среде, vLLM — к производительному serving engine, а Ollama претендует на слой дистрибуции и совместимости между локальным запуском, облаком и агентными приложениями. Поэтому её сравнение с Docker здесь содержательнее обычного «ещё один способ запустить LLM».

Но open weights не делают систему автоматически локальной, дешёвой или безопасной. В разборе конфигураций агентного стека я разделял модель, harness, инструменты, identity и границы исполнения. А локальная модель просто переносит расходы из API в GPU, эксплуатацию и риск недозагрузки.

Если ставка Ollama сработает, открытые модели не уничтожат платформы. Они создадут новый класс платформ поверх взаимозаменяемых весов. И тогда компании полезно владеть не каждым компонентом, а теми слоями, где находится её реальная ценность: контрактом задачи, состоянием, полномочиями, воспроизводимыми эпизодами и outcome-evals. Остальные слои можно арендовать — но [перепроверять после каждого заметного сдвига модели и обвязки.

#AI4SDLC #AI #Agents #Architecture #PlatformEngineering #FinOps

Открыть видео на YouTube

Публичные источники