Дешёвый токен не означает меньший бюджет
Выпуск начинает с авторского прогноза, а не с обещания точных тарифов. К 2029 году достижение качества моделей 2026-го может подешеветь в 3–10 раз, типовая принятая задача — в 2–5 раз, но бюджет масштабированного AI-портфеля способен вырасти в 2–5 раз. Направление поддерживают разные сигналы: enterprise-расходы и adoption быстро растут, тогда как масштабирование и доказанный вклад в финансовый результат отстают. Эти выборки несопоставимы напрямую, но вместе показывают, что AI уже превращается из эксперимента в производственный класс расходов.
Механика роста описывается формулой: число задач × вызовы на задачу × токены на вызов × цена токена, плюс лицензии, платформа и зарезервированная capacity. Агентная задача может породить 5, 10 или 50 модельных вызовов, повторно передавать контекст, обращаться к инструментам и запускать fallback. Цена токена уменьшается только в одном множителе, а остальные растут. Поэтому рост бюджета может означать полезное расширение работы, но без trace-level телеметрии его невозможно отличить от циклов, лишних повторов и скрытого rework.
Бюджетировать trace, считать принятую задачу
Глобальный лимит на человека смешивает быстрые подсказки и длинные production-workflow. Выпуск предлагает ограничивать полный trace: стоимость, число шагов, retries и одинаковых tool calls, объём результатов инструментов, время, concurrency и полномочия. У агента должны быть loop detector, kill switch и безопасный fallback на человека, потому что неуспешная автономная попытка не обнуляет расходы — она добавляет разбор и восстановление. Владельца назначают на естественном уровне: seat относится к человеку, exploration — к команде, production inference — к use case, shared platform — к центру.
Зрелость FinOps начинается с visibility и showback: команда видит стоимость по продуктам, workflow и средам, строит прогноз и только затем получает мягкие пороги или chargeback. Главный знаменатель — accepted task. В числитель входят модель, tools, retrieval, gateway, compute, человеческое review, переделка и ожидаемая цена ошибки; в знаменатель — только работа, прошедшая критерий приёмки. Для bugfix это тесты и отсутствие регрессии, для review — полезное замечание без шума, для production-агента — завершённый workflow с допустимыми последствиями.
Оптимизация начинается после quality gate
Маршруты сравниваются на одинаковых реальных задачах и общем quality threshold, с несколькими прогонами, retries, fallback, human time и хвостами распределения стоимости. Только прошедшие кандидаты образуют Pareto frontier качества, цены и latency. Такой подход одновременно раскрывает настоящий vendor lock-in: он живёт не в HTTP endpoint, а в prompts, поведении tools, state, evals, коммерческих обязательствах и навыках команды. Переносимым должен быть бизнес-контракт задачи — вход, ожидаемый artifact, критерий приёмки и допустимый эффект — при осознанной изоляции provider-specific возможностей.
Зрелость роутинга строится ступенями: один наблюдаемый маршрут, task tags, статические правила, проверенный fallback, каскад с эскалацией и только затем обучаемый router на реальных outcome labels. Локальная модель тоже допускается после того же quality gate. Её экономика включает GPU или cloud commitment, idle capacity, HA, storage, inference engineering, SRE, security и обновления; точка безубыточности существует лишь при достаточном стабильном потоке принятых задач. Enterprise-контракт оценивается вместе с capacity, retention, версионированием, экспортом usage data и exit rights, а не только по скидке.
Что стоит унести с собой
- 01Снижение цены фиксированного качества расширяет спрос, поэтому общий AI-бюджет может расти даже при удешевлении каждой принятой задачи.
- 02Ограничения должны применяться ко всему trace — стоимости, шагам, времени и полномочиям, — а не к абстрактному месячному лимиту человека.
- 03Cost per accepted task объединяет inference, инструменты, человеческую проверку, rework и риск; сравнение цены до общего quality gate вводит в заблуждение.
- 04Routing, enterprise commitment и local inference окупаются только после появления телеметрии, evals, стабильного потока и проверяемого плана выхода.