AIOps / LLMOps для ИИ-продуктов
Управленческие решения, экономика и FinOps для продакшен-контура ИИ
Управленческие решения, экономика и FinOps для продакшен-контура ИИ
Управленческие решения, экономика и FinOps для продакшен-контура ИИ
Technical Director & Fellow, Т-Технологии
Архитектура и инженерные практики
AI внедрение на масштабе разработки
Фокус: управляемый продакшен AI
Руководитель выбирает поведение, запуск и контроль
Словарь уже есть — Gateway, context, evals, защитные ограничения известны.
Фокус на решениях — SLA, автономия и цена качества.
Денежный якорь — Support-бот проверяет TCO/FinOps.
AIOps / LLMOps начинается после появления платформы
Не пересказываем карту платформы
Выбираем сервис под сценарий
Считаем цену решенной задачи
Фокус: управляемость AI-продукта
Не повторяем устройство AI-платформы, а переводим его в решения руководителя
Появляются владельцы, бюджет и контур контроля
Качество: сценарии и пороги
Риск: права, аудит, резервный сценарий
Стоимость: не только токены
Ответственность: продукт, платформа, риск
Одна модель может быть помощником, сервисом или агентом
Что должно произойти
Какой сценарий улучшаем
Какую базовую линию побеждаем
Что нельзя сломать
Цена ошибки и риск данных
Потолок стоимости операции
До запуска: сценарий и потолок
Во время: автономия и резервный сценарий
После: экономика и маршруты
Модель управления важнее единичной модели
Сценарий, автономия, цена ошибки, SLA, бюджет качества и ответственность
Иначе AI растет быстрее контроля
Value — Ценность и сценарий — Где ценность, какую базовую линию и какой SLA.
Risk — Риск и контроль — Допустимая автономия и human-in-the-loop.
Cost — Экономика и ответственность — Цена качества; владельцы продукта, данных, риска и счета.
Дороже последствие — строже контроль
Низкая цена ошибки
Черновики, подсказки, поиск
Быстрые модели и кэш
Метрика: скорость и deflection
Высокая цена ошибки
Деньги, договоры, prod
Policy gate, approval, аудит
Метрика: инциденты и эскалации
Важен безопасный результат, а не вызов модели
Service health
Latency, timeouts, fallback
Peaks, queues, rate limits
SLO включает резервный путь
Quality health
Источники, полнота, policy
Нет контекста — эскалация
Качество мерим по сценариям
Одинаковый стек может быть правильным или нет
Ценность: процесс и базовая линия
Риск: ошибка и approval
Экономика: unit cost
Операционность: выпуск и откат
Решение объясняется не стеком
API-first, управляемая платформа, арендованные GPU, свой self-host и hybrid
Выбор зависит от данных, контроля и горизонта
Покупаем больше готового
API-first: быстрый старт
Managed: контроль и lock-in
SaaS: проверка спроса
Берем больше контроля
Rented GPU: OPEX вместо CAPEX
Own self-host: контроль и эксплуатация
Hybrid: маршруты по сценариям
Одна модель, но разные риск и управление
Read-only помощник
Ценность: поиск и объяснение
Риск: ошибка и утечка
Контроль: ACL, citations, резервный сценарий
Агент с действиями
Ценность: выполняет шаги
Риск: деньги и prod
Путь выбирается по сценарию, риску и цене
Низкий риск — дешевый route
Дорогая ошибка — premium/review
Сбой — partial/read-only/handoff
Стоимость меняет routing
API-first — старт и проверка
Rented GPU — переходный контроль
Own self-host — только при нагрузке
Hybrid — разные сценарии
Нельзя выбрать runtime без сценариев и финансового горизонта
Support-бот: нагрузка, токены, GPU, команда и управленческий выбор
200 000 диалогов в месяц, 10 сообщений в диалоге, SLA до 5 секунд
Что считаем — Нагрузка, токены, peak, GPU, CAPEX/OPEX, команда.
Что сравниваем — API-first, rented GPU, own self-host, hybrid.
Что решаем — Путь на год и метрики пересмотра.
Это уже не игрушечное демо, но еще не нагрузка, которая автоматически оправдывает свое железо
1 000 000 LLM-ответов в месяц дают пик около 9-10 одновременных генераций для SLA 5 сек
При профиле 1 400 input и 180 output токенов на ответ LLM-часть стоит около $4 970 в месяц
Риск — тихий рост unit economics
Почему стартовать удобно
Почти нулевой CAPEX
Быстрее production
Тоньше платформа вокруг
Что нужно контролировать
Output, cache, retries
Provider limits и деградация
Для пика около 10 параллельных ответов оценка дает 6-8 A100 для 14B и около 12 GPU для 32B
В примере 6-8 A100 дают 1.17-1.56 млн руб/мес до учета сети, хранения и команды
Вместо токенов появляется инфраструктурный продукт
Rented GPU
Проверка self-host гипотезы
OPEX зависит от загрузки
Нужны MLOps/SRE
Own hardware
Максимум контроля
CAPEX и сроки поставки
Смысл при стабильной нагрузке
Для заданной нагрузки API-first чаще всего рационален, если нет жесткого требования on-prem
Запуск через API не отменяет план пересчета при росте трафика, комплаенса или цены качества
Стартовать API-first
Сразу вести unit economics
Задать триггеры пересмотра
Self-host доказывать расчетом
Первое решение - скорость с контролем, не вечная архитектура
Дашборд, распределение затрат, пересчет unit economics и 120-дневный план
Без связи с продуктом расходы растут быстрее пользы
Сценарий имеет лимит
Стоимость видна по route
Общий счет прячет решения
Цена объясняет компромисс
Habr/TCO пример показывает порядок: одна конфигурация около 202 млн руб, а prod/dev/test/reserve - около 606 млн руб
Электричество, охлаждение, лицензии, поддержка и команда превращают железо в сервис
GPU-часы, хранение, кВт·ч, трафик, контейнеры, модели и пользователи связывают затраты с поведением продуктов
Отдельные графики токенов не дают решения
Качество и риск
Качество по сценариям
Резервный сценарий и policy violations
Инциденты с evidence pack
Экономика и контроль
Cost per outcome
Cache, retries, route mix
План начинается с управленческого контура
0-30: сценарии, базовая линия, owners
30-60: observability, fallback, dashboard
60-90: limited release, unit economics
90-120: FinOps и масштабирование
Масштабируйте управляемые сценарии
Без evals качество кажется выше
Без резервный сценарий растет риск
Без unit economics ломается экономика
Без ответственности начинается спор
Управляемый ИИ начинается с решений менеджера
AIOps, риск и экономика
OpenAI pricing and docs.
OWASP, NIST, Langfuse.
Habr TCO, FinOps Foundation.
Форма обратной связи по второму дню