

ИИ-лидеры: бизнес-лаборатория для руководителей — ВШЭ ФКН
От инфраструктуры к GenAI‑приложениям поверх foundation models
Контекст — ИИ перешёл от серверных к сервисам по подписке.
Цель — Выбрать площадку, команду и экономику запуска.
Ключевые вопросы — Ресурсы, масштабирование, TCO и техконтур.
ИИ‑инфраструктура прошлого
Большой CAPEX на GPU‑серверы.
Серверная: питание, охлаждение, безопасность.
Долгий rollout и сложное масштабирование.
ИИ‑проекты доступны в основном корпорациям.
Мощности без покупки железа
AWS/Azure/GCP дали ресурсы по подписке.
Pay‑as‑you‑go: старт без CAPEX.
Масштабирование за минуты.
Постоянная высокая нагрузка дороже владения.
От кода с нуля к библиотекам
Open source: scikit‑learn, TensorFlow, PyTorch.
Эксперименты и разработка моделей ускоряются.
Предобученные модели снижают барьер входа.
Специалисты и ML‑пайплайны всё ещё нужны.
API вместо обучения с нуля
GPT‑3/ChatGPT закрывают широкий круг задач.
Доступ через API.
Текст, речь, изображение — как сервис.
Фокус: prompting, fine-tuning, integration.
Prompting → RAG → Agents → Multi-agents
2023: Prompt Engineering адаптирует модель.
2024: RAG подключает знания и контекст.
2025: агенты вызывают инструменты.
2026: multi-agent для сложных процессов.
От специализации к гибридным командам
Раньше
Data engineer и ML‑исследователь
ML‑инженер и DevOps
Software engineer для интеграции
Сегодня
2–3 человека для пилота
Prompt‑инженер/AI‑оркестратор
MLOps + PM с AI‑бэкграундом
Фокус: upskilling и работа с API/сервисами.
Что важно учесть при планировании бюджета
Инфраструктура — On‑prem — upfront‑затраты; облако — расходы по использованию.
API и масштабирование — Token-cost растёт вместе с нагрузкой.
Данные и люди — Данные, разметка, экспертиза и поддержка — ключевые расходы.
Практические принципы запуска
Начните с пилота с понятным эффектом.
Cloud default; on-prem — при строгих требованиях.
Готовые сервисы вместо типовых компонентов.
Проектируйте UX и ошибки вокруг модели.
200 000 диалогов/мес, SLA до 5 сек
Входные параметры — 200 000 диалогов/мес, 10 сообщений, SLA 5 сек.
Цель расчета — Сравнить CAPEX/OPEX, команду и time-to-prod.
Формат решения — Load, model cost, sizing и итоговый выбор.
10 сообщений = 5 ответов бота
LLM-вызовов: 1 000 000 ответов/мес.
Средняя нагрузка: ~0.386 RPS.
Пиковый час: ~1.85 RPS.
SLA 5 сек: ~9-10 параллельных генераций.
Support-ответ: standard pricing
Цены: input $1.75/M, output $14/M.
Профиль: ~1 400 input / ~180 output.
Месяц: 1.4B input, 180M output.
Итого LLM: ~$4 970/мес, $0.0249/диалог.
Плюс API-подхода — быстрый старт при минимальном CAPEX
Финансы
CAPEX: практически 0.
LLM OPEX: ~ $5k/мес (в базовом профиле).
Платформа вокруг: обычно $0.5k-$5k/мес.
Реализация
Запуск: 5-7 FTE.
Эксплуатация: 1.5-3 FTE.
MVP: 4-6 недель; production: 8-12 недель.
Пиковая нагрузка
Qwen-14B: ~86 ток/с; 32B: ~50.
180 токенов: ~2.1 / ~3.6 сек.
Параллельность: ~2 / ~1.
Пик ~10 ответов: 14B 6-8; 32B 12.
Токены превращаются в infra + ops
Финансы
14B: ~$120k-$220k; 32B: ~$200k-$350k+.
Амортизация $180k: ~$5k/мес.
OPEX: колокация, обслуживание, GPU ops.
Реализация
Запуск: 8-12 FTE.
Эксплуатация: 3-5 FTE.
SLA: 12-20+ недель плюс поставка.
CAPEX ниже, OPEX выше
Финансы
CAPEX: почти 0 (железо не покупается).
OPEX: GPU, сеть, хранение.
При высокой загрузке дороже своего железа.
Реализация
Запуск быстрее закупки серверов.
Нужны MLOps/SRE и управление инференсом.
Риски: цена и доступность GPU.
A100: 4.5 руб/мин
A100: 270 руб/час.
1 GPU 24x7: 194 400 руб/мес.
14B (6-8 GPU): 1.17-1.56 млн руб/мес.
32B (~12 GPU): 2.33 млн + сеть/резерв.
200 000 диалогов в месяц
OpenAI API: быстрый старт.
Своё железо: контроль на масштабе.
Арендованные GPU: без CAPEX.
Для текущей нагрузки выигрывает API-first.
Без strict on-prem требований стартуйте с API.
Арендованные GPU: контроль модели без CAPEX.
Своё железо выгоднее на большом стабильном трафике.
Экономика API: output и cacheable input.
Для кейса: OpenAI API и регулярный пересчёт unit-экономики.
API, GPU, self-host
OpenAI API docs/pricing
cloud.ru GPU pricing
Hugging Face model/deploy docs
FinOps unit economics
ИИ стал commodity: функции доступны как сервисы.
Cloud-развёртывание; команда — small core + domain.
Экономику считаем заранее: API, данные, люди.
Успех дает комбинация технологии и грамотного управления.
Прошлый опыт и новые инструменты дают устойчивую бизнес-пользу.