К основному содержимому
ИИ-лидеры: бизнес-лаборатория для руководителей — ВШЭ ФКН

Содержание слайдов

  1. 1. ИИ-лидеры: бизнес-лаборатория для руководителей — ВШЭ ФКН

    ИИ-лидеры: бизнес-лаборатория для руководителей — ВШЭ ФКН

  2. 2. Эволюция подходов к ИИ‑проекту

    От инфраструктуры к GenAI‑приложениям поверх foundation models

    Контекст — ИИ перешёл от серверных к сервисам по подписке.

    Цель — Выбрать площадку, команду и экономику запуска.

    Ключевые вопросы — Ресурсы, масштаби­рование, TCO и техконтур.

  3. 3. Собственное железо

    ИИ‑инфраструктура прошлого

    Большой CAPEX на GPU‑серверы.

    Серверная: питание, охлаждение, безопасность.

    Долгий rollout и сложное масштабирование.

    ИИ‑проекты доступны в основном корпорациям.

  4. 4. Облака: compute on demand

    Мощности без покупки железа

    AWS/Azure/GCP дали ресурсы по подписке.

    Pay‑as‑you‑go: старт без CAPEX.

    Масштабирование за минуты.

    Постоянная высокая нагрузка дороже владения.

  5. 5. ML‑инструменты взрослеют

    От кода с нуля к библиотекам

    Open source: scikit‑learn, TensorFlow, PyTorch.

    Эксперименты и разработка моделей ускоряются.

    Предобученные модели снижают барьер входа.

    Специалисты и ML‑пайплайны всё ещё нужны.

  6. 6. Foundation models

    API вместо обучения с нуля

    GPT‑3/ChatGPT закрывают широкий круг задач.

    Доступ через API.

    Текст, речь, изображение — как сервис.

    Фокус: prompting, fine-tuning, integration.

  7. 7. GenAI‑приложения

    Prompting → RAG → Agents → Multi-agents

    2023: Prompt Engineering адаптирует модель.

    2024: RAG подключает знания и контекст.

    2025: агенты вызывают инструменты.

    2026: multi-agent для сложных процессов.

  8. 8. Роли сжимаются до tiny teams

    От специализации к гибридным командам

    Раньше

    Data engineer и ML‑исследователь

    ML‑инженер и DevOps

    Software engineer для интеграции

    Сегодня

    2–3 человека для пилота

    Prompt‑инженер/AI‑оркестратор

    MLOps + PM с AI‑бэкграундом

    Фокус: upskilling и работа с API/сервисами.

  9. 9. Оценка затрат и скрытые статьи

    Что важно учесть при планировании бюджета

    Инфраструктура — On‑prem — upfront‑затраты; облако — расходы по использованию.

    API и масштабирование — Token-cost растёт вместе с нагрузкой.

    Данные и люди — Данные, разметка, экспертиза и поддержка — ключевые расходы.

  10. 10. Техническая сторона

    Практические принципы запуска

    Начните с пилота с понятным эффектом.

    Cloud default; on-prem — при строгих требованиях.

    Готовые сервисы вместо типовых компонентов.

    Проектируйте UX и ошибки вокруг модели.

  11. 11. TCO support-бота

    200 000 диалогов/мес, SLA до 5 сек

    Входные параметры — 200 000 диалогов/мес, 10 сообщений, SLA 5 сек.

    Цель расчета — Сравнить CAPEX/OPEX, команду и time-to-prod.

    Формат решения — Load, model cost, sizing и итоговый выбор.

  12. 12. Из параметров в нагрузку

    10 сообщений = 5 ответов бота

    LLM-вызовов: 1 000 000 ответов/мес.

    Средняя нагрузка: ~0.386 RPS.

    Пиковый час: ~1.85 RPS.

    SLA 5 сек: ~9-10 параллельных генераций.

  13. 13. OpenAI gpt-5.2: стоимость

    Support-ответ: standard pricing

    Цены: input $1.75/M, output $14/M.

    Профиль: ~1 400 input / ~180 output.

    Месяц: 1.4B input, 180M output.

    Итого LLM: ~$4 970/мес, $0.0249/диалог.

  14. 14. OpenAI API: CAPEX/OPEX/Команда/Скорость

    Плюс API-подхода — быстрый старт при минимальном CAPEX

    Финансы

    CAPEX: практически 0.

    LLM OPEX: ~ $5k/мес (в базовом профиле).

    Платформа вокруг: обычно $0.5k-$5k/мес.

    Реализация

    Запуск: 5-7 FTE.

    Эксплуатация: 1.5-3 FTE.

    MVP: 4-6 недель; production: 8-12 недель.

  15. 15. Qwen self-host: SLA 5 сек

    Пиковая нагрузка

    Qwen-14B: ~86 ток/с; 32B: ~50.

    180 токенов: ~2.1 / ~3.6 сек.

    Параллельность: ~2 / ~1.

    Пик ~10 ответов: 14B 6-8; 32B 12.

  16. 16. Self-host: CAPEX, OPEX, команда

    Токены превращаются в infra + ops

    Финансы

    14B: ~$120k-$220k; 32B: ~$200k-$350k+.

    Амортизация $180k: ~$5k/мес.

    OPEX: колокация, обслуживание, GPU ops.

    Реализация

    Запуск: 8-12 FTE.

    Эксплуатация: 3-5 FTE.

    SLA: 12-20+ недель плюс поставка.

  17. 17. Qwen на арендованных GPU

    CAPEX ниже, OPEX выше

    Финансы

    CAPEX: почти 0 (железо не покупается).

    OPEX: GPU, сеть, хранение.

    При высокой загрузке дороже своего железа.

    Реализация

    Запуск быстрее закупки серверов.

    Нужны MLOps/SRE и управление инференсом.

    Риски: цена и доступность GPU.

  18. 18. OPEX аренды GPU

    A100: 4.5 руб/мин

    A100: 270 руб/час.

    1 GPU 24x7: 194 400 руб/мес.

    14B (6-8 GPU): 1.17-1.56 млн руб/мес.

    32B (~12 GPU): 2.33 млн + сеть/резерв.

  19. 19. Три стратегии развертывания

    200 000 диалогов в месяц

    OpenAI API: быстрый старт.

    Своё железо: контроль на масштабе.

    Арендованные GPU: без CAPEX.

    Для текущей нагрузки выигрывает API-first.

  20. 20. Управленческий вывод по кейсу

    Без strict on-prem требований стартуйте с API.

    Арендованные GPU: контроль модели без CAPEX.

    Своё железо выгоднее на большом стабильном трафике.

    Экономика API: output и cacheable input.

    Для кейса: OpenAI API и регулярный пересчёт unit-экономики.

  21. 21. Материалы

    API, GPU, self-host

    OpenAI API docs/pricing

    cloud.ru GPU pricing

    Hugging Face model/deploy docs

    FinOps unit economics

  22. 22. Главные выводы

    ИИ стал commodity: функции доступны как сервисы.

    Cloud-развёртывание; команда — small core + domain.

    Экономику считаем заранее: API, данные, люди.

    Успех дает комбинация технологии и грамотного управления.

    Прошлый опыт и новые инструменты дают устойчивую бизнес-пользу.