К основному содержимому
#Documentary

[2/2] Nvidia’s Explosive Rise from Zero to Trillions (Рубрика Documentary)

#Documentary #Infrastructure #AI #ML #Engineering #Software #Leadership #Startup #DistributedSystems

Продолжая рассказ про историю Nvidia надо отметить инсайты фильма, которые пришли ко мне после его просмотра

1️⃣ Платформа съедает продукт NVIDIA выиграла не только “чипом”, а тем, что сделала программируемую платформу: CUDA - это не “одна библиотека”, а экосистема (компилятор, тулкит, профилинг, библиотеки). В итоге возникает “липкость” и сетевой эффект вокруг железа - редкость для hardware‑бизнеса. 2️⃣ Ставка на рынки с нулевым размером может быть рациональной Большие pivots компании (3D‑графика для PC, потом AI) - это ставки на “zero‑billion dollar markets”. То есть не про хайп, а про умение увидеть будущий сдвиг вычислительной парадигмы. 3️⃣ Программируемость = мультипликатор GeForce 256 была важна не только как ускорение рисования, а как шаг к программируемому ускорителю. Дальше из этого выросла CUDA и общие вычисления 4️⃣ Инженерная дисциплина под давлением решает История “у нас один шанс на tape‑out” и ускорение цикла разработки - это не романтика, а практическая управленческая инженерия: сокращать feedback loop любой ценой. 5️⃣ AI‑инфраструктура - это “система систем” DGX (системы) + Mellanox (сеть) = понимание, что для AI важны не только FLOPS, но и: память, интерконнект, сеть, софт‑стек, инструменты, поставки. Собственно Mellanox был куплен Nvvidia за $7 млрд в 2020 году, когда ребята поняли, что им этого не хватает.

Для технических лидеров мне кажется полезным будет подумать над такими тезисами

1) Стратегия вычислений = стратегия бизнеса Если у вас AI‑фичи в roadmap - у вас появляется новый ресурс: GPU‑время/память/интерконнект, и этим нужно управлять как бюджетом и SLA.

2) Платформенная команда - это не роскошь Нужны люди/команда, которые делают “внутренний CUDA” вашей компании:

  • Шаблоны пайплайнов,
  • Инфраструктура обучения/инференса,
  • Наблюдаемость (стоимость, утилизация, узкие места),
  • Guardrails по качеству/безопасности.

3) Управляйте vendor lock‑in как риском, а не как идеологией CUDA‑экосистема реально мощная - и именно это даёт NVIDIA рычаг.

  • Оставляйте “точки выхода” (абстракции, ONNX/portable‑слои где уместно, контрактные тесты производительности),
  • Держите план B по инфраструктуре (облако/он‑прем/альтернативные ускорители),
  • Фиксируйте метрики стоимости/латентности как продуктовые KPI.

4) "Полный стек" важнее "самого быстрого GPU"

  • Покупка Mellanox и ставка на DGX - хороший сигнал: производительность AI‑системы часто упирается в сеть/IO/оркестрацию, а не в “ещё 10% TFLOPS”.

🧐 После просмотра можно пройтись по таком мини‑чеклист для команды

  1. Посчитать стоимость 1 GPU‑часа (или inference‑1000 req) и сделать её видимой.
  2. Ввести профилирование как обязательный шаг перед релизом ML‑фич.
  3. Определить, где вам нужна "портируемость", а где можно идти в максимальную оптимизацию под конкретный стек.
  4. Проверить узкие места: сеть, storage, батчинг, очереди.
  5. Обновить hiring/skill‑matrix: нужен ли вам performance engineer / ML systems engineer?
  6. Зафиксировать “exit strategy” от критических зависимостей (не завтра, но чтобы она была на бумаге).

#Documentary #Infrastructure #AI #ML #Engineering #Software #Leadership #Startup #DistributedSystems