[2/2] Nvidia’s Explosive Rise from Zero to Trillions (Рубрика Documentary)
Продолжая рассказ про историю Nvidia надо отметить инсайты фильма, которые пришли ко мне после его просмотра
1️⃣ Платформа съедает продукт NVIDIA выиграла не только “чипом”, а тем, что сделала программируемую платформу: CUDA - это не “одна библиотека”, а экосистема (компилятор, тулкит, профилинг, библиотеки). В итоге возникает “липкость” и сетевой эффект вокруг железа - редкость для hardware‑бизнеса. 2️⃣ Ставка на рынки с нулевым размером может быть рациональной Большие pivots компании (3D‑графика для PC, потом AI) - это ставки на “zero‑billion dollar markets”. То есть не про хайп, а про умение увидеть будущий сдвиг вычислительной парадигмы. 3️⃣ Программируемость = мультипликатор GeForce 256 была важна не только как ускорение рисования, а как шаг к программируемому ускорителю. Дальше из этого выросла CUDA и общие вычисления 4️⃣ Инженерная дисциплина под давлением решает История “у нас один шанс на tape‑out” и ускорение цикла разработки - это не романтика, а практическая управленческая инженерия: сокращать feedback loop любой ценой. 5️⃣ AI‑инфраструктура - это “система систем” DGX (системы) + Mellanox (сеть) = понимание, что для AI важны не только FLOPS, но и: память, интерконнект, сеть, софт‑стек, инструменты, поставки. Собственно Mellanox был куплен Nvvidia за $7 млрд в 2020 году, когда ребята поняли, что им этого не хватает.
Для технических лидеров мне кажется полезным будет подумать над такими тезисами
1) Стратегия вычислений = стратегия бизнеса Если у вас AI‑фичи в roadmap - у вас появляется новый ресурс: GPU‑время/память/интерконнект, и этим нужно управлять как бюджетом и SLA.
2) Платформенная команда - это не роскошь Нужны люди/команда, которые делают “внутренний CUDA” вашей компании:
- Шаблоны пайплайнов,
- Инфраструктура обучения/инференса,
- Наблюдаемость (стоимость, утилизация, узкие места),
- Guardrails по качеству/безопасности.
3) Управляйте vendor lock‑in как риском, а не как идеологией CUDA‑экосистема реально мощная - и именно это даёт NVIDIA рычаг.
- Оставляйте “точки выхода” (абстракции, ONNX/portable‑слои где уместно, контрактные тесты производительности),
- Держите план B по инфраструктуре (облако/он‑прем/альтернативные ускорители),
- Фиксируйте метрики стоимости/латентности как продуктовые KPI.
4) "Полный стек" важнее "самого быстрого GPU"
- Покупка Mellanox и ставка на DGX - хороший сигнал: производительность AI‑системы часто упирается в сеть/IO/оркестрацию, а не в “ещё 10% TFLOPS”.
🧐 После просмотра можно пройтись по таком мини‑чеклист для команды
- Посчитать стоимость 1 GPU‑часа (или inference‑1000 req) и сделать её видимой.
- Ввести профилирование как обязательный шаг перед релизом ML‑фич.
- Определить, где вам нужна "портируемость", а где можно идти в максимальную оптимизацию под конкретный стек.
- Проверить узкие места: сеть, storage, батчинг, очереди.
- Обновить hiring/skill‑matrix: нужен ли вам performance engineer / ML systems engineer?
- Зафиксировать “exit strategy” от критических зависимостей (не завтра, но чтобы она была на бумаге).
#Documentary #Infrastructure #AI #ML #Engineering #Software #Leadership #Startup #DistributedSystems