К основному содержимому
к странице архива
#AI

Stanford MS&E435: inference как производственная система (Рубрика #AI)

Действия с публикацией

После истории Google TPU и разговора с Dylan Patel про hardware-software co-design вторая лекция Stanford MS&E435 складывается в следующий кусок пазла. Она называется «The GPU Economy», но интереснее здесь не вопрос «какой чип победит?». Интереснее момент, в котором software становится производством: каждый новый запрос снова включает фабрику.

Встречу ведёт Apoorv Agrawal, преподаватель курса и партнёр Altimeter. Гости — основатель фонда Brad Gerstner и Sunny Madra, бывший президент Groq, перешедший с частью команды в NVIDIA. Gerstner задаёт экономическую рамку, Madra объясняет железо. Оптика у разговора соответствующая: инвестор в AI-инфраструктуру и человек со стороны её поставщика, поэтому прогнозы и рыночные числа я бы держал с хорошим запасом скепсиса.

Техническое ядро — inference как неоднородный workload. Prefill обрабатывает входной контекст, decode последовательно выпускает токены; разные части упираются в вычисления, память и latency по-разному. Поэтому вместо одного «лучшего GPU» появляется составная система:

» GPU с HBM остаётся универсальной машиной для тяжёлых частей; » LPU Groq использует детерминированное выполнение, compiler-managed SRAM и предсказуемую задержку; » NVLink связывает ускорители, а runtime отправляет каждой архитектуре подходящую часть работы.

По словам Madra, совместный прототип давал в 2,5 раза больше токенов при том же энергобюджете (правда, в лекции нет конфигурации и воспроизводимого benchmark, так что это заявление участника сделки). Но сам принцип уже виден в продуктовой архитектуре NVIDIA: Rubin GPU и Groq LPX проектируются как одна inference-система (подробнее можно почитать в анонсе про Groq 3 LPX)

Не менее важна продуктовая часть. Groq не заставила разработчиков сначала полюбить новую архитектуру — она спрятала её за API GroqCloud. А затем вместо лобовой войны с NVIDIA команда разложила workload и нашла слой, где две архитектуры дополняют друг друга. Для deep tech совместимость с доминирующей платформой иногда сильнее чистой победы в benchmark.

Кстати, в разговоре NVIDIA несколько раз «покупает Groq за $20 млрд». Формально всё тоньше: стороны заключили неисключительную лицензию, часть команды перешла в NVIDIA, а Groq осталась независимой и сохранила GroqCloud. В отчётности NVIDIA раскрыто $17 млрд совокупного вознаграждения и отдельно сказано, что акции, клиентские контракты и существующие продукты не покупались. По-факту, это покупка части интеллектуальной собственности + покупка команды.

Дальше начинается экономика. Стоимость единицы inference падает, но reasoning и агенты делают больше шагов, вызывают инструменты, проверяют себя и работают часами. Поэтому удешевление токена не обязательно снимает дефицит GPU — оно может увеличить общий спрос. Почти парадокс Джевонса, только вместо угля мы сжигаем матричные умножения.

Но здесь я бы поспорил с Gerstner: больше токенов ещё не означает больше ценности. Мы уже обсуждали token burn как proof of work и ненулевую предельную стоимость в AI pricing. Для продукта взрослая метрика — не tokens per task, а cost per verified outcome: полезный результат вместе с retries, review и rework.

Тут есть даже непрямая связь с роботами. Для physical AI мало tokens per watt: нужны успешные действия на джоуль, p99 latency замкнутого control loop и доказанная безопасность. В разборе Waymo цена ошибки уже измерялась не токенами. И вот здесь «inference-фабрика» заканчивается не ответом в чате, а движением машины в физическом мире.

Я бы смотрел внимательно отрезок примерно с 16-й по 35-ю минуту: там разговор перестаёт быть презентацией большого AI-будущего и становится хорошим обсуждением системной инженериеи.

#AI #Engineering #Architecture #Infrastructure #Agents #Robotics

Открыть видео на YouTube

Публичные источники