Stanford MS&E435: дефицитный мегаватт AI-фабрики (Рубрика #AI)
После этой лекции «облачный AI» выглядит удивительно тяжёлой промышленностью: электричество, подстанции, охлаждение, бетон и люди, которые всё это собирают. Третья встреча Stanford MS&E435 полезна именно этим — опускает разговор о моделях, токенах и GPU на физический слой ниже. Гость — Чейз Локмиллер, сооснователь и CEO Crusoe, которая строит и продаёт весь стек от площадки до managed inference. Поэтому это одновременно хорошая карта отрасли изнутри и vendor pitch: Локмиллер объясняет ровно тот вертикальный стек, который продаёт.
Его схема называется «от электронов к токенам»: энергия → здание и охлаждение → compute → токены → выполненная работа. А главный тезис звучит так: по его опыту, текущий bottleneck — уже не отдельный GPU, а energized data center, то есть готовое место, где чип можно включить и загрузить работой.
Вот какие инсайты из лекции я бы вынес: 🔸 Bottleneck постоянно мигрирует Вчера не хватало GPU, сегодня — подключённой мощности, газовых турбин, трансформаторов, switchgear и квалифицированных электриков. Вертикальная интеграция здесь работает не только как способ забрать больше маржи, но и как страховка от очередного дефицита. 🔸 Дефицитный товар — энергизированный мегаватт Купить ускорители недостаточно: нужны земля, разрешения, подстанция, сеть и охлаждение. Поэтому площадка, где можно быстро запустить 100–1000 МВт compute, оказывается стратегическим активом. 🔸 Иногда дешевле перемещать данные, а не электричество Обучение не обязано происходить рядом с пользователем, поэтому Crusoe ставит кластеры возле избыточной энергии Западного Техаса. Для inference с жёсткой задержкой и данных с требованиями к размещению эта логика работает хуже. 🔸 AI-бум — это ещё и промышленный бум На кампусе Abilene, по словам Локмиллера, ежедневно работают тысячи строителей. Электрики, сварщики, pipefitters, бетон и километры кабеля оказываются не менее важны, чем CUDA и архитектура модели. 🔸 Старый GPU может стать commodity, масштаб — нет Большой coherent cluster с общей высокопроизводительной сетью трудно воспроизвести. А managed service может скрыть поколение железа от клиента и продлить экономическую жизнь ускорителей: пользователю нужен результат API, а не конкретный H100. 🔸 В модели Локмиллера экономика зависит от depreciation, загрузки и слоя сервиса По его оценке, здание и генерация стоят около $20 млн на МВт, IT — ещё $40 млн, из которых примерно $30 млн приходится на GPU. Аренда compute в его расчёте даёт около $15 млн выручки на МВт в год, managed inference — в оптимистичном случае до $30 млн. Последние цифры я бы воспринимал только как модель самого CEO. Локмиллер прямо признаёт возможный двойной счёт, неполный OpEx и то, что слайды были собраны в тот же день. Поэтому заявленные два–четыре года «окупаемости» — скорее CapEx / revenue, а не расчёт прибыли или free cash flow.
Самая спорная часть — последняя стрелка в схеме «от электронов к токенам»: от токенов к выполненной работе. Локмиллер называет AI-агентов digital labor и переносит их в фактор труда модели Cobb–Douglas. Это производственная функция (или функция полезности), отражающая зависимость объёма производства Y от создающих его факторов производства — затрат труда L и физического капитала K). Она выглядит так Y(L,K)=A * (L * alpha) * (K * beta), где A — технологический коэффициент, α ⩾ 0 — коэффициент эластичности по труду, а β ⩾ 0 — коэффициент эластичности по капиталу. Как метафора это работает. Но в обычном growth accounting GPU и дата-центр скорее попадают в капитал, улучшение моделей — в технологию и продуктивность, а токены сами по себе ещё не равны полезному результату.
И ещё одна оговорка: closed-loop cooling в Abilene действительно резко снижает расход воды, но, по словам Локмиллера, для кампуса построена газовая станция на 350 МВт. Low-water не означает автоматически low-carbon.
Я бы рекомендовал посмотреть отрезки 9:26–18:30 и 23:54–40:45: сначала меняется представление о bottleneck, затем появляется редкий публичный разбор экономики мегаватта — со всеми его полезными цифрами и честными оговорками.
#AI #Engineering #Infrastructure #Architecture #Economics #Bigtech
Публичные источники
- Stanford Online: MS&E435 — Building AI Factories
- Stanford MS&E435: расписание и материалы курса
- Crusoe: биография Чейза Локмиллера
- Crusoe: расширение кампуса Abilene до проектных 2,1 ГВт
- IEA: рост энергопотребления дата-центров и физические bottlenecks
- OpenAI: инфраструктура и водяное охлаждение Abilene
- OECD: AI, capital deepening и multifactor productivity