К основному содержимому
к странице архива
#AI

Stanford MS&E435: Baseten и как юнит-экономика меняет стратегию (Рубрика #AI)

В беседе Apoorv Agrawal с Тухином Шриваставой, сооснователем Baseten, из стэнфордского курса Economics of the AI Supercycle мне понравилась история о том, как рост бизнеса заставляет пересматривать архитектуру. Сначала компания берёт готовые API, потом обзаводится своими моделями. А её инфраструктурный провайдер тем временем начинает задумываться о собственных GPU. У обоих постепенно меняется ответ на вопрос: что мы можем делегировать?

На старте логика понятная: run fast. Берёшь топовую модель провайдера, собираешь продукт, проверяешь спрос. Пока непонятно, нужен ли кому-то твой сервис, строить команду эксплуатации моделей довольно дорого. Гораздо полезнее быстро выяснить, за что люди готовы платить.

Дальше появляются пользователи, повторяющиеся задачи и счёт за инференс. Тут начинается run effective: имеет смысл взять модель с открытыми весами и дообучить под свой сценарий. Универсальность большой модели оплачивается в каждом запросе, хотя конкретному продукту нужна лишь часть её возможностей.

По оценке Шриваставы, открытые модели можно запускать на 70–90% дешевле передовых закрытых. Это оценка спикера, а не обещание такой экономии любому продукту. Считать придётся стоимость успешно выполненной задачи, включая обучение, проверки качества, повторные попытки и работу команды. При достаточном объёме экономия начинает окупать всю эту возню.

Но между «скачать веса» и «отвечать за работающий сервис» лежит отдельная профессия. Нужны люди, которые подготовят данные, дообучат модель, развернут её, добьются нужной задержки и будут разбираться, почему ночью всё упало. Здесь появляется Baseten: по описанию Шриваставы, платформа берёт на себя инфраструктуру обучения и инференса. Клиент приносит данные и определяет, что считать хорошим результатом. Понимание собственного продукта делегировать сложнее.

К экономике добавляется конкуренция. Вот наглядный пример не из лекции. Anthropic поставляет модели разработчикам приложений и одновременно развивает Claude Code, который работает с той же аудиторией, что и Cursor. Поставщик вполне может захотеть сам продавать конечный продукт. При этом собственные модели Cursor появились ещё до Claude Code: Tab работает на кастомной модели с марта 2024 года. Позже компания представила Composer 2 на базе Kimi K2.5, с дополнительным предобучением и reinforcement learning. Кстати, Baseten действительно работает с Cursor, хотя из этого не следует, что весь его инференс обслуживается там.

Я бы отделял эту конкуренцию от страха, что провайдер обучится на твоих данных. Использование данных регулируется условиями работы; у Anthropic для коммерческого API уже действует отказ от обучения по умолчанию. Но такой запрет не мешает поставщику самостоятельно выйти на твой рынок. Собственные модели дают больше контроля над себестоимостью и развитием продукта.

И дальше та же история повторяется этажом ниже.

Baseten строит программную платформу поверх чужих облаков: оптимизирует инференс, собирает доступные мощности, обеспечивает отказоустойчивость. По словам Шриваставы, дефицит GPU заставляет компанию двигаться к владению частью оборудования: нужно гарантировать ресурсы под будущую нагрузку клиентов. Вместе с железом появляются расходы на его покупку, риск недозагрузки и устаревания. При дефиците посредник, умеющий находить мощности у разных поставщиков, становится особенно полезным. Но если ты обещаешь клиенту надёжную услугу, в какой-то момент приходится брать под контроль поставку критического ресурса. Через долгосрочную аренду, собственное оборудование или сочетание обоих вариантов.

Получается симметрия: Cursor наращивает контроль над моделями, Baseten — над вычислениями. Масштаб меняет границу между тем, что удобно покупать как услугу, и тем, за что уже приходится отвечать самому. И эту границу полезно пересматривать вместе со счётом за инфраструктуру.

#AI #Architecture #PlatformEngineering #Product #Management

Открыть видео на YouTube

Публичные источники