Stanford MS&E435: Yash Patil про внутреннее знание компании как learning loop (Рубрика #AI)
В обзоре Stanford MS&E435 я писал, что курс даёт хорошую карту экономики AI, но инженерам может не хватить глубины. На встрече с Yash Patil глубина как раз появляется: он не останавливается на «подключим модель к документам компании», а показывает, как внутреннее экспертное суждение превратить в eval, reward и post-training.
Патил — основатель и CEO Applied Compute. До своего стартапа он работал в OpenAI; по его рассказу, начал с post-training и evals, а затем перешёл к длинным агентным задачам. Технический опыт подтверждается не только его словами со сцены: OpenAI указывает Патила среди research contributors GPT-4.1 и Deep Research, а руководитель Deep Research Иса Фулфорд рассказывала, что раннюю работу над browsing-agent она начинала вместе с ним.
То есть механику обучения моделей он знает изнутри. Но перед нами не нейтральный академический обзор: Applied Compute продаёт компаниям ровно то, о чём говорит Патил, — post-training, специализированные модели и их дальнейшее улучшение. Я бы воспринимал его как сильного оператора со skin in the game, а не как отраслевого оракула.
💡 Главный тезис лекции: следующее узкое место — continual learning, способность системы учиться по редкой обратной связи из production. Код и математика первыми выиграли от reasoning-моделей не случайно. Там уже есть проверяемая награда: код можно скомпилировать и прогнать через тесты, ответ по математике — проверить. В большинстве корпоративных задач готового verifier нет. Более того, JP Morgan и Goldman Sachs могут считать хорошим результатом разные вещи.
Поэтому внутреннее преимущество компании не сводится к весам, документам или RAG. Патил отдельно подчёркивает, что model, harness и context работают вместе. Но накопительным активом становится контур:
реальные задачи и ошибки → экспертные исправления → eval и grader → reward → post-training → production feedback → следующая итерация
Патил удачно формулирует: eval определяет холм, на который затем карабкается RL. Если организация не умеет явно описать качество, выделить дорогие ошибки и согласовать спорные edge cases, модель будет оптимизировать удобный proxy. И может очень успешно забраться не на тот холм.
Практическое следствие мне нравится своей приземлённостью. Прежде чем решать, нужна ли компании собственная модель, стоит выбрать частую и экономически заметную задачу, собрать реальные сбои и решения экспертов, сделать held-out eval и проверить grader. После этого уже видно, хватает ли prompt + context + tools или выигрыш от post-training окупит отдельный model lifecycle.
В лекции есть два показательных кейса 1️⃣ В совместном материале Applied Compute и DoorDash заявлено примерно 30% относительного снижения доли низкокачественных меню после human validation и production A/B-теста; систему развернули на всём потоке меню в США. 2️⃣ По отчёту Cognition, специализированный SWE-Check сравнялся с Opus 4.6 на внутреннем in-distribution eval и работал примерно в десять раз быстрее. Но на полностью отложенном out-of-distribution наборе он всё ещё уступал Это хорошие аргументы за специализацию узкой, частой и измеримой задачи, но не доказательство, что каждой компании срочно нужен собственный checkpoint модели.
Поэтому моя калибровка такая: Патилу я бы уверенно верил в вопросах evals, graders, reward design и post-training. Осторожнее — в прогнозах, что continual learning станет следующим главным фронтиром, а специализированные модели понадобятся почти всем. Самый устойчивый отрыв от конкурентов здесь, кажется, не конкретные веса: следующая frontier-модель может быстро их догнать. Защитный ров (moat) — это накопительный learning loop, который снова и снова превращает работу и ошибки компании в улучшение системы.
Если времени мало: 03:43–05:38 — опыт Патила 23:56–35:20 — evals и два прикладных кейса 35:51–40:05 — continual learning и production feedback
#AI #Agents #Evals #Engineering #Management #AI4SDLC
Публичные источники
- Stanford Online: MS&E435 — Enterprise Internal Knowledge с Yash Patil
- Stanford MS&E435: расписание и материалы курса
- OpenAI: GPT-4.1 — список участников исследования
- OpenAI: Deep Research — список участников исследования
- Sequoia Capital: Иса Фулфорд об истории создания Deep Research
- Applied Compute: совместный кейс с DoorDash
- Cognition: SWE-Check, специализированная модель поиска ошибок
- Applied Compute: позиция компании о специализированных моделях
- Книжный куб: обзор курса Stanford MS&E435
- Книжный куб: Ю Су про continual learning и экспертизу