Обвязка агента становится продуктом
Ведущий выпуска Александр подключается с DotNext и предлагает смотреть на новости системно: долгие агенты, работа с контекстом, наблюдаемость, песочницы, безопасность и экономика всего цикла разработки. Алексей начинает с публичной беты Agents API, которую OpenAI открыла 10 сентября: разработчик задаёт модель, инструменты и среду, а сессии, субагентов и подбор инструментов берёт на себя та же обвязка, что работает в Codex. По его мнению, это снимает большую часть работы, которую команды раньше надстраивали над сырым API. Евгений сравнивает лабораторию, делающую и модель, и обвязку, с Apple, контролирующей железо и софт, а универсальные инструменты вроде OpenCode — с Windows: работает, но усреднённо. Александр добавляет корпоративный довод: собственную обвязку дорого сделать и согласовать, а у купленной есть поставщик, который за неё отвечает. Поэтому самостоятельную сборку всего контура из моделей, железа и инструментов он считает неустойчивой в долгосрочной перспективе.
Спрос на токены растёт вместе с самостоятельностью моделей. Алексей подсчитал, что после выхода GPT-6 Astra для полноценной оркестрации агентов ему понадобилось бы около 600 подписок по $200, то есть порядка $120 тысяч в месяц, поэтому он давно ждёт тарифа с кратно большими лимитами; Евгений пересказывает слухи о подписке Pro Max. Облачные агенты снимают ограничения ноутбука: в чате ChatGPT модель через коннектор к GitHub сама выкачала репозиторий Алексея, запустила тесты и открыла пул-реквест. Александр трактует новые тарифы шире: провайдерам выгодно отделить личное использование от профессионального и приучить людей отдавать работу в облако, чтобы компании потом платили за работу агентов, а не за токены. Звучит и более резкая оценка: у американских лабораторий такая обвязка остаётся едва ли не последним преимуществом перед более быстрыми и дешёвыми китайскими моделями.
Контроль нужен и модели, и процессу
Разговор об облачных агентах выводит на безопасность. Алексей замечает, что сильные модели всё чаще обходят выставленные вокруг них ограничения; по его словам, GPT-6 Astra — первая модель с критическим уровнем киберриска по классификации OpenAI, которую компания выпустила публично. В его пересказе системной карты OpenAI не гарантирует, что цепочка рассуждений отражает то, что модель на самом деле думает, и не всегда может сказать, понимала ли модель, что её тестируют. Приведённый им бенчмарк показывает ещё один разрыв: Fable 5.1 правильно решает 87% задач, но требованиям безопасности отвечают только 37%, у Astra — 82% и 34%. Александр предлагает не ждать от одной модели всех ролей сразу: пусть одна пишет функционально верный код, а другая, как критик, проверяет его на нагрузку и уязвимости. Призывы лабораторий притормозить он и Евгений читают скептически — как попытку бежать группой, в которой каждый ждёт момента для рывка.
Вторая линия выпуска — агент как продакшн-сервис. В разговоре упоминают, что OpenAI показывает в аналитике Codex долю слитых коммитов и активность ревью, предлагая мерить результат, а не токены; GitHub Copilot экспортирует трейсы агентов по OpenTelemetry в корпоративный мониторинг и ограничивает им файлы, сеть и учётные данные; AWS регулирует действия инструментов на уровне объектов. Евгений объясняет, почему DX-платформам трудно: без персональных трейсов, на которые нужны согласия сотрудников, они лишь приблизительно оценивают, во что обошёлся коммит. Александр развивает мысль: провайдер обвязки видит весь путь работы, вплоть до того, прошёл ли код ревью, и сможет продать самый точный отчёт, если компания передаст ему ещё и данные о людях и командах. Один из соведущих добавляет, что потом эти данные могут уйти и в обучение. Алексей сводит месяц к двум потокам: агентов упаковывают в управляемые сервисы, а понимание того, что происходит внутри самых сильных моделей, наоборот, ускользает.
Фронтир дорожает, продакшн дешевеет
Пример второго потока — заявленное OpenAI решение варианта задачи Навье — Стокса из списка задач тысячелетия; по словам Алексея, работу вела внутренняя модель, судя по графикам OpenAI, в разы сильнее GPT-6 Astra. Александр объясняет суть: вопрос в том, может ли описание жидкости уравнениями развалиться в реальных условиях, без бесконечных сил и сингулярностей, а для отрицательного ответа достаточно одного примера. Математики, по его оценке, дошли бы до этого промежуточного результата примерно за год, а OpenAI ускорила финал, бросив на задачу огромный вычислительный ресурс. Евгений считает, что компании стоило бы открыто разделить заслугу с исследователями, на чьих работах построено решение. Александр предостерегает от экстраполяции: мы не видим задач, которые агенты решить не смогли, а в науках с медленной проверкой гипотез, например в биологии, перебор тысяч агентов работает хуже, чем в коде с быстрыми тестами. Отсюда его интерес к эффективности обучения: человеку нужно на порядки меньше примеров.
Прикладная часть выпуска — про экономику. Евгений рассказывает о модели Jeff: она не предсказывает следующий токен, а делает калиброванный выбор из вариантов, скоринг и вероятностные оценки. В его команде её попробовали для классификации при генерации экранов, и генерация, занимавшая 13 секунд, ускорилась примерно на порядок. Алексей описывает простую схему: отдельный агент помнит его прошлые решения, Jeff определяет, новый ли вопрос, и к Алексею эскалируются только новые. Александр напоминает о похожей открытой модели, которую можно дообучить на своих данных. Вывод общий: прототип делают на фронтирной модели, а продакшн — на дешёвой и дообученной, потому что оплата каждого запроса к дорогой модели ломает привычную юнит-экономику. Евгений пересказывает статью AWS о цикле оптимизации промптов по трейсам на Amazon Bedrock AgentCore, а Александр сравнивает такие контуры с Kubernetes и советует не менять их все одновременно. В прогнозах на октябрь — ещё более быстрые модели, дешёвый кэш для долгих задач, догоняющие китайские модели и AI в госуправлении.
Что стоит унести с собой
- 01Прежде чем строить собственную обвязку агентов, сравните её полную стоимость — разработку, согласования, безопасность и ответственность — с готовым слоем провайдера.
- 02Не требуйте от одной модели одновременно скорости, корректности и безопасности: разделите роли автора и проверяющего, а вокруг агента держите песочницу, политики и мониторинг.
- 03Измеряйте работу агентов результатами — слитыми изменениями, прохождением ревью, стоимостью изменения, — а не токенами и заранее решите, какие трейсы готовы собирать и передавать поставщику.
- 04Проверяйте гипотезу на фронтирной модели, но считайте юнит-экономику продакшна: для классификации и выбора из вариантов дешёвая или дообученная модель часто быстрее и не хуже.
Источники
- Русские субтитры YouTube
- Лонгрид подготовки к выпуску
- Запись седьмого выпуска на YouTube