Не сумма модели и обвязки, а производственная система во времени
Формула Agent = Model + Harness полезна как первое приближение, но слишком быстро становится ловушкой. Она выносит за скобки стоимость , реальную среду действий, идентичность, проверку результата и контур обратной связи. В итоге две команды могут купить одну контрольную точку и получить совершенно разный продукт: одна даст модели знакомое изменение, ограниченную оболочку и короткие результаты инструментов, другая — сотню новых схем JSON, шумный контекст и подтверждение каждого безопасного шага.01Слово «стек» звучит слишком статично. Здесь полезнее думать о нескольких контурах управления, которые делят сигналы, но обновляются с разной скоростью. Живой пример такого контура — внутренний агент, который сам ведёт эксперименты над моделями: память прошлых запусков, бюджеты, инструкции на типовые отказы и точки контроля. Разбирал его устройство в канале.Книжный куб · агент, который замыкает цикл ML-экспериментовКнижный куб · как он устроен внутри
У системы минимум шесть слоёв, и каждый отвечает на свой вопрос. В заголовке названы пять осязаемых — железо, модели, обвязка, инструменты и трейсы; шестой слой, проверки и результаты, замыкает контур. Оценка модели описывает способность в заданном бенчмарке. определяет, какой контекст и путь восстановления доступны. Инструменты и превращают намерение в проверяемое изменение. Проверки показывают, пережило ли качество новый выпуск. Трейсы дают материал для диагностики — но ещё не разрешение на обучение.
| Слой | Что входит | Что определяет |
|---|---|---|
| Оборудование и обслуживание | Точность, память, интерконнект, GPU-ядра, кеш, планировщик | Цена и задержка экономически достижимого поведения |
| Модель и дообучение | Веса, SFT/RL, траектории использования инструментов, привычные форматы действий | Способность и поведенческие склонности |
| Обвязка | Контекст, планирование, сжатие, сохранение состояния, изоляция, подтверждения | Как долго и в каком мире действует модель |
| Инструменты и среда | Оболочка, примитивы редактирования, API, MCP, виртуальная машина, идентичность, секреты | Какие последствия вообще доступны агенту |
| Проверки и результаты | Воспроизводимые эпизоды, проверяющие программы, повторные запуски, допуски к выпуску | Можно ли безопасно сравнивать изменения |
| Трейсы и управление | Вызовы, ошибки, задержка, разрешения, итоговое состояние, срок хранения | Как отказ превращается в доказательство |
Внутренний контур живёт днями и неделями: команда меняет описания инструментов, упаковку контекста, бюджеты, маршрутизацию и допуски к выпуску. Внешний — месяцами и годами: дообучение, архитектура обслуживания, ускоритель и сетевая фабрика. Локальный отказ не всегда требует новой модели. Но если один класс ошибок повторяется на тысячах эпизодов, сигнал может подняться выше — в обучение, рантайм или следующее поколение оборудования.
Оборудование задаёт пространство экономически возможных моделей
Ускоритель важен не только числом FLOPS. В Hopper Transformer Engine связывает FP8/FP16 с трансформерами, а NVLink — с ценой коммуникации между GPU. Blackwell развивает уже систему масштаба стойки, а в анонсе Vera Rubin NVIDIA прямо говорит о предельном совместном проектировании: CPU, GPU, , хранение и сеть проектируются как один контур. Числа ускорения и TCO на этих страницах — заявления вендора; сам вектор проектирования наблюдается напрямую.02Мысль не новая: Джефф Дин прямо называет специализацию чипов и разреженные модели условием следующего шага, а история NVIDIA показывает, что AI-инфраструктура — это система систем, где память, сеть и программный слой значат не меньше FLOPS. Пересказывал оба сюжета в канале.Книжный куб · Джефф Дин про путь к нынешнему AIКнижный куб · NVIDIA как система систем
Самый наглядный сдвиг — расхождение обучения и инференса. Google TPU 8t и 8i стали двумя системами: первая оптимизирована под крупное предварительное обучение, вторая — под обслуживание, выборку и длинные рассуждения. Память, встроенная SRAM, сеть и коллективные операции меняются вместе с формой MoE и агентной нагрузки. Для CTO это означает, что тариф «за токен» скрывает решения поставщика о пакетной обработке, кеше, задержке и доступной ёмкости.
При этом полная вертикаль не является единственным путём. DeepSeek-V3 показывает обратное совместное проектирование: команда адаптировала FP8, MoE, балансировку экспертов и среду обучения к доступным H800. Отчёт о часах GPU остаётся самоотчётом, но архитектурная реакция на ограничение задокументирована. Anthropic и Annapurna Labs демонстрируют ещё один вариант — плотный партнёрский контур без владения облачным гиперскейлером.
Модель учится действовать не вообще, а в конкретной среде
Вызов функций проверяет способность сформировать запрос. Реальный агент должен ещё выбрать инструмент, правильно интерпретировать ошибку, продолжить после большого результата, проверить эффект и не расширить свои полномочия. Эти привычки формируются на распределении пространств действий, которое модель видела при дообучении.
Cursor описывает, как неделями адаптирует обвязку к новой модели: моделям OpenAI даёт знакомое редактирование изменениями, моделям Anthropic — замену строк. В отдельном разборе Codex команда меняла названия инструментов, преамбулу, обратную связь линтера и обработку трейса рассуждений, потому что модель была обучена сначала работать через оболочку. Это наблюдения компании, не открытый набор данных A/B, но они хорошо согласуются с природой дообучения.
Обвязка нужна не потому, что модель «недостаточно умна», а потому, что автономная работа требует протокола. Codex App Server включает жизненный цикл и постоянные ветки, конфигурацию и аутентификацию, , MCP и навыки под общей моделью политик. В экспериментах Anthropic с долго работающими агентами одной высокоуровневой подсказки и сжатия оказалось мало: понадобились инициализатор, список функций, артефакты прогресса, история Git и малые итерации.03Мне нравится практическое определение: обвязка — временная теория слабостей текущей модели. Опасно лишь считать эту теорию вечной. Поставщики и сами подают это одной связкой: в анонсе Gemini 3.5 обновлённая обвязка идёт вместе с моделью, а ставка сделана на длинные задачи и подагентов. Разбирал анонс в канале.Книжный куб · Gemini 3.5 и ставка на агентов
По мере роста надёжности ответственность перемещается. Cursor раньше жёстко перепроверял задачу, принудительно выполнял коммит и отправку и отдельно забирал журналы CI. Затем эти действия стали обычными инструментами под управлением модели. Но вокруг более слабого управления компьютером выросли отдельные маршрутизация, подагент и запись экрана. Обвязка не «заканчивается»: она перестаёт контролировать созревшую способность и начинает страховать новую.
Инструменты недостаточно подключить — их нужно спроектировать для поведения
MCP решает важную, но узкую задачу. Спецификация инструментов стандартизует обнаружение, схему и семантику вызова. Она не обещает, что модель видела похожую схему, выберет правильный инструмент среди десятков, получит компактный ответ или выполнит действие с корректной идентичностью.04Подключить инструмент — самая простая часть. Dex Horthy показывает, как каталог инструментов забивает контекст схемами и идентификаторами и загоняет агента в зону деградации, а свежие предложения агентных транспортных протоколов пытаются поднять идентичность и полномочия на уровень самого протокола. Разбирал оба сюжета в канале.Книжный куб · No Vibes Allowed про работу с контекстомКнижный куб · транспортные протоколы для агентов
Большой каталог может оказаться хуже нескольких знакомых примитивов. В кейсе code execution поверх MCP Anthropic показывает цену прямого подключения: схемы занимают контекст, а промежуточные результаты каждый раз проходят через модель. Пример с расшифровкой встречи добавлял около 50 тысяч токенов. Постепенное обнаружение и выполнение кода оставляют большие данные в песочнице, возвращая модели только нужный результат. Это не делает оболочку безопасной автоматически: вместе с композиционностью появляется новая поверхность политик пакетов, сети и секретов.
| Грань | Что зафиксировать | Какой отказ предотвращает |
|---|---|---|
| Граница | Одно действие и отличие от соседних инструментов | Неверный выбор инструмента |
| Результат | Компактный, структурированный, ограниченный | Переполнение контекста и потеря происхождения |
| Ошибки | Стабильный код, причина и допустимое следующее действие | Слепые повторы и зацикливание |
| Полномочия | Идентичность, область доступа, делегирование от имени пользователя (OBO) и невозможность расширить права подсказкой | Действие не от того субъекта или не в той среде |
| Эффект | Идемпотентность либо явная необратимость | Повторное разрушительное действие |
| Проверяемость | Происхождение, воспроизведение и сценарии оценки | Невозможно доказать полученный результат |
Поэтому внутренний инструментальный шлюз — не вспомогательный инфраструктурный проект. Это поведенческий продукт платформенной команды. Его преимущество находится не в числе подключённых серверов, а в качестве контрактов и в данных о том, как агенты ошибаются при выборе, аргументах, отказе и восстановлении.
Трейсы замыкают цикл — но не дают автоматического права обучать
Слово «трейс» часто используют как сокращение для магического самоулучшения. Полезнее развести четыре режима. Инфраструктурная телеметрия оптимизирует обслуживание и таймауты. Продуктовая телеметрия показывает ошибки выбора инструментов, остановки из-за прав и сбои сжатия. Оценка результата связывает эпизод с тестами, слиянием, откатом или пользовательской коррекцией. Траектория обучения — специально отобранный и разрешённый прогон политики с наградой или проверяющей программой.
Различие между траекторией и итогом принципиально. В методике Anthropic расшифровка — это последовательность шагов, а результат — состояние среды после работы. τ-bench добавляет надёжность серии прогонов: единичный успех не доказывает стабильность. GitHub отдельно проверяет выбор инструментов и аргументов MCP Server, а Databricks связывает сценарии, похожие на рабочие, трейсы и регрессионные допуски. Всё это улучшает систему без изменения весов.
Даже если поставщик обучает модель в реалистичной среде, нельзя автоматически приписывать обучение всем клиентским сессиям. Cursor Privacy Mode запрещает использование клиентских данных для обучения; Anthropic отделяет коммерческие сессии от программ с явным согласием (снимок политик на июль 2026 года), а OpenAI по умолчанию не обучается на входах и выходах корпоративного API. Наблюдаемость, использование для оценки и обучение модели требуют разных политик, сроков хранения и правовых оснований.05Самая дорогая зависимость от поставщика часто живёт не в API модели, а в закрытом формате эпизодов и результатов, которые нельзя воспроизвести у другого поставщика. А настройки по умолчанию меняются на ходу: с апреля 2026 GitHub может брать данные взаимодействия с Copilot на личных тарифах Free, Pro и Pro+ для обучения моделей, пока это не отключено вручную; корпоративных аккаунтов это не касается. Разбирал этот сдвиг в канале.Книжный куб · GitHub учит модели на данных взаимодействия
рабочий отказ → трейс + итоговое состояние → воспроизводимая проверка → изменение обвязки, инструмента или модели → повторный допуск → управляемый запуск
Общая схема телеметрии, например развивающиеся OpenTelemetry GenAI conventions, снижает стоимость экспорта. Но формат полей не определяет срок хранения, очистку и право обучения. Эти решения остаются у владельца системы.
Полураспад обвязки: сильная метафора, слабая метрика
Моя исходная гипотеза при старте исследования звучала провокационно: за 180 ± 60 дней половина значимой обвязки становится не нужна, заменяется или удаляется. Проверять её по текучести строк нельзя: большая разница интерфейса не обязательно меняет поведение агента. Поэтому в исследовании были зафиксированы десять механизмов — контекст, сжатие, планирование, редактирование, политики, обнаружение, изоляция, сохранение состояния, оркестрация и телеметрия с проверками — и просмотрена публичная история с 23 января по 23 июля 2026 года Codex, Gemini CLI и OpenCode. Строгой заменой считался только вывод прежнего основного поведенческого пути; флаг возможности, параллельная реализация, узкое удаление или путь чтения старого формата этого порога не проходят.
Реестр изменений даёт одинаковый счёт — 3/10 строгих замен в каждом проекте, — но не одинаковый набор. У Codex это контекст, редактирование и политики; у Gemini CLI — политики, сохранение состояния и оркестрация; у OpenCode — сжатие, сохранение состояния и объединённая ячейка телеметрии с проверками. Итого зелёных ячеек девять из тридцати, а два независимых проекта с доказанными ≥ 5/10 по-прежнему не нашлись.
Что именно было заменено
Здесь «было → стало» относится к основному исполняемому пути, а не к переименованию типа или перестановке файлов. Ссылки ведут на PR, в которых видны миграция потребителей и удаление прежней реализации.
| Проект | Механизм | Было → стало | Первичные источники |
|---|---|---|---|
| Codex | Контекст | Раздельные EnvironmentContext и пути базовой линии → единый WorldState/EnvironmentsState с общими рендерером и базовой линией | #29249 |
| Codex | Редактирование | JSON/function-вариант apply_patch → только custom/freeform apply_patch | #21687#21651 |
| Codex | Политики | Устаревший exec-policy рядом с новым движком → только новый exec-policy | #10851#32093 |
| Gemini CLI | Политики | Императивное скрытие инструментов плана и жёсткое ASK_USER → DENY → декларативные правила PolicyEngine | #20596#23668 |
| Gemini CLI | Сохранение состояния | Перезапись монолитного JSON сеанса → дописываемый JSONL; старый JSON только мигрирует при возобновлении | #23749 |
| Gemini CLI | Оркестрация | Устаревшие планировщики React/Core → единый событийный Scheduler | #18567#23502 |
| OpenCode | Сжатие | Одноразовая сводка всей активной истории → обновляемая опорная сводка старой истории + недавние ходы дословно | #23870#27145 |
| OpenCode | Сохранение состояния | JSON-файлы Project/Session/Message/Part/Todo → рабочее хранилище SQLite/Drizzle; импортёр JSON затем удалён | #10597#30461 |
| OpenCode | Телеметрия и проверки | Самописный журнал + отдельная обвязка CLI/OTEL → единый слой наблюдаемости Effect logging/OTLP | #31310 |
Синие ячейки тоже обозначают содержательные изменения. Например, в Codex новый контур сжатия стал основным, но старые удалённый и локальный пути оставались; в Gemini CLI JIT-загрузка контекста сосуществовала с предварительной загрузкой; в OpenCode движок поиска успел перейти с нативного rg на WASM и вернуться обратно. Серый знак у планирования OpenCode означает, что найдены рефакторинг и исправление безопасности, но недостаточно данных даже для уверенной перенастройки механизма. Наконец, зелёная ячейка OpenCode «телеметрия и проверки» подтверждает замену именно пути телеметрии; отдельную замену исполнителя проверок она не доказывает.
Погрешность здесь эпистемическая, а не статистическая. История Git не всегда показывает долю постепенного развертывания, его статус и роль фича флагов. Молодость проектов тоже увеличивает видимый темп. Зато стратегический вывод устойчив: собственная общая обвязка — не одноразовая сборка, а бессрочная программа совместимости.
Концентрация создаёт несколько контуров, а не одного победителя
Интеграция ускоряет обратную связь. Команда, которая одновременно видит поведение модели, продуктовые трейсы и результат, быстрее связывает регрессию с нужным слоем. Высокая стоимость обучения передовых моделей, песочниц для нескольких операционных систем, ферм эвалов и корпоративного усиливает эффект масштаба. Это повышает концентрацию внутри отдельных контуров, но не означает победу одной компании, владеющей всем.
Четыре способа замкнуть короткий цикл
- Google связывает TPU, сеть, компилятор, модель, облако и распространение — это полная вертикаль от оборудования до продукта.
- Anthropic владеет моделью и обвязкой, а совместное проектирование оборудования строит как партнёрство с AWS.
- Cursor начал с рабочего процесса разработчика и распространения, накопил трейсы и проверки, затем добавил собственное дообучение и модельный слой.
- OpenAI строит гибридную партнёрскую вертикаль: Stargate связывает лабораторию с облаками, дата-центрами, энергетикой и капиталом, а совместная работа с Broadcom добавляет спроектированные OpenAI ускорители и сетевые системы. Компания не владеет каждым физическим слоем, но задаёт архитектуру контура и переносит знания о моделях и продуктах в железо.
Китайский путь: национальный контур на собственном железе
Китайский сдвиг к собственному железу переносит короткий цикл на уровень национальной технологической экосистемы. Авторы Pangu Ultra сообщают о предварительном обучении плотной модели со 135 млрд параметров на 13,2 трлн токенов с использованием 8192 NPU Ascend. В плане развития Huawei Ascend 950PR специализируется на предварительном заполнении кеша и рекомендациях, а Ascend 950DT — на декодировании и обучении. Вокруг них совместно развиваются интерконнект, форматы низкой точности, CANN, инструменты и openPangu. Это уже проверяемый пример обучения крупной модели на китайском стеке, но не доказательство того, что весь китайский рынок отказался от NVIDIA.
С DeepSeek V4 доказательная граница тоньше. В официальном анонсе DeepSeek называет 1,6 трлн общих и 49 млрд активных параметров у V4-Pro, а также 284 млрд общих и 13 млрд активных параметров у V4-Flash, но не раскрывает железо базового предварительного обучения. Зато исследование SLAI T-Rex документирует дообучение семейства V4 с обновлением всех параметров на Ascend NPU SuperPOD: авторы сообщают о 34,22% MFU и 2,93-кратном улучшении относительно открытой базовой конфигурации, а для V4-Flash описывают продолженное предварительное обучение и SFT. Это уже подтверждённое обучение модели триллионного масштаба на Ascend, но не доказательство того, что базовую V4 обучили на этих ускорителях с нуля.
В 2026 году положение больших китайских лабораторий нельзя свести ни к абсолютному запрету на NVIDIA, ни к простому нежеланию её покупать. BIS перевело заявки на H200 в индивидуальный режим рассмотрения, но сама NVIDIA сообщила, что получила разрешение лишь на небольшие объёмы для отдельных клиентов, не получила по программе выручки и фактически была вытеснена с китайского рынка вычислений для дата-центров. Одновременно выбор части лабораторий становится стратегическим: по данным Reuters, DeepSeek дала китайским производителям несколько недель раннего доступа к V4 для оптимизации, но не сделала этого для NVIDIA и AMD. После выпуска модели Reuters также сообщило о новых запросах ByteDance, Tencent и Alibaba на Ascend 950 при дефиците поставок до их масштабирования во второй половине 2026 года. Компании публично эти закупочные переговоры не подтвердили, поэтому это снимок рынка по источникам агентства, а не официальный отказ всех больших китайских лабораторий от NVIDIA.
Контрсилы: открытые модели и маршрутизация
Вертикальная интеграция — не единственная сила. Открытые веса DeepSeek, Qwen и GLM снижают барьер смены поставщика. Qwen Code и OpenCode выносят интерфейс сессии, разрешения и часть инструментов из-под контроля одной лаборатории. MCP и совместимые API уменьшают стоимость интеграции. RouteLLM формализует выбор между сильной дорогой и более дешёвой моделью, а OpenRouter Auto Router превращает тот же принцип в продукт: определяет тип задачи, выбирает модель из разрешённого набора, учитывает баланс цены и качества и сохраняет резервные маршруты. Это не воспроизведение конкретного алгоритма RouteLLM, а реализация той же архитектурной идеи поверх моделей разных поставщиков. Корпоративная среда при этом может быть настолько специфична, что универсальный поставщик не видит ни полномочий, ни конечного результата.06Марк Андреессен смотрит на ту же картину с другой стороны: горстка больших моделей наверху, каскад дешёвых снизу, открытые веса из Китая и продукты, которые крутят десятки моделей одновременно. Разбирал его прогноз в канале.Книжный куб · прогноз Андреессена про Китай и цену AI
Поэтому более вероятны несколько экосистем с собственными быстрыми путями, чем единый универсальный рантайм. Преимущество возникает там, где организация контролирует несколько соседних слоёв и имеет канал доказательств между ними. Полное владение — лишь один из вариантов.
Граница для CTO: арендовать, адаптировать, оставить своим
Решение полезнее проводить не по логотипам поставщиков, а по двум осям: скорость изменения и уникальность для компании. Возможности передовых моделей меняются быстро и редко являются корпоративной спецификой. Идентичность, политики, доменные контракты действий и принятые результаты, наоборот, медленнее устаревают и определяют, что система вообще имеет право считать успехом.
| Режим | Что относится | Почему |
|---|---|---|
| Арендовать | Передовые модели, общая обвязка, типовое исполнение | Редко уникально; быстро меняется и требует масштаба |
| Адаптировать | Адаптеры моделей и инструментов, упаковка контекста, маршрутизация, бюджеты, сжатие | На стыке встречаются поведение поставщика и локальная среда |
| Оставить своим | Идентичность, политика, контракты инструментов, набор проверок, результаты, управление трейсами | Это уникальное знание, полномочия и основа переносимости |
Что не стоит строить по умолчанию
- ещё один общий цикл агента разработки только ради смены конечной точки API;
- собственное сжатие или оркестрация без регрессионного набора на реальных эпизодах;
- каталог сотен MCP-инструментов без владельцев, ограничений ответа и телеметрии выбора;
- «самообучение», в котором рабочие журналы автоматически считаются разрешёнными данными для обучения;
- шлюз, приводящий всех поставщиков к общему минимуму и скрывающий их сильные стороны;
- форк обвязки с открытым кодом без команды, отвечающей за слияние вышестоящих изменений, безопасность и совместимость с моделями.
Собственная обвязка оправдана, когда одновременно сходятся несколько условий: уникальная среда действий, суверенность или экстремальные ограничения задержки, достаточный объём, зрелые проверки и готовность поддерживать быстрые пути для конкретных моделей. Самое сильное условие — возможности агента являются частью внешнего продукта и стратегического преимущества. Наличия талантливой платформенной команды самого по себе недостаточно.07Похожий вывод я делал про платформу разработки: как только агенты входят в основной поток, проверки кода, безопасность, политики и телеметрия перестают быть внешней обвязкой и становятся частью вычислительного пути. Писал об этом отдельно.Книжный куб · от AI-native разработки к AI-native платформе
Практический контур: от отказа к управляемому выпуску
Перенести идею совместного проектирования в компанию можно без собственного ускорителя и базовой модели. Нужно замкнуть тот участок цикла, который компания действительно контролирует: её задачи, полномочия, инструменты, итоговые состояния и решение о запуске.
Минимальная программа на один квартал
- 01Выбрать 20–30 реальных эпизодов. Зафиксировать чистое исходное состояние, контракт задачи, допустимые инструменты и проверяемый результат.
- 02Разделить режимы трейсов. Отдельно определить рабочую телеметрию, проверку человеком, использование для оценки и допустимые траектории обучения.
- 03Инвентаризировать контракты действий. Для каждого критичного инструмента записать идентичность, область доступа, идемпотентность, ограничение ответа, происхождение и владельца.
- 04Собрать независимое от поставщика воспроизведение. Хранить эпизод, версию среды, версии модели, обвязки и инструментов и доказательство итогового состояния в переносимом формате.
- 05Ввести повторные допуски к выпуску. Сравнивать не один удачный запуск, а качество, дисперсию, стоимость, безопасность и приёмку человеком. Метрика самого контура — медианное время пути «обнаруженный класс отказа → изменение, прошедшее допуск → выпуск».
- 06Тестировать слой, а не бренд. При регрессии менять описание инструмента, контекст, политику, маршрутизацию или модель только через контролируемый эксперимент.
В этом контуре поставщик приносит быстро меняющуюся возможность, а компания сохраняет право выпуска. Новая модель может быть дешевле и сильнее в публичном бенчмарке — рабочий запуск всё равно проходит через внутренние эпизоды, проверки политик и сравнение принятых результатов. Это и есть практическая защита одновременно от технической и доказательной зависимости от поставщика.08Про это же был мой доклад «State of AI4SDLC»: внедрение AI — изменение производственной системы разработки, а не закупка инструмента, и цепочка «замысел → контекст → план → проверка» говорит о результате больше, чем метрики использования. Запись выкладывал в канале.Книжный куб · доклад State of AI4SDLC
Здесь же обретает содержание «план выхода» из выводов — это не пункт декларации, а три практики поверх той же программы. Первая — следить за окнами депрекации поставщика: объявленные даты вывода моделей и API из эксплуатации задают крайний срок перепроверки стека. Вторая — независимое воспроизведение прогонов, и здесь стоит снять двусмысленность шага 04: после вывода закрытого чекпоинта из эксплуатации точная репродукция записанной траектории невозможна, поэтому воспроизведение означает повторный эвал — прогон тех же эпизодов на новой конфигурации и сравнение итоговых состояний с сохранённым доказательством. Третья — репетиция замены базовой модели как регулярное учение; как такое учение устроено, разобрано в лонгриде «Сквозной игрок без своего железа».
У финального тезиса есть честный контраргумент. Если скачок способности следующей модели перекрывает всю накопленную выгоду контура, а инструменты эвалов коммодитизируются, то скорость контура — гигиена, доступная каждому, а не преимущество. Ответ в том, что контур не соревнуется с моделью. Он определяет, как быстро именно новая модель безопасно оказывается в рабочей среде: скачок способности всё равно проходит через внутренние эпизоды, политики и допуски к выпуску, и выигрывает та организация, которой на это нужны дни, а не кварталы. А уникальным остаётся то, что не поставляется вместе с чекпоинтом: собственные эпизоды, полномочия и трейсы.
Что стоит унести с собой
- 01Качество AI-агента — свойство конкретной рабочей конфигурации «модель × обвязка × инструменты × среда» во времени, а не постоянная оценка одной модели.
- 02MCP и совместимый API снижают стоимость подключения, но не гарантируют знакомое модели поведение, качественное восстановление или богатую семантику сессии.
- 03За полугодовое окно Git-аудит нашёл по три строгие замены из десяти в Codex, Gemini CLI и OpenCode, но в разных механизмах — не половину обвязки.
- 04Рабочий трейс, эпизод оценки и траектория обучения — разные режимы данных; право наблюдать не создаёт автоматически права обучать.
- 05Компании выгодно арендовать быстро меняющуюся общую способность, адаптировать стык и владеть полномочиями, контрактами, результатами, проверками и планом выхода.
Первичные материалы, исследования и документация
Прочие источники
- NVIDIA · Hopper ArchitectureTransformer Engine, FP8/FP16 и NVLink; показатели производительности — данные вендора
- NVIDIA · Blackwell Architecturerack-scale co-design, precision и интерконнект
- NVIDIA · Vera Rubin platformанонс extreme codesign; относительная экономика — заявление компании
- Google Cloud · TPU 8t and TPU 8i technical deep diveразделение систем для pretraining и инференса/рассуждений
- Google Cloud · Ironwood TPUs and Axion VMsсовместное проектирование кремния, систем и программного обеспечения
- THUDM / Z.ai · slimeоткрытый фреймворк обучения с подкреплением: прогоны политики, инструменты, отклик песочницы и награды проверяющей программы
- Model Context Protocol · Tools specificationнормативный контракт discovery, schemas и calls
- GitHub · Offline evaluation of GitHub MCP Serverпроверка выбора инструментов и аргументов до выпуска
- Databricks · coSTARсценарии, приближенные к рабочим, трейсы и регрессионные ворота; результаты — самоотчёт
- OpenTelemetry · GenAI semantic conventionsполя телеметрии агента, инструментов и эвалов, предупреждения о чувствительных данных
- Google · Gemini CLI repositoryпубличная история механизмов контекста, политик, сохранения состояния и подагентов
- Anomaly · OpenCode repositoryпубличная история обвязки, не зависящей от модели, и миграций на v2
- Huawei · Ascend and SuperPoD roadmapспециализация Ascend 950PR/950DT и развитие CANN/openPangu; показатели и сроки — заявления вендора
- U.S. BIS · H200 export licensing policy for Chinaиндивидуальное рассмотрение лицензий на H200 с января 2026 года
- NVIDIA · FY2026 Form 10-Kразрешения на небольшие объёмы H200, отсутствие выручки и фактическое вытеснение с китайского рынка
- OpenRouter · Auto Routerпродуктовая маршрутизация по типу задачи, цене и качеству с резервными маршрутами
Обвязки и модели
- DeepSeek · DeepSeek-V3 repository and reportFP8, MoE и адаптация training framework к H800; затраты — самоотчёт команды
- Anthropic · Expanding our use of AWS Trainiumпример партнёрского совместного проектирования оборудования и модели
- OpenAI · Unlocking the Codex harnessосновной цикл, сохранение состояния, песочница, MCP и границы семантики сессии
- OpenAI · Harness engineeringчитаемые агентом леса и контуры обратной связи; прирост производительности — самооценка компании
- Anthropic · Effective harnesses for long-running agentsинициализатор, артефакты прогресса, список возможностей и малые итерации
- Anthropic · Harness design for long-running appsпланирование, проверка и передача состояния между окнами контекста
- Anthropic · Effective context engineering for AI agentsсжатие, структурированные заметки, подагенты и извлечение по требованию
- Anthropic · Claude Code sandboxingсвязь изоляции и автономности; сокращение запросов на подтверждение — внутреннее измерение
- Cursor · Continually improving our agent harnessмногонедельная адаптация под модели и различия edit primitives
- Cursor · Improving the harness for OpenAI Codex modelsприоритет оболочки, именование инструментов и обратная связь линтера
- Cursor · What we’ve learned building cloud agentsперенос процедурной логики из обвязки в инструменты, доступные модели
- Cursor · Composer 2 technical reportобучение с подкреплением в сессиях, приближенных к рабочим, и собственный контур эвалов; бенчмарки — заявления компании
- Cursor · Self-summarizationобучение модели работать со сжатием внутри цикла обучения
- Cursor · Data Use & Privacy OverviewPrivacy Mode, ZDR и границы допустимого использования данных
- Alibaba Qwen · Qwen3-Coderобучение с подкреплением на длинном горизонте и 20 тысяч окружений — заявление команды
- Alibaba Qwen · Qwen Codeоткрытая обвязка для нескольких поставщиков с предпочтительным быстрым путём для Qwen
- Anthropic · Code execution with MCPprogressive discovery и обработка больших промежуточных данных вне контекста модели
- Anthropic · Writing tools for agentsвлияние имён, описаний, схем и формы ответа на поведение агента
- Anthropic · Demystifying evals for AI agentsразличие транскрипта, трейса и результата, оценивающие программы и обвязка эвалов
- Anthropic Privacy Center · Model training data policyграницы использования коммерческих чатов и сессий работы с кодом
- OpenAI Help Center · How data is used to improve model performanceразличие пользовательских настроек и корпоративных умолчаний без обучения на данных
- OpenAI · Codex repositoryпубличная история изменений обвязки для проверки темпа
- OpenAI · Building the compute infrastructure for the Intelligence AgeStargate как партнёрская инфраструктурная экосистема и контур реинвестирования
- OpenAI and Broadcom · OpenAI-designed AI acceleratorsпланы совместной разработки ускорителей и сетевых систем; сроки и масштаб — заявления компаний
- DeepSeek · DeepSeek V4 Preview Releaseофициальные размеры V4-Pro и V4-Flash; железо базового предварительного обучения не указано
- Reuters · DeepSeek V4 early access for domestic chipmakersперепечатка сообщения Reuters о раннем доступе Huawei и исключении NVIDIA/AMD из предрелизной оптимизации со ссылкой на неназванные источники
- Reuters · Demand for Ascend 950 after DeepSeek V4перепечатка сообщения Reuters: запросы ByteDance, Tencent и Alibaba и дефицит поставок до второй половины 2026 года со ссылкой на неназванные источники
Исследования
- Cottier et al. · The rising costs of training frontier AI modelsисторические оценки и сценарии стоимости обучения передовых моделей
- Wang et al. · Executable Code Actions Elicit Better LLM Agentsисследование кода как композиционного action space
- Yao et al. · τ-benchнадёжность агентов с инструментами по повторным прогонам и конечному состоянию
- Yin et al. · Pangu Ultra on Ascend NPUsпредварительное обучение плотной модели со 135 млрд параметров на 13,2 трлн токенов и 8192 NPU Ascend
- Li et al. · SLAI T-Rex on Ascend SuperPODдообучение семейства DeepSeek V4 с обновлением всех параметров, MFU и контур CPT/SFT на Ascend
- Ong et al. · RouteLLMмаршрутизация между сильными и дешёвыми моделями как контрпример single-provider подходу