К основному содержимому
ко всем лонгридам
Лонгрид#AI4SDLC#PlatformEngineering

AI-разработка как совместно эволюционирующий стек: железо, модели, обвязка, инструменты и трейсы

Пока мы сравниваем модели, реальное преимущество всё чаще возникает между слоями: оборудование меняет экономику архитектуры, дообучение формирует привычную среду действий, обвязка собирает мир для модели, инструменты дают полномочия, а трейсы и проверяемые результаты запускают следующий цикл. Выигрывает не самый сильный компонент, а система, которая быстрее превращает реальный сбой в безопасное улучшение.

23 июля 2026≈ 21 минута

Материал основан на исследовательском досье, проверенном 23 июля 2026 года. Характеристики новых систем, бенчмарки и эффекты, опубликованные самими компаниями, обозначены как заявления поставщиков. Публичная история обвязок с открытым кодом показывает изменения кода, но не всегда раскрывает этап внедрения и состояние в рабочей среде.

01

Не сумма модели и обвязки, а производственная система во времени

Формула Agent = Model + Harness полезна как первое приближение, но слишком быстро становится ловушкой. Она выносит за скобки стоимость , реальную среду действий, идентичность, проверку результата и контур обратной связи. В итоге две команды могут купить одну контрольную точку и получить совершенно разный продукт: одна даст модели знакомое изменение, ограниченную оболочку и короткие результаты инструментов, другая — сотню новых схем JSON, шумный контекст и подтверждение каждого безопасного шага.

схема 01 · замкнутый контур совместно эволюционирующего стека
Совместно эволюционирующий стек AI-разработкиОБОРУДОВАНИЕпамять · сетьМОДЕЛЬpost-trainingОБВЯЗКАконтекст · политикаИНСТРУМЕНТЫ + СРЕДАдействия · результатыEVALSreplay · gatesТРЕЙСЫсбои · сигналыMOATскорость циклаТекущая оценка быстро стареет; устойчивее способность учиться через границы слоёв

У системы минимум шесть слоёв, и каждый отвечает на свой вопрос. В заголовке названы пять осязаемых — железо, модели, обвязка, инструменты и трейсы; шестой слой, проверки и результаты, замыкает контур. Оценка модели описывает способность в заданном бенчмарке. определяет, какой контекст и путь восстановления доступны. Инструменты и превращают намерение в проверяемое изменение. Проверки показывают, пережило ли качество новый выпуск. Трейсы дают материал для диагностики — но ещё не разрешение на обучение.

Слой
Оборудование и обслуживание
Что входит
Точность, память, интерконнект, GPU-ядра, кеш, планировщик
Что определяет
Цена и задержка экономически достижимого поведения
Слой
Модель и дообучение
Что входит
Веса, SFT/RL, траектории использования инструментов, привычные форматы действий
Что определяет
Способность и поведенческие склонности
Слой
Обвязка
Что входит
Контекст, планирование, сжатие, сохранение состояния, изоляция, подтверждения
Что определяет
Как долго и в каком мире действует модель
Слой
Инструменты и среда
Что входит
Оболочка, примитивы редактирования, API, MCP, виртуальная машина, идентичность, секреты
Что определяет
Какие последствия вообще доступны агенту
Слой
Проверки и результаты
Что входит
Воспроизводимые эпизоды, проверяющие программы, повторные запуски, допуски к выпуску
Что определяет
Можно ли безопасно сравнивать изменения
Слой
Трейсы и управление
Что входит
Вызовы, ошибки, задержка, разрешения, итоговое состояние, срок хранения
Что определяет
Как отказ превращается в доказательство
схема 02 · быстрый и медленный контуры делят одни доказательства
Два темпа внутри одного контура улучшенийОТ СИГНАЛА ДО ВЫПУСКА · ДВА ПУТИ ИЗМЕНЕНИЙ1 · СИГНАЛ ИЗ ПРОДАтрейс · сбойрезультат2 · ГДЕ ЧИНИТЬ?локальноили в основе3 · МЕДЛЕННО · МЕСЯЦЫ / ГОДЫдообучение · рантаймGPU · память · сеть3 · БЫСТРО · ДНИ / НЕДЕЛИинструменты · подсказки · контекстполитика · маршрутизация · допуски4 · ВЫПУСКпроверки · канарейкановые сигналыЭСКАЛАЦИЯ, ЕСЛИ КЛАСС СБОЯПОВТОРЯЕТСЯ ВО МНОГИХ ЭПИЗОДАХНОВЫЕ ТРЕЙСЫ И РЕЗУЛЬТАТЫ ЗАПУСКАЮТ СЛЕДУЮЩИЙ ЦИКЛЧитайте слева направо: большинство сигналов идёт быстро, повторяющийся класс сбоев поднимается выше

Внутренний контур живёт днями и неделями: команда меняет описания инструментов, упаковку контекста, бюджеты, маршрутизацию и допуски к выпуску. Внешний — месяцами и годами: дообучение, архитектура обслуживания, ускоритель и сетевая фабрика. Локальный отказ не всегда требует новой модели. Но если один класс ошибок повторяется на тысячах эпизодов, сигнал может подняться выше — в обучение, рантайм или следующее поколение оборудования.

02

Оборудование задаёт пространство экономически возможных моделей

Ускоритель важен не только числом FLOPS. В Hopper Transformer Engine связывает FP8/FP16 с трансформерами, а NVLink — с ценой коммуникации между GPU. Blackwell развивает уже систему масштаба стойки, а в анонсе Vera Rubin NVIDIA прямо говорит о предельном совместном проектировании: CPU, GPU, , хранение и сеть проектируются как один контур. Числа ускорения и TCO на этих страницах — заявления вендора; сам вектор проектирования наблюдается напрямую.

Самый наглядный сдвиг — расхождение обучения и инференса. Google TPU 8t и 8i стали двумя системами: первая оптимизирована под крупное предварительное обучение, вторая — под обслуживание, выборку и длинные рассуждения. Память, встроенная SRAM, сеть и коллективные операции меняются вместе с формой MoE и агентной нагрузки. Для CTO это означает, что тариф «за токен» скрывает решения поставщика о пакетной обработке, кеше, задержке и доступной ёмкости.

схема 03 · точность, память и сеть меняют относительную цену архитектур
Оборудование задаёт экономически достижимое пространство моделейТОЧНОСТЬHBM / SRAMИНТЕРКОННЕКТSTORAGEЭКОНОМИЧЕСКИДОСТИЖИМОЕПРОСТРАНСТВОDENSE ↔ MoEтрафик экспертовКОНТЕКСТKV cacheBATCHlatencyTRAIN ↔ SERVEразные системыЖелезо не диктует одну модель — оно меняет относительную цену архитектурных решений

При этом полная вертикаль не является единственным путём. DeepSeek-V3 показывает обратное совместное проектирование: команда адаптировала FP8, MoE, балансировку экспертов и среду обучения к доступным H800. Отчёт о часах GPU остаётся самоотчётом, но архитектурная реакция на ограничение задокументирована. Anthropic и Annapurna Labs демонстрируют ещё один вариант — плотный партнёрский контур без владения облачным гиперскейлером.

03

Модель учится действовать не вообще, а в конкретной среде

Вызов функций проверяет способность сформировать запрос. Реальный агент должен ещё выбрать инструмент, правильно интерпретировать ошибку, продолжить после большого результата, проверить эффект и не расширить свои полномочия. Эти привычки формируются на распределении пространств действий, которое модель видела при дообучении.

Cursor описывает, как неделями адаптирует обвязку к новой модели: моделям OpenAI даёт знакомое редактирование изменениями, моделям Anthropic — замену строк. В отдельном разборе Codex команда меняла названия инструментов, преамбулу, обратную связь линтера и обработку трейса рассуждений, потому что модель была обучена сначала работать через оболочку. Это наблюдения компании, не открытый набор данных A/B, но они хорошо согласуются с природой дообучения.

схема 04 · API-совместимость не гарантирует поведенческую совместимость
Одна контрольная точка по-разному ведёт себя в разных пространствах действийОДНА МОДЕЛЬcheckpointЗНАКОМАЯ СРЕДА ДЕЙСТВИЙизменение · оболочка · знакомые ошибкиНЕЗНАКОМАЯ СХЕМАновые имена · шумный результатКОРОЧЕ ПУТЬпонятное восстановлениеБОЛЬШЕ РАССУЖДЕНИЙбольше сбоевAPI-совместимость ≠ поведенческая совместимостьЗнакомство с инструментом — часть поведения после дообучения, а не свойство одной схемы JSON

Обвязка нужна не потому, что модель «недостаточно умна», а потому, что автономная работа требует протокола. Codex App Server включает жизненный цикл и постоянные ветки, конфигурацию и аутентификацию, , MCP и навыки под общей моделью политик. В экспериментах Anthropic с долго работающими агентами одной высокоуровневой подсказки и сжатия оказалось мало: понадобились инициализатор, список функций, артефакты прогресса, история Git и малые итерации.

схема 05 · процедурная логика переезжает, а новый каркас появляется
Ответственность обвязки переезжает, а не исчезаетРАНЬШЕЖЁСТКО ЗАДАННАЯ ОБВЯЗКАперепроверить каждую задачупринудить коммит и отправкузабрать журналы CIмодель взрослеетТЕПЕРЬИНСТРУМЕНТЫ ПОД УПРАВЛЕНИЕМ МОДЕЛИGit · CI · файлы · ветка / PRНОВЫЙ КАРКАСуправление компьютером · несколько агентов · политикаменьше процедуры здесь · больше каркаса тамХорошая обвязка — временная теория слабостей текущей модели

По мере роста надёжности ответственность перемещается. Cursor раньше жёстко перепроверял задачу, принудительно выполнял коммит и отправку и отдельно забирал журналы CI. Затем эти действия стали обычными инструментами под управлением модели. Но вокруг более слабого управления компьютером выросли отдельные маршрутизация, подагент и запись экрана. Обвязка не «заканчивается»: она перестаёт контролировать созревшую способность и начинает страховать новую.

04

Инструменты недостаточно подключить — их нужно спроектировать для поведения

MCP решает важную, но узкую задачу. Спецификация инструментов стандартизует обнаружение, схему и семантику вызова. Она не обещает, что модель видела похожую схему, выберет правильный инструмент среди десятков, получит компактный ответ или выполнит действие с корректной идентичностью.

Большой каталог может оказаться хуже нескольких знакомых примитивов. В кейсе code execution поверх MCP Anthropic показывает цену прямого подключения: схемы занимают контекст, а промежуточные результаты каждый раз проходят через модель. Пример с расшифровкой встречи добавлял около 50 тысяч токенов. Постепенное обнаружение и выполнение кода оставляют большие данные в песочнице, возвращая модели только нужный результат. Это не делает оболочку безопасной автоматически: вместе с композиционностью появляется новая поверхность политик пакетов, сети и секретов.

схема 06 · хороший контракт действия шире схемы JSON
Контракт инструмента — поведенческий продуктDISCOVERYясная границаOUTPUTкомпактный · ограниченныйОШИБКИmachine-readableIDENTITYscope · OBOЭФФЕКТидемпотентный?PROVENANCEreplay · evalКОНТРАКТДЕЙСТВИЯMCP стандартизует обнаружение и вызов, но не принимает эти продуктовые решения
Грань
Граница
Что зафиксировать
Одно действие и отличие от соседних инструментов
Какой отказ предотвращает
Неверный выбор инструмента
Грань
Результат
Что зафиксировать
Компактный, структурированный, ограниченный
Какой отказ предотвращает
Переполнение контекста и потеря происхождения
Грань
Ошибки
Что зафиксировать
Стабильный код, причина и допустимое следующее действие
Какой отказ предотвращает
Слепые повторы и зацикливание
Грань
Полномочия
Что зафиксировать
Идентичность, область доступа, делегирование от имени пользователя (OBO) и невозможность расширить права подсказкой
Какой отказ предотвращает
Действие не от того субъекта или не в той среде
Грань
Эффект
Что зафиксировать
Идемпотентность либо явная необратимость
Какой отказ предотвращает
Повторное разрушительное действие
Грань
Проверяемость
Что зафиксировать
Происхождение, воспроизведение и сценарии оценки
Какой отказ предотвращает
Невозможно доказать полученный результат

Поэтому внутренний инструментальный шлюз — не вспомогательный инфраструктурный проект. Это поведенческий продукт платформенной команды. Его преимущество находится не в числе подключённых серверов, а в качестве контрактов и в данных о том, как агенты ошибаются при выборе, аргументах, отказе и восстановлении.

05

Трейсы замыкают цикл — но не дают автоматического права обучать

Слово «трейс» часто используют как сокращение для магического самоулучшения. Полезнее развести четыре режима. Инфраструктурная телеметрия оптимизирует обслуживание и таймауты. Продуктовая телеметрия показывает ошибки выбора инструментов, остановки из-за прав и сбои сжатия. Оценка результата связывает эпизод с тестами, слиянием, откатом или пользовательской коррекцией. Траектория обучения — специально отобранный и разрешённый прогон политики с наградой или проверяющей программой.

схема 07 · один трейс расходится по четырём режимам данных
Один трейс может питать четыре разных контура управленияПРОДТРЕЙСINFRA TELEMETRYlatency · cache · retriesПРОДУКТОВАЯ ТЕЛЕМЕТРИЯошибки инструментов · остановкиOUTCOME EVALtests · merge · revertТРАЕКТОРИЯ ОБУЧЕНИЯотобранный запуск + наградаОТДЕЛЬНОЕ ОСНОВАНИЕсогласие · политикаочистка · хранениеНаблюдаемость, оценка и обучение модели — разные режимы работы с данными

Различие между траекторией и итогом принципиально. В методике Anthropic расшифровка — это последовательность шагов, а результат — состояние среды после работы. τ-bench добавляет надёжность серии прогонов: единичный успех не доказывает стабильность. GitHub отдельно проверяет выбор инструментов и аргументов MCP Server, а Databricks связывает сценарии, похожие на рабочие, трейсы и регрессионные допуски. Всё это улучшает систему без изменения весов.

Даже если поставщик обучает модель в реалистичной среде, нельзя автоматически приписывать обучение всем клиентским сессиям. Cursor Privacy Mode запрещает использование клиентских данных для обучения; Anthropic отделяет коммерческие сессии от программ с явным согласием (снимок политик на июль 2026 года), а OpenAI по умолчанию не обучается на входах и выходах корпоративного API. Наблюдаемость, использование для оценки и обучение модели требуют разных политик, сроков хранения и правовых оснований.

рабочий отказ → трейс + итоговое состояние → воспроизводимая проверка → изменение обвязки, инструмента или модели → повторный допуск → управляемый запуск

Общая схема телеметрии, например развивающиеся OpenTelemetry GenAI conventions, снижает стоимость экспорта. Но формат полей не определяет срок хранения, очистку и право обучения. Эти решения остаются у владельца системы.

06

Полураспад обвязки: сильная метафора, слабая метрика

Моя исходная гипотеза при старте исследования звучала провокационно: за 180 ± 60 дней половина значимой обвязки становится не нужна, заменяется или удаляется. Проверять её по текучести строк нельзя: большая разница интерфейса не обязательно меняет поведение агента. Поэтому в исследовании были зафиксированы десять механизмов — контекст, сжатие, планирование, редактирование, политики, обнаружение, изоляция, сохранение состояния, оркестрация и телеметрия с проверками — и просмотрена публичная история с 23 января по 23 июля 2026 года Codex, Gemini CLI и OpenCode. Строгой заменой считался только вывод прежнего основного поведенческого пути; флаг возможности, параллельная реализация, узкое удаление или путь чтения старого формата этого порога не проходят.

схема 08 · замены есть, но распределены по-разному
Матрица аудита с 23 января по 23 июля 2026 года. Строгие замены: в Codex — контекст, редактирование и политики; в Gemini CLI — политики, сохранение состояния и оркестрация; в OpenCode — сжатие, сохранение состояния и телеметрия.3 ПРОЕКТА × 10 МЕХАНИЗМОВПУБЛИЧНЫЙ GIT · 23 ЯНВ — 23 ИЮЛ 2026ПРОЕКТЗАМЕНЕНОконтекстсжатиепланправкиправилапоискизоляц.состояниеоркестр.трейсыCodex3/10Gemini CLI3/10OpenCode?3/10заменаперенастроено / сосуществует?мало данныхСтрогая замена = прежний основной поведенческий путь выведен; чтение старых данных не считается

Реестр изменений даёт одинаковый счёт — 3/10 строгих замен в каждом проекте, — но не одинаковый набор. У Codex это контекст, редактирование и политики; у Gemini CLI — политики, сохранение состояния и оркестрация; у OpenCode — сжатие, сохранение состояния и объединённая ячейка телеметрии с проверками. Итого зелёных ячеек девять из тридцати, а два независимых проекта с доказанными ≥ 5/10 по-прежнему не нашлись.

Что именно было заменено

Здесь «было → стало» относится к основному исполняемому пути, а не к переименованию типа или перестановке файлов. Ссылки ведут на PR, в которых видны миграция потребителей и удаление прежней реализации.

Проект
Codex
Механизм
Контекст
Было → стало
Раздельные EnvironmentContext и пути базовой линии → единый WorldState/EnvironmentsState с общими рендерером и базовой линией
Первичные источники
Проект
Codex
Механизм
Редактирование
Было → стало
JSON/function-вариант apply_patch → только custom/freeform apply_patch
Первичные источники
Проект
Codex
Механизм
Политики
Было → стало
Устаревший exec-policy рядом с новым движком → только новый exec-policy
Первичные источники
Проект
Gemini CLI
Механизм
Политики
Было → стало
Императивное скрытие инструментов плана и жёсткое ASK_USER → DENY → декларативные правила PolicyEngine
Первичные источники
Проект
Gemini CLI
Механизм
Сохранение состояния
Было → стало
Перезапись монолитного JSON сеанса → дописываемый JSONL; старый JSON только мигрирует при возобновлении
Первичные источники
Проект
Gemini CLI
Механизм
Оркестрация
Было → стало
Устаревшие планировщики React/Core → единый событийный Scheduler
Первичные источники
Проект
OpenCode
Механизм
Сжатие
Было → стало
Одноразовая сводка всей активной истории → обновляемая опорная сводка старой истории + недавние ходы дословно
Первичные источники
Проект
OpenCode
Механизм
Сохранение состояния
Было → стало
JSON-файлы Project/Session/Message/Part/Todo → рабочее хранилище SQLite/Drizzle; импортёр JSON затем удалён
Первичные источники
Проект
OpenCode
Механизм
Телеметрия и проверки
Было → стало
Самописный журнал + отдельная обвязка CLI/OTEL → единый слой наблюдаемости Effect logging/OTLP
Первичные источники

Синие ячейки тоже обозначают содержательные изменения. Например, в Codex новый контур сжатия стал основным, но старые удалённый и локальный пути оставались; в Gemini CLI JIT-загрузка контекста сосуществовала с предварительной загрузкой; в OpenCode движок поиска успел перейти с нативного rg на WASM и вернуться обратно. Серый знак у планирования OpenCode означает, что найдены рефакторинг и исправление безопасности, но недостаточно данных даже для уверенной перенастройки механизма. Наконец, зелёная ячейка OpenCode «телеметрия и проверки» подтверждает замену именно пути телеметрии; отдельную замену исполнителя проверок она не доказывает.

Погрешность здесь эпистемическая, а не статистическая. История Git не всегда показывает долю постепенного развертывания, его статус и роль фича флагов. Молодость проектов тоже увеличивает видимый темп. Зато стратегический вывод устойчив: собственная общая обвязка — не одноразовая сборка, а бессрочная программа совместимости.

07

Концентрация создаёт несколько контуров, а не одного победителя

Интеграция ускоряет обратную связь. Команда, которая одновременно видит поведение модели, продуктовые трейсы и результат, быстрее связывает регрессию с нужным слоем. Высокая стоимость обучения передовых моделей, песочниц для нескольких операционных систем, ферм эвалов и корпоративного усиливает эффект масштаба. Это повышает концентрацию внутри отдельных контуров, но не означает победу одной компании, владеющей всем.

схема 09 · устойчивые способы замкнуть соседние слои
Три жизнеспособных архетипа интеграцииFULL VERTICALпаттерн GooglesiliconрантайммодельпродуктLAB + CLOUDпаттерн Anthropic + AWSпартнёрские вычислениямодельобвязкараспространениеPRODUCT-FIRSTпаттерн Cursordistributionтрейсыharnesspost-trainingВажнее контролировать соседние слои, чем обязательно владеть всеми

Четыре способа замкнуть короткий цикл

  • Google связывает TPU, сеть, компилятор, модель, облако и распространение — это полная вертикаль от оборудования до продукта.
  • Anthropic владеет моделью и обвязкой, а совместное проектирование оборудования строит как партнёрство с AWS.
  • Cursor начал с рабочего процесса разработчика и распространения, накопил трейсы и проверки, затем добавил собственное дообучение и модельный слой.
  • OpenAI строит гибридную партнёрскую вертикаль: Stargate связывает лабораторию с облаками, дата-центрами, энергетикой и капиталом, а совместная работа с Broadcom добавляет спроектированные OpenAI ускорители и сетевые системы. Компания не владеет каждым физическим слоем, но задаёт архитектуру контура и переносит знания о моделях и продуктах в железо.

Китайский путь: национальный контур на собственном железе

Китайский сдвиг к собственному железу переносит короткий цикл на уровень национальной технологической экосистемы. Авторы Pangu Ultra сообщают о предварительном обучении плотной модели со 135 млрд параметров на 13,2 трлн токенов с использованием 8192 NPU Ascend. В плане развития Huawei Ascend 950PR специализируется на предварительном заполнении кеша и рекомендациях, а Ascend 950DT — на декодировании и обучении. Вокруг них совместно развиваются интерконнект, форматы низкой точности, CANN, инструменты и openPangu. Это уже проверяемый пример обучения крупной модели на китайском стеке, но не доказательство того, что весь китайский рынок отказался от NVIDIA.

С DeepSeek V4 доказательная граница тоньше. В официальном анонсе DeepSeek называет 1,6 трлн общих и 49 млрд активных параметров у V4-Pro, а также 284 млрд общих и 13 млрд активных параметров у V4-Flash, но не раскрывает железо базового предварительного обучения. Зато исследование SLAI T-Rex документирует дообучение семейства V4 с обновлением всех параметров на Ascend NPU SuperPOD: авторы сообщают о 34,22% MFU и 2,93-кратном улучшении относительно открытой базовой конфигурации, а для V4-Flash описывают продолженное предварительное обучение и SFT. Это уже подтверждённое обучение модели триллионного масштаба на Ascend, но не доказательство того, что базовую V4 обучили на этих ускорителях с нуля.

В 2026 году положение больших китайских лабораторий нельзя свести ни к абсолютному запрету на NVIDIA, ни к простому нежеланию её покупать. BIS перевело заявки на H200 в индивидуальный режим рассмотрения, но сама NVIDIA сообщила, что получила разрешение лишь на небольшие объёмы для отдельных клиентов, не получила по программе выручки и фактически была вытеснена с китайского рынка вычислений для дата-центров. Одновременно выбор части лабораторий становится стратегическим: по данным Reuters, DeepSeek дала китайским производителям несколько недель раннего доступа к V4 для оптимизации, но не сделала этого для NVIDIA и AMD. После выпуска модели Reuters также сообщило о новых запросах ByteDance, Tencent и Alibaba на Ascend 950 при дефиците поставок до их масштабирования во второй половине 2026 года. Компании публично эти закупочные переговоры не подтвердили, поэтому это снимок рынка по источникам агентства, а не официальный отказ всех больших китайских лабораторий от NVIDIA.

Контрсилы: открытые модели и маршрутизация

Вертикальная интеграция — не единственная сила. Открытые веса DeepSeek, Qwen и GLM снижают барьер смены поставщика. Qwen Code и OpenCode выносят интерфейс сессии, разрешения и часть инструментов из-под контроля одной лаборатории. MCP и совместимые API уменьшают стоимость интеграции. RouteLLM формализует выбор между сильной дорогой и более дешёвой моделью, а OpenRouter Auto Router превращает тот же принцип в продукт: определяет тип задачи, выбирает модель из разрешённого набора, учитывает баланс цены и качества и сохраняет резервные маршруты. Это не воспроизведение конкретного алгоритма RouteLLM, а реализация той же архитектурной идеи поверх моделей разных поставщиков. Корпоративная среда при этом может быть настолько специфична, что универсальный поставщик не видит ни полномочий, ни конечного результата.

Поэтому более вероятны несколько экосистем с собственными быстрыми путями, чем единый универсальный рантайм. Преимущество возникает там, где организация контролирует несколько соседних слоёв и имеет канал доказательств между ними. Полное владение — лишь один из вариантов.

08

Граница для CTO: арендовать, адаптировать, оставить своим

Решение полезнее проводить не по логотипам поставщиков, а по двум осям: скорость изменения и уникальность для компании. Возможности передовых моделей меняются быстро и редко являются корпоративной спецификой. Идентичность, политики, доменные контракты действий и принятые результаты, наоборот, медленнее устаревают и определяют, что система вообще имеет право считать успехом.

схема 10 · арендовать быстро меняющееся, оставить своим уникальное и проверяемое
Где проводить корпоративную границу владениябольше специфики · больше полномочийбыстрее меняетсяАРЕНДОВАТЬпередовые моделиобщий агентный циклтиповое исполнениеАДАПТИРОВАТЬадаптеры моделей и инструментовконтекст + маршрутизациябюджеты + сжатиеВЛАДЕТЬидентичность + политикаконтракты инструментовпроверки + результаты + трейсыАрендуйте общую способность · адаптируйте стык · владейте полномочиями и доказательствами
Режим
Арендовать
Что относится
Передовые модели, общая обвязка, типовое исполнение
Почему
Редко уникально; быстро меняется и требует масштаба
Режим
Адаптировать
Что относится
Адаптеры моделей и инструментов, упаковка контекста, маршрутизация, бюджеты, сжатие
Почему
На стыке встречаются поведение поставщика и локальная среда
Режим
Оставить своим
Что относится
Идентичность, политика, контракты инструментов, набор проверок, результаты, управление трейсами
Почему
Это уникальное знание, полномочия и основа переносимости

Что не стоит строить по умолчанию

  • ещё один общий цикл агента разработки только ради смены конечной точки API;
  • собственное сжатие или оркестрация без регрессионного набора на реальных эпизодах;
  • каталог сотен MCP-инструментов без владельцев, ограничений ответа и телеметрии выбора;
  • «самообучение», в котором рабочие журналы автоматически считаются разрешёнными данными для обучения;
  • шлюз, приводящий всех поставщиков к общему минимуму и скрывающий их сильные стороны;
  • форк обвязки с открытым кодом без команды, отвечающей за слияние вышестоящих изменений, безопасность и совместимость с моделями.
схема 11 · когда собственная обвязка действительно получает бизнес-обоснование
Порог решения для собственной обвязки1. ОТВЕТЬТЕ «ДА» ИЛИ «НЕТ»ДАНЕТ1Среда действий действительно уникальна?2Ключевые ограничения нельзя передать?3Масштаб окупает постоянную адаптацию?4Есть эвалы и контролируемые эксперименты?5Агентный цикл — часть вашего продукта?2. НАЙДИТЕ СОЧЕТАНИЕТИПОВАЯ ПОТРЕБНОСТЬАРЕНДОВАТЬготовое ядро · свои политики и данныеУНИКАЛЬНЫЙ СТЫКАДАПТИРОВАТЬсвой слой · готовая обвязкаНЕПЕРЕДАВАЕМО + ПРОДУКТСТРОИТЬ СВОЮстратегическая роль · зрелые evalsЗрелые evals и стратегическая роль — gatesПомощь в решении, не формула · условия имеют разный вес

Собственная обвязка оправдана, когда одновременно сходятся несколько условий: уникальная среда действий, суверенность или экстремальные ограничения задержки, достаточный объём, зрелые проверки и готовность поддерживать быстрые пути для конкретных моделей. Самое сильное условие — возможности агента являются частью внешнего продукта и стратегического преимущества. Наличия талантливой платформенной команды самого по себе недостаточно.

09

Практический контур: от отказа к управляемому выпуску

Перенести идею совместного проектирования в компанию можно без собственного ускорителя и базовой модели. Нужно замкнуть тот участок цикла, который компания действительно контролирует: её задачи, полномочия, инструменты, итоговые состояния и решение о запуске.

Минимальная программа на один квартал

  1. 01Выбрать 20–30 реальных эпизодов. Зафиксировать чистое исходное состояние, контракт задачи, допустимые инструменты и проверяемый результат.
  2. 02Разделить режимы трейсов. Отдельно определить рабочую телеметрию, проверку человеком, использование для оценки и допустимые траектории обучения.
  3. 03Инвентаризировать контракты действий. Для каждого критичного инструмента записать идентичность, область доступа, идемпотентность, ограничение ответа, происхождение и владельца.
  4. 04Собрать независимое от поставщика воспроизведение. Хранить эпизод, версию среды, версии модели, обвязки и инструментов и доказательство итогового состояния в переносимом формате.
  5. 05Ввести повторные допуски к выпуску. Сравнивать не один удачный запуск, а качество, дисперсию, стоимость, безопасность и приёмку человеком. Метрика самого контура — медианное время пути «обнаруженный класс отказа → изменение, прошедшее допуск → выпуск».
  6. 06Тестировать слой, а не бренд. При регрессии менять описание инструмента, контекст, политику, маршрутизацию или модель только через контролируемый эксперимент.

В этом контуре поставщик приносит быстро меняющуюся возможность, а компания сохраняет право выпуска. Новая модель может быть дешевле и сильнее в публичном бенчмарке — рабочий запуск всё равно проходит через внутренние эпизоды, проверки политик и сравнение принятых результатов. Это и есть практическая защита одновременно от технической и доказательной зависимости от поставщика.

Здесь же обретает содержание «план выхода» из выводов — это не пункт декларации, а три практики поверх той же программы. Первая — следить за окнами депрекации поставщика: объявленные даты вывода моделей и API из эксплуатации задают крайний срок перепроверки стека. Вторая — независимое воспроизведение прогонов, и здесь стоит снять двусмысленность шага 04: после вывода закрытого чекпоинта из эксплуатации точная репродукция записанной траектории невозможна, поэтому воспроизведение означает повторный эвал — прогон тех же эпизодов на новой конфигурации и сравнение итоговых состояний с сохранённым доказательством. Третья — репетиция замены базовой модели как регулярное учение; как такое учение устроено, разобрано в лонгриде «Сквозной игрок без своего железа».

У финального тезиса есть честный контраргумент. Если скачок способности следующей модели перекрывает всю накопленную выгоду контура, а инструменты эвалов коммодитизируются, то скорость контура — гигиена, доступная каждому, а не преимущество. Ответ в том, что контур не соревнуется с моделью. Он определяет, как быстро именно новая модель безопасно оказывается в рабочей среде: скачок способности всё равно проходит через внутренние эпизоды, политики и допуски к выпуску, и выигрывает та организация, которой на это нужны дни, а не кварталы. А уникальным остаётся то, что не поставляется вместе с чекпоинтом: собственные эпизоды, полномочия и трейсы.

Выводы

Что стоит унести с собой

  1. 01Качество AI-агента — свойство конкретной рабочей конфигурации «модель × обвязка × инструменты × среда» во времени, а не постоянная оценка одной модели.
  2. 02MCP и совместимый API снижают стоимость подключения, но не гарантируют знакомое модели поведение, качественное восстановление или богатую семантику сессии.
  3. 03За полугодовое окно Git-аудит нашёл по три строгие замены из десяти в Codex, Gemini CLI и OpenCode, но в разных механизмах — не половину обвязки.
  4. 04Рабочий трейс, эпизод оценки и траектория обучения — разные режимы данных; право наблюдать не создаёт автоматически права обучать.
  5. 05Компании выгодно арендовать быстро меняющуюся общую способность, адаптировать стык и владеть полномочиями, контрактами, результатами, проверками и планом выхода.
Источники

Первичные материалы, исследования и документация

Прочие источники

  1. NVIDIA · Hopper ArchitectureTransformer Engine, FP8/FP16 и NVLink; показатели производительности — данные вендора
  2. NVIDIA · Blackwell Architecturerack-scale co-design, precision и интерконнект
  3. NVIDIA · Vera Rubin platformанонс extreme codesign; относительная экономика — заявление компании
  4. Google Cloud · TPU 8t and TPU 8i technical deep diveразделение систем для pretraining и инференса/рассуждений
  5. Google Cloud · Ironwood TPUs and Axion VMsсовместное проектирование кремния, систем и программного обеспечения
  6. THUDM / Z.ai · slimeоткрытый фреймворк обучения с подкреплением: прогоны политики, инструменты, отклик песочницы и награды проверяющей программы
  7. Model Context Protocol · Tools specificationнормативный контракт discovery, schemas и calls
  8. GitHub · Offline evaluation of GitHub MCP Serverпроверка выбора инструментов и аргументов до выпуска
  9. Databricks · coSTARсценарии, приближенные к рабочим, трейсы и регрессионные ворота; результаты — самоотчёт
  10. OpenTelemetry · GenAI semantic conventionsполя телеметрии агента, инструментов и эвалов, предупреждения о чувствительных данных
  11. Google · Gemini CLI repositoryпубличная история механизмов контекста, политик, сохранения состояния и подагентов
  12. Anomaly · OpenCode repositoryпубличная история обвязки, не зависящей от модели, и миграций на v2
  13. Huawei · Ascend and SuperPoD roadmapспециализация Ascend 950PR/950DT и развитие CANN/openPangu; показатели и сроки — заявления вендора
  14. U.S. BIS · H200 export licensing policy for Chinaиндивидуальное рассмотрение лицензий на H200 с января 2026 года
  15. NVIDIA · FY2026 Form 10-Kразрешения на небольшие объёмы H200, отсутствие выручки и фактическое вытеснение с китайского рынка
  16. OpenRouter · Auto Routerпродуктовая маршрутизация по типу задачи, цене и качеству с резервными маршрутами

Обвязки и модели

  1. DeepSeek · DeepSeek-V3 repository and reportFP8, MoE и адаптация training framework к H800; затраты — самоотчёт команды
  2. Anthropic · Expanding our use of AWS Trainiumпример партнёрского совместного проектирования оборудования и модели
  3. OpenAI · Unlocking the Codex harnessосновной цикл, сохранение состояния, песочница, MCP и границы семантики сессии
  4. OpenAI · Harness engineeringчитаемые агентом леса и контуры обратной связи; прирост производительности — самооценка компании
  5. Anthropic · Effective harnesses for long-running agentsинициализатор, артефакты прогресса, список возможностей и малые итерации
  6. Anthropic · Harness design for long-running appsпланирование, проверка и передача состояния между окнами контекста
  7. Anthropic · Effective context engineering for AI agentsсжатие, структурированные заметки, подагенты и извлечение по требованию
  8. Anthropic · Claude Code sandboxingсвязь изоляции и автономности; сокращение запросов на подтверждение — внутреннее измерение
  9. Cursor · Continually improving our agent harnessмногонедельная адаптация под модели и различия edit primitives
  10. Cursor · Improving the harness for OpenAI Codex modelsприоритет оболочки, именование инструментов и обратная связь линтера
  11. Cursor · What we’ve learned building cloud agentsперенос процедурной логики из обвязки в инструменты, доступные модели
  12. Cursor · Composer 2 technical reportобучение с подкреплением в сессиях, приближенных к рабочим, и собственный контур эвалов; бенчмарки — заявления компании
  13. Cursor · Self-summarizationобучение модели работать со сжатием внутри цикла обучения
  14. Cursor · Data Use & Privacy OverviewPrivacy Mode, ZDR и границы допустимого использования данных
  15. Alibaba Qwen · Qwen3-Coderобучение с подкреплением на длинном горизонте и 20 тысяч окружений — заявление команды
  16. Alibaba Qwen · Qwen Codeоткрытая обвязка для нескольких поставщиков с предпочтительным быстрым путём для Qwen
  17. Anthropic · Code execution with MCPprogressive discovery и обработка больших промежуточных данных вне контекста модели
  18. Anthropic · Writing tools for agentsвлияние имён, описаний, схем и формы ответа на поведение агента
  19. Anthropic · Demystifying evals for AI agentsразличие транскрипта, трейса и результата, оценивающие программы и обвязка эвалов
  20. Anthropic Privacy Center · Model training data policyграницы использования коммерческих чатов и сессий работы с кодом
  21. OpenAI Help Center · How data is used to improve model performanceразличие пользовательских настроек и корпоративных умолчаний без обучения на данных
  22. OpenAI · Codex repositoryпубличная история изменений обвязки для проверки темпа
  23. OpenAI · Building the compute infrastructure for the Intelligence AgeStargate как партнёрская инфраструктурная экосистема и контур реинвестирования
  24. OpenAI and Broadcom · OpenAI-designed AI acceleratorsпланы совместной разработки ускорителей и сетевых систем; сроки и масштаб — заявления компаний
  25. DeepSeek · DeepSeek V4 Preview Releaseофициальные размеры V4-Pro и V4-Flash; железо базового предварительного обучения не указано
  26. Reuters · DeepSeek V4 early access for domestic chipmakersперепечатка сообщения Reuters о раннем доступе Huawei и исключении NVIDIA/AMD из предрелизной оптимизации со ссылкой на неназванные источники
  27. Reuters · Demand for Ascend 950 after DeepSeek V4перепечатка сообщения Reuters: запросы ByteDance, Tencent и Alibaba и дефицит поставок до второй половины 2026 года со ссылкой на неназванные источники

Исследования

  1. Cottier et al. · The rising costs of training frontier AI modelsисторические оценки и сценарии стоимости обучения передовых моделей
  2. Wang et al. · Executable Code Actions Elicit Better LLM Agentsисследование кода как композиционного action space
  3. Yao et al. · τ-benchнадёжность агентов с инструментами по повторным прогонам и конечному состоянию
  4. Yin et al. · Pangu Ultra on Ascend NPUsпредварительное обучение плотной модели со 135 млрд параметров на 13,2 трлн токенов и 8192 NPU Ascend
  5. Li et al. · SLAI T-Rex on Ascend SuperPODдообучение семейства DeepSeek V4 с обновлением всех параметров, MFU и контур CPT/SFT на Ascend
  6. Ong et al. · RouteLLMмаршрутизация между сильными и дешёвыми моделями как контрпример single-provider подходу
Поделиться
TelegramLinkedIn