Что такое обвязка и из каких семи частей она состоит
Определение у меня уже есть, и переписывать его я не буду. В сентябрьской статье о том, что остаётся инженерией я назвал средой исполнения: цикл работы, инструменты, состояние, ограничения и обратная связь. Документация Claude Code говорит почти то же самое короче: обвязка — это инструменты, управление контекстом и среда исполнения, которые превращают языковую модель в работающего агента; Claude Code — обвязка, Claude — модель внутри. Биргитта Бёкелер на сайте Мартина Фаулера ещё короче: всё в агенте, кроме модели. Три определения не противоречат друг другу, но и не помогают ничего спроектировать. Для проектирования нужна декомпозиция.01Лестницу «промпт → контекст → обвязка → цикл» мы с Максимом Смирновым разбирали в июльском эфире; там же — почему главная часть цикла не та, что снова говорит агенту «работай», а та, что умеет сказать «стоп».Книжный куб · Loop Engineering
Сначала — соседи термина, потому что в 2026 году они путаются даже в глоссариях. Фреймворк — библиотека, из которой обвязку собирают; он не исполняет агента и не отвечает за его границы. Рантайм — место, где обвязка исполняется у вендора. Леса, они же scaffold, — слово эпохи 2024 года; в документах Anthropic 2025 года оно означало всю обёртку вокруг модели, а в глоссарии Hugging Face мая 2026 года — только слой поведения, тогда как обвязкой там назван слой исполнения. Единого определения нет, и авторы глоссария честно об этом пишут. Наконец, у слова есть второй смысл, который обычно теряют: обучающая среда. Prime Intellect в июле 2026 года разделила среду обучения ровно на две части — набор задач и обвязку, программу, которая эти задачи решает и производит траектории; одна конфигурация служит и оценке, и обучению. Это тот же объект, увиденный со стороны лаборатории, и дальше в статье он вернётся.
| Термин | Что это | Чем не является |
|---|---|---|
| Фреймворк | Библиотека для сборки обвязки: LangChain, ADK, Agents SDK, Deep Agents | Сам не исполняет агента и не отвечает за его границы |
| Леса (scaffold) | Обёртка эпохи 2024: цепочки, графы, роли; в текстах Anthropic 2025 года — вся обёртка вокруг модели | В глоссарии Hugging Face 2026 года это, наоборот, только слой поведения — единого определения нет |
| Обвязка (harness) | Протокол работы модели с миром: цикл, контекст, инструменты и среда, проверка, оркестрация, наблюдаемость, границы | Не модель, не задача и не фреймворк, из которого её собрали |
| Рантайм | Место, где обвязка исполняется у вендора: Managed Agents, Foundry Hosted Agents, Managed Agents в Gemini API | Не заменяет ваши задачу, контекст и критерии результата |
| Агент | Модель плюс обвязка плюс задача — то, что вы запускаете | Не свойство модели: одна модель в разных обвязках даёт разные результаты |
| Обучающая среда | Тот же смысл со стороны лаборатории: набор задач плюс обвязка, в которой модель тренируют | Не гарантирует, что развёрнутая обвязка совпадает с обучающей |
Теперь декомпозиция. Я делю обвязку на семь частей, и каждая часть — ответ на вопрос, который модель задаёт миру. Что я вижу — контекст и память. Что я могу сделать — инструменты и среда. Как долго и когда остановиться — цикл. Кто проверяет — проверка. Как масштабироваться — оркестрация. Кто увидит, что было, — наблюдаемость и оценка. Кто разрешает — доверие и границы. Три первых вопроса обвязка исторически закрывала словами: инструкциями в промпте, описаниями инструментов, навыками. Четыре последних — стенами: кодом, который исполняется независимо от того, что решила модель. Важно, чем стены не являются: они не ведут модель за руку на каждом шаге, а очерчивают поле — что можно тронуть, куда можно выйти, кто увидит. Это деление на слова и стены — стержень всей статьи, и дальше я покажу три движения сразу: слова сжимаются, стены растут, а свободы внутри стен становится больше.
У корпуса сайта уже есть две декомпозиции той же сущности, и без сверки с ними третья выглядела бы как несогласованность. В июльском лонгриде о совместной эволюции стека обвязка — один из шести слоёв, между моделью и инструментами, и отвечает за контекст, планирование, сжатие, состояние, изоляцию и подтверждения. Там же аудит полугода истории трёх открытых обвязок делил их на десять механизмов. Семь частей здесь — не замена, а другой разрез: не «что лежит в репозитории», а «на какой вопрос модели это отвечает». Последняя колонка таблицы связывает разрезы: каждой части соответствуют один-три механизма июльского аудита.
| Часть | Вопрос модели | Что модель забрала к 2026 году | Что остаётся в обвязке | Механизмы аудита |
|---|---|---|---|---|
| Цикл и остановка | Как долго и когда остановиться | Рассуждение между вызовами инструментов, запуск тестов без напоминания, учёт остатка контекста | Критерии остановки, бюджет, контрольные точки, судья на другой модели | планирование · состояние |
| Контекст и память | Что я вижу | Окно в миллион токенов, заявленное «обученное» уплотнение | Политика уплотнения, карта репозитория вместо инструкций, память между сессиями | контекст · сжатие |
| Инструменты и среда | Что я могу сделать | Вызов функций, работа с экраном, выбор процедуры без сценария | Определения инструментов, песочница, рабочие деревья, протокол MCP | редактирование · обнаружение · изоляция |
| Проверка | Кто проверяет | Самопроверка — заявляется вендорами, не измерена независимо | Тесты и линтеры как канал обратной связи, хуки, свежая модель как судья, воспроизводимые эпизоды | телеметрия и проверки |
| Оркестрация | Как масштабироваться | Порождение субагентов у моделей, обученных на рое | Устойчивое выполнение, команды агентов, расписания, распределение состояния | оркестрация |
| Наблюдаемость и оценка | Кто увидит, что было | Ничего | Трейсы, журнал сессии, учёт стоимости, оценка на эпизодах | телеметрия и проверки |
| Доверие и границы | Кто разрешает | Ничего — намеренно | Права и классификатор действий, идентичность агента, аудит | политики · изоляция |
Четыре эпохи: от bash-цикла до управляемого рантайма
Слово старше агентов. В тестировании harness — набор заглушек и драйверов, которые позволяют прогнать компонент вне его настоящего окружения. В мир языковых моделей оно пришло тем же путём: lm-evaluation-harness от EleutherAI — прогонщик оценки, а не обёртка для действий. Ещё в августе 2024 года OpenAI в описании SWE-bench Verified называла обёртку вокруг модели scaffold, а harness — контейнерный прогонщик тестов. В январе 2025 года Anthropic определила агента как «сочетание модели и программных лесов вокруг неё», и в анонсах Claude 4 и Sonnet 4.5 результаты на SWE-bench шли с примечанием про «простой каркас с двумя инструментами — bash и редактирование файлов». Переход от лесов к обвязке случился, когда обёртка стала продуктом: в сентябре 2025 года Anthropic описала Agent SDK как «обвязку, на которой работает Claude Code», а к 2026 году METR в отчётах сменила scaffold на agent harness. Дисциплина появилась в феврале 2026 года: Mitchell Hashimoto написал, что не знает принятого термина и стал называть свою практику harness engineering, а через шесть дней вышел одноимённый пост OpenAI.
За словом стоит четыре эпохи, и в каждой обвязка компенсировала конкретную слабость модели. В 2022–2023 годах модель не умела действовать: ни инструментов, ни памяти. Цикл «подумай — вызови — прочитай» писали руками вокруг API, и первая функция обвязки ушла в API уже в июне 2023 года, когда OpenAI добавила вызов функций в gpt-4-0613. В 2024 году модель действовала, но терялась в репозитории и на длинной задаче — и это эпоха лесов: интерфейс агента с компьютером у SWE-agent, графы ролей у LangGraph и CrewAI, планировщик и критик, экранное управление у Claude в октябре и протокол контекста MCP в ноябре. В 2025 году модель уже писала файлы и целые фичи, а продукты вокруг предлагали автодополнение и чат: Boris Cherny называет это product overhang, и Claude Code вырос из наблюдения, что Sonnet 3.5 умеет больше, чем ему позволяют. Один универсальный агент в пространстве файлов стал продуктом — Claude Code, Codex, Gemini CLI, — а вокруг него за год появились файл инструкций репозитория, SDK обвязки, стандарт навыков и фонд стандартов под Linux Foundation.
2026 год — эпоха дисциплины и инфраструктуры. Обвязку описывают как инженерную практику со своими постами, курсами и экзаменами и одновременно сдают в аренду целиком: в апреле Anthropic выпустила Managed Agents и назвала его «мета-обвязкой», в мае Google показала Managed Agents в Gemini API, в июне Microsoft — Foundry Hosted Agents. Протокол MCP в июле стал протоколом без состояния, GitHub в августе выпустил стандарт плагинов, а Antigravity заменила Gemini CLI для бесплатного тарифа. Слабость модели, которую компенсирует обвязка 2026 года, звучит парадоксально: модель делает больше, чем продукт позволяет, а сама обвязка устаревает быстрее, чем её пишут. Периодизация Константина Крестникова с Data Fest — от чистых языковых моделей через ReAct и цепочки к графам и, наконец, к одному агенту с файлами — совпадает с моей с точностью до границ эпох, и его метафора точна: модель — тяговая сила, файлы — поле, обвязка — упряжка.
| Эпоха | Слабость модели | Что делала обвязка | Артефакт | Представители |
|---|---|---|---|---|
| 2022–2023 · текст в текст | Модель не умеет действовать: ни инструментов, ни памяти | Цикл «подумай — вызови — прочитай» писали руками вокруг API | ReAct-цикл, первые автономные скрипты, вызов функций в API | AutoGPT, BabyAGI, function calling (июнь 2023) |
| 2024 · леса | Модель действует, но теряется в репозитории и на длинной задаче | Интерфейс агента с компьютером, графы ролей, планировщик и критик | ACI, графы LangGraph и CrewAI, экранное управление, протокол контекста | SWE-agent, Devin, computer use (октябрь 2024), MCP (ноябрь 2024) |
| 2025 · обвязка как продукт | Модель уже пишет файлы и фичи, а продукты вокруг предлагают автодополнение | Один универсальный агент в пространстве файлов; цикл, инструменты и файловая система «в коробке» | Терминальные агенты, файл инструкций репозитория, SDK обвязки, навыки, фонд стандартов | Claude Code, Codex, Gemini CLI, AGENTS.md, Agent SDK, Skills, AAIF |
| 2026 · дисциплина и инфраструктура | Модель делает больше, чем продукт позволяет; обвязка устаревает быстрее, чем её пишут | Обвязка описывается как инженерная дисциплина и сдаётся в аренду целиком | Посты о «harness engineering», управляемые рантаймы, протокол без состояния, стандарт плагинов | OpenAI (февраль), Anthropic (март–апрель), Google и Microsoft (май–июнь), MCP 2026-07-28 |
Механизм: как модель и обвязка эволюционируют вместе
Anthropic сформулировала главный закон этой эволюции в марте 2026 года одной фразой: каждая компонента обвязки кодирует предположение о том, чего модель не умеет сама. Отсюда следует всё остальное. Если предположение перестаёт быть верным, компонента становится не бесполезной, а вредной: она ограничивает модель тем, что модель уже переросла. В июле я называл обвязку временной теорией слабостей текущей модели; сейчас можно проследить, какие именно теории уже опровергнуты, а какие лаборатории хранят намеренно.02Лучший пример миграции по частям — годовой отчёт Cursor об облачных агентах: процедура переезжает из обвязки в инструменты, которые агент выбирает сам, а сложность растёт вокруг среды, политик и состояния.Книжный куб · облачные агенты Cursor
Вот датированная линия того, что ушло в модель. Вызов функций — июнь 2023 года. Структурированный вывод по грамматике — август 2024 года: JSON-режим годом раньше обещал только валидный синтаксис, а не соответствие схеме, и даже синтаксис, по опыту Simon Willison, гарантирован не был. Работа с экраном — октябрь 2024 года, когда Anthropic прямо написала, что учит модель общим навыкам работы с компьютером вместо того, чтобы делать инструменты под каждую задачу. Рассуждение между вызовами инструментов — в Claude 4 оно включалось beta-заголовком, в 4.6 включается само, в 4.7 ручной режим отклоняется: флаг обвязки растворился в поведении модели. Учёт остатка контекста — Sonnet 4.5 получает от API теги с бюджетом, Opus 4.7 и новее уже нет. Уплотнение истории — OpenAI в ноябре 2025 года назвала GPT-5.1-Codex-Max «первой моделью, обученной работать через несколько окон контекста»; это заявление, а не измерение, и Simon Willison тут же напомнил, что Claude Code делал то же самое на уровне обвязки. Самая наглядная строка — в журнале изменений Claude Code: инструменты трекинга задач теперь предлагаются только моделям до Opus 4.7. Компонент, который год был обязательным, снят для моделей новее, потому что они держат план в голове.
Теперь то, что лаборатории держат в обвязке намеренно, и формулировки здесь важнее дат. Документация Claude Code: правила прав исполняет Claude Code, а не модель; инструкции в промпте определяют, что модель пытается сделать, но не меняют того, что ей разрешено. Там же: CLAUDE.md не является слоем жёсткого принуждения, а чтобы заблокировать действие независимо от решения модели, нужен хук перед вызовом инструмента. Песочница уровня операционной системы, по данным Anthropic, сократила запросы на подтверждение на восемьдесят четыре процента и покрывает любые подпроцессы — не потому, что модель ненадёжна, а потому, что граница должна держаться и при ненадёжной. Codex описывает два слоя вне модели — режим песочницы и политику подтверждений — и объясняет прямо: вы доверяете не намерениям агента, а тому, что он действует внутри принудительных границ. Политика уплотнения тоже остаётся у разработчика: серверное уплотнение Anthropic имеет порог по умолчанию, но промпт сводки заменяемый и «зависит от модели». Закономерность видна невооружённым глазом: в веса уходит то, что можно натренировать; в обвязке остаётся то, что нельзя доверить даже хорошо натренированному.
Обучающая среда и развёрнутая обвязка сходятся
Второй смысл слова из первого раздела здесь становится механизмом. Cursor в октябре 2025 года написала, что в обучении с подкреплением модель Composer «может вызывать любой инструмент обвязки Cursor Agent», а в отчёте о Composer 2 в марте 2026 года — что обучение идёт «в реалистичных сессиях Cursor с теми же инструментами и обвязкой, что у развёрнутой модели»; контрольные точки модели выходят примерно каждые пять часов, и частью среды обучения стал пользователь. Cognition в анонсе SWE-1.5 говорит о переобучении модели на обновлённой обвязке Cascade. OpenAI обучила GPT-5-Codex «на реальной инженерной работе» и рекомендует использовать её «только в Codex или Codex-подобных средах» — обвязка обучения не названа, но рекомендация говорит сама за себя. Zhipu собрала для GLM-5 больше десяти тысяч сред в формате Harbor — то есть в формате бенчмарка Terminal-Bench. Минимальный пресет открытой обвязки DeepSeek описан в репозитории как «RL-agent composition»: короткий фиксированный промпт, persistent bash и редактор строк воспроизводят среду обучения. Anthropic прямого заявления не делает и говорит только о «той же инфраструктуре, что у Claude Code», — и отсутствие заявления не равно отсутствию практики.03Про DeepSeek Harness я писал отдельно: там журнал сессии только дописывается, уплотнение повторяет прежний префикс байт в байт ради кеша, а контур «обвязка → траектории → дообучение → та же обвязка» — пока архитектурная возможность, а не доказанная политика данных.Книжный куб · DeepSeek Harness
Если модель учится в своей обвязке, чужая обвязка на фронтире должна проигрывать — и должна проигрывать немного, потому что фронтирные модели обучены переносить навык между обёртками. Ровно это показывают измерения. Harbor-Index в июне 2026 года столкнул родные обвязки моделей с нейтральной Terminus-2 на одних задачах: родная «обычно чуть впереди, но ни одно сравнение не является статистически значимым». METR в феврале написала, что Claude Code и Codex «не очевидно лучше» дефолтных каркасов лаборатории: Opus 4.5 в Claude Code обгоняет простой ReAct лишь в половине бутстрэп-выборок, GPT-5 в Codex обгоняет Triframe в одной из семи. И в то же время ниже фронтира разброс огромен. На Claw-SWE-Bench GLM 5.1 с минимальным адаптером решает девятнадцать процентов задач, с полным — семьдесят три; в среднем по моделям выбор обвязки сдвигает результат на двадцать семь пунктов. Команда GigaChain на своих замерах видит между обвязками разброс в двадцать-тридцать пунктов при одной и той же модели.
| Исследование | Модель и бенчмарк | Эффект | Кто опубликовал | Класс |
|---|---|---|---|---|
| Claw-SWE-Bench · июнь 2026 | GLM 5.1 · Claw-SWE-Bench | Минимальный адаптер 19,1 % против полного 73,4 %; средний эффект 27,4 п.п. | Независимая работа (arXiv) | Проверяемый факт |
| GigaChain · август 2026 | Sonnet · 104 задачи соревнования | Claude Code 70 задач, DeepAgents 67; между обвязками — разброс 20–30 п.п. | Сбер, доклад на Data Fest | Заявление вендора |
| Профиль модели · август 2026 | GigaChat 3.5 · 391 задача | 77,2 → 87,0 % успеха, токены −50 % | Сбер на Habr | Заявление вендора |
| AHE · апрель 2026 | GPT-5.4 · Terminal-Bench 2.0 | 69,7 % (исходная) → 71,9 % (Codex CLI) → 77,0 % (эволюционировавшая) | Независимая работа (arXiv) | Проверяемый факт |
| icat-agent · июнь 2026 | GPT-5.4-xhigh · SWE-bench Pro | 59,1 → 67,4 % | Независимая работа (arXiv) | Проверяемый факт |
| Vercel d0 · декабрь 2025 | Модель не названа · 5 внутренних запросов | Инструменты −80 %: 4 из 5 → 5 из 5, 3,5× быстрее, токены −37 % | Vercel | Заявление вендора |
| Meta-Harness · март 2026 | Opus 4.6 и Haiku 4.5 · Terminal-Bench 2.0 | 74,7 → 76,4 % и 33,7 → 37,6 % при заголовке «до 6×» | Stanford (arXiv) | Проверяемый факт |
| Whitepaper Google · май 2026 | Модель не названа · Terminal-Bench 2.0 | Из-за пределов топ-30 в топ-5 сменой обвязки; LangChain +13,7 балла | Google, авторы документа | Снимок |
| Nvidia · август 2026 | Opus 5 · ARC-AGI-3 | 30 % без обвязки → 100 % с обвязкой Nvidia | TechCrunch о работе Nvidia; верификация ARC Prize не упомянута | Снимок |
| Harbor-Index · июнь 2026 | Несколько моделей · Terminal-Bench | Родная обвязка против нейтральной Terminus-2 — разница статистически незначима | Terminal-Bench | Проверяемый факт |
| METR · февраль 2026 | Opus 4.5, GPT-5 · задачи METR | Claude Code лучше ReAct в 50,7 % выборок, Codex лучше Triframe в 14,5 % — «не очевидно лучше» | METR | Проверяемый факт |
Обвязки, которые переписывают сами себя
Логическое продолжение коэволюции — обвязка, которую меняет не инженер, а другой агент. Идея старше, чем кажется: в августе 2024 года Hu, Lu и Clune описали мета-агента, который итеративно программирует новых агентов из архива прежних находок. Darwin Gödel Machine от Sakana в мае 2025 года подняла свой результат на SWE-bench с двадцати до пятидесяти процентов, переписывая собственный код, — и в той же работе авторы сообщают, что машина удалила маркеры, по которым функция награды ловила галлюцинации, вопреки прямой инструкции этого не делать. В 2026 году направление стало академической рутиной: Meta-Harness из Стэнфорда, Agentic Harness Engineering с ростом GPT-5.4 на Terminal-Bench с семидесяти до семидесяти семи процентов, DemoEvolve с честным выводом, что самоэволюция по разреженной награде «хрупка». Anthropic в июне выпустила «обвязку под каждую задачу» — Claude пишет сценарий оркестрации на лету. Всё это работает и всё это оптимизирует ровно ту награду, которую ему выдали. Работа ACL 2026 добавляет неприятный штрих: опыт, накопленный на безобидных задачах, всё равно подрывает безопасность в рискованных сценариях, потому что усиливает склонность действовать, а не отказываться. Самомодифицирующаяся обвязка без скрытого судьи и реестра предположений — это закон Гудхарта, которому дали автомат.
Что сжимается: инструкции превращаются в карты
Три цифры 2026 года описывают одно движение. Boris Cherny в июльском интервью: «мы удалили восемьдесят процентов системного промпта — Opus 5 просто это делает»; есть переменная окружения, которая убирает все промпты вообще, и в таком голом режиме модель на замерах команды оказывается даже чуть лучше. Nick Nisi из WorkOS на AI Engineer Europe: из документации сгенерировали десять тысяч семьсот строк инструкций для навыков, после удаления девяноста пяти процентов результат стал лучше, а управление потоком переехало из навыка в машину состояний на TypeScript. Vercel в декабре 2025 года: у внутреннего агента убрали восемьдесят процентов инструментов, оставив один bash, — в три с половиной раза быстрее, на треть меньше токенов, успех на внутреннем наборе поднялся с четырёх из пяти запросов до пяти из пяти. Все три — самоотчёты, и у Vercel «сто процентов» — это пять запросов. Но направление у трёх независимых команд одно, и Vercel формулирует его точнее всех: модель принимает лучшие решения, когда мы перестаём принимать их за неё.04Выступление Черны я разбирал через день после релиза Opus 5. Главный вывод у меня тогда был такой: системный промпт и файл инструкций — это технический долг со сроком годности в одно поколение моделей.Книжный куб · Boris Cherny про −80 % промпта
Слова не исчезают — они меняют жанр. У OpenAI в посте о harness engineering файл AGENTS.md занимает около ста строк и служит «картой с указателями на документацию» в структурированном каталоге: агент читает то, что ему нужно сейчас, а не всё сразу, потому что, как пишут авторы, «всё, до чего агент не может дотянуться в контексте, для него не существует». Стандарт навыков устроен так же: метаданные в сто токенов всегда в контексте, инструкции до пяти тысяч токенов подгружаются по требованию, ресурсы — по мере надобности; на витрине стандарта сорок шесть клиентов. Исследование на ста двадцати четырёх PR из десяти репозиториев связывает наличие AGENTS.md с сокращением медианного времени почти на тридцать процентов и выходных токенов на шестнадцать при сопоставимом завершении задач — это корреляция, не эксперимент, но она согласуется с внутренними эвалами Vercel, где восьмикилобайтный индекс документации в AGENTS.md дал сто процентов против семидесяти девяти у навыков. Карта побеждает сценарий, потому что сценарий кодирует предположение о том, как модель должна идти, а карта — только о том, где что лежит.05У Nisi мне дороже всего история про файл-маркер, который агент создал командой touch вместо прогона тестов; у Vercel — честная оговорка, что вклад архитектуры и более сильной модели в удвоение оценки они разделить не могут.Книжный куб · Nick Nisi про навыкиКнижный куб · Vercel d0
Цикл: от bash-строки до судьи на другой модели
Цикл — вторая часть обвязки, которая исторически жила словами, и его эволюция за год показательна. В июле 2025 года Geoffrey Huntley описал Ralph: «в чистом виде это bash-цикл», который снова и снова подаёт агенту один и тот же промпт. Через год у Anthropic это официальный плагин, реализованный через хук на остановку сессии с ограничением итераций, а рядом — встроенные команды: повтор по расписанию или в самотемпе с недельным сроком жизни и цель, выполнение которой проверяет «свежая модель, а не та, что делает работу». Каждая реплика создаёт контрольную точку, хранятся сто последних, и документация честно предупреждает, что изменения от bash-команд не отслеживаются. Agent SDK задаёт жёсткие пределы по числу ходов и по бюджету в долларах, и бюджет покрывает субагентов. Kyle Mistele из HumanLayer предлагает смотреть на всё это как на контур управления из учебника: уставка — желаемое свойство кодовой базы, датчик — детерминированная проверка, регулятор выбирает следующее маленькое изменение, исполнитель — агент, и модель нужна далеко не в каждом звене. Направление то же, что у инструкций: из «повторяй, пока не получится» в «остановись, когда независимая проверка сказала, что получилось».
Контекст: миллион токенов, и всё равно уплотнение
Контекст в 2026 году — конечный ресурс даже при бесконечном на вид окне. Модели Anthropic от 4.6 и новее получили окно в миллион токенов по умолчанию и по стандартной цене, и Claude Code всё равно уплотняет историю на девяноста семи процентах окна: сначала вычищает старые выводы инструментов, потом суммирует, потом перечитывает до пяти изменённых файлов. Причина названа в самой документации словом context rot — Chroma показала на восемнадцати моделях, что качество падает с ростом длины входа даже на простых задачах. Anthropic ещё в сентябре 2025 года описала три техники для задач длиннее окна: уплотнение, структурированные заметки во внешней памяти, субагенты со сжатыми сводками, — и все три за год стали функциями API или продукта. Экономику префиксного кеша и предостережение о памяти, которая повышает любой прошлый ответ до правила, я разбирал в июльской и сентябрьской статьях; здесь важно одно: даже там, где обвязка сжимает инструкции, управление контекстом остаётся её работой, потому что модель не видит собственного окна снаружи.
Что растёт: границы, среда и проверка
Пока инструкции сжимаются, растёт код, который исполняется независимо от решения модели. Он не диктует модели маршрут — внутри поля она сама выбирает инструменты, порядок и момент проверки; он держит края поля. Самый наглядный рост — хуки. В гайде Claude Code их тридцать три события: начало сессии, запрос прав, до и после вызова инструмента, остановка агента и субагента, до и после уплотнения, создание рабочего дерева, изменение конфигурации. Код выхода 2 блокирует действие, решения deny, defer, ask и allow складываются так, что самое строгое побеждает, а документация формулирует назначение без обиняков: некоторые действия должны происходить всегда, а не по выбору модели. Хуки могут быть не только скриптами, но и промптами к другой модели, и это важный гибрид: вероятностная проверка внутри детерминированного контура. Права оформлены в шесть режимов, и в режиме auto отдельная модель-классификатор проверяет действия до выполнения и блокирует всё, что выходит за рамки запроса; некоторые действия не автоодобряются ни в одном режиме.
Среда стала частью качества, и это второй растущий пояс стен. Cursor по итогам года облачных агентов пишет, что неполная среда не падает с ошибкой — агент просто работает хуже, а деградацию списывают на модель. Отсюда возобновляемые рабочие места: образы с историей версий, откат, аудит, правила исходящего доступа. Anthropic в апреле разделила рантайм на «мозг» — модель с циклом, уплотнением и памятью — и «руки» — инструменты и . Пока они жили в одном контейнере, модель не могла начать рассуждать до конца сборки среды, а падение любой половины убивало агента целиком; после разделения время до первого токена сократилось на шестьдесят процентов в медиане и больше чем на девяносто на хвосте, умершая песочница пересоздаётся, умерший «мозг» поднимается из журнала сессии. Учётные данные в такой схеме расшифровываются только в момент вызова инструмента, и модель их не видит. Docker в январе перевёл песочницы для агентов на выделенные микровиртуальные машины, Vercel объявила награду до миллиона долларов за побег из своей, а рабочие деревья git стали примитивом изоляции у Claude Code, Cursor и Codex.
Инструменты: четыре базовых и протокол без состояния
Инструменты сжимаются в описаниях и растут в среде. Базовых четыре — чтение файла, поиск, редактирование, bash; mini-SWE-agent обходится вообще одним bash в ста строках и показывает выше семидесяти четырёх процентов на SWE-bench Verified, а Pi намеренно живёт без протокола MCP и субагентов с четырьмя инструментами и расширениями на TypeScript. Когда инструментов тысячи, их описания перестают влезать в контекст, и обвязка отвечает поиском по инструментам — Anthropic держит до десяти тысяч отложенных определений и говорит о сокращении токенов больше чем на восемьдесят пять процентов, честно добавляя, что точность падает после тридцати-пятидесяти доступных инструментов. Следующий шаг — программный вызов: модель пишет код в контейнере, вызывает инструменты из него и получает в контекст только вывод скрипта; Anthropic заявляет плюс одиннадцать процентов качества при минус двадцати четырёх процентах входных токенов, Cloudflare пришла к тому же годом раньше с формулировкой «модели видели много кода и мало вызовов инструментов». Сам протокол MCP в ревизии от 28 июля 2026 года стал протоколом без состояния: убраны рукопожатие и идентификатор сессии, появились обнаружение серверов и подписки, задачи вынесены в расширение, динамическая регистрация OAuth-клиентов устарела, контекст трассировки передаётся в метаданных, а на вывод любой функции даётся минимум двенадцать месяцев. Фонд, который им управляет, за девять месяцев вырос со ста сорока шести до ста девяноста членов, включая армию США и национальные лаборатории, а суммарные загрузки SDK превысили миллиард.
Проверка, наблюдаемость, идентичность
Проверка — самая быстрорастущая стена, потому что для неё не нужно доверять модели. У OpenAI это выглядит так: около миллиона строк за пять месяцев, полторы тысячи PR, семь инженеров и ноль строк, написанных руками, — а дисциплина «проявляется в лесах, а не в коде»: собственные линтеры, которые отвечают агенту сообщением с инструкцией по исправлению, CI, который держит документацию свежей, фоновые агенты, которые собирают мусор. Бёкелер называет это датчиками в противовес направляющим, и Thoughtworks в апрельском радаре описывает те же две категории: направляющие вроде навыков и спецификаций, датчики вроде мутационного тестирования, — под общей темой «посадить кодовых агентов на поводок». Судья на другой модели, воспроизводимые эпизоды и разница между pass@k и pass^k — тема отдельной статьи, и Anthropic в январе 2026 года формализовала ту же лестницу: задача, прогон, оценщик, транскрипт, результат.
С наблюдаемостью и доверием картина двойственная. Claude Code отдаёт метрики, события и трассировку по OpenTelemetry, но сами конвенции GenAI в OpenTelemetry на середину июля 2026 года по-прежнему в статусе «Development» — стабильного релиза нет, и каждый вендор трассирует по-своему. Идентичность агента, напротив, оформилась в продукт за полгода: Okta в апреле сделала агентов полноправными записями каталога, в августе выпустила единый вход для агентов, а расширение Cross App Access стало официальной частью MCP для корпоративной авторизации; NIST в феврале запустил инициативу стандартов для агентов с отдельной опорой на идентичность, OWASP выпустил десятку рисков агентных приложений. И ещё один сюжет про границу как продукт: 31 марта 2026 года пакет Claude Code ушёл в npm с картой исходников — около тысячи девятисот файлов TypeScript; Anthropic назвала это ошибкой упаковки, а не нарушением безопасности, но через день в сети появились троянизированные «утечки». Обвязка — ценность, которую воруют, и ценность, через которую атакуют. В срезе по безопасности я показал, что все исправления инъекций 2026 года прошли по границам — файлов, сети, автоодобрения, — и ни одно не было формулировкой в промпте. Это та же закономерность, увиденная со стороны атакующего.
Что становится инфраструктурой: оркестрация и долгие циклы
Третье движение — части обвязки, которые в 2025 году каждая команда писала сама, в 2026-м сдаются в аренду. Первой ушла оркестрация. Субагенты в Claude Code работают в своих окнах контекста, возвращают только сводку, вкладываются на три уровня и запускаются до двадцати параллельно; команды агентов делят список задач и почтовые ящики, а документация честно пишет, что они тратят значительно больше токенов, чем одна сессия. Projects в сентябре порождают облачные сессии на отдельных ветках из одной координирующей беседы, Routines запускают агента по расписанию, событию GitHub или вызову API без запросов прав во время прогона. Спор двух школ 2025 года — Anthropic с оркестратором и исполнителями, которые на внутренних эвалах обгоняют одиночную модель на девяносто процентов при пятнадцатикратном расходе токенов, и Cognition с одной нитью и полными трейсами вместо сообщений — не разрешён, но перестал быть спором о коде: обе стратегии теперь настройки рантайма.
Вторыми ушли долгие циклы. Cursor держит цикл агента в Temporal, жизненный цикл виртуальной машины управляет отдельно, а хранение и поток разговора выносит в свой слой: «один агент» распадается по времени жизни и владельцу состояния. Temporal в сентябре 2026 года подняла пятьсот пятьдесят миллионов при оценке двенадцать с половиной миллиардов «на фоне спроса на надёжную инфраструктуру для AI»; Cloudflare встроила ожидание события — то есть паузу ради подтверждения человеком — прямо в шаги своего движка; Inngest объясняет спрос одной фразой: повторное исполнение шага с моделью означает повторную оплату токенов. Устойчивое выполнение существовало десять лет для платежей и заказов; агентный цикл оказался тем же классом задач с более дорогим повтором.
Третьими ушли сами рантаймы. За восемь недель весны 2026 года три вендора выпустили управляемую обвязку целиком: 8 апреля Anthropic — Managed Agents, «готовую настраиваемую обвязку агента в управляемой инфраструктуре» с примитивами агента, среды, сессии и событий, облачными или собственными песочницами и ценой восемь центов за час активной сессии сверх токенов; 19 мая Google — Managed Agents в Gemini API, где один вызов поднимает удалённую Linux-песочницу и конфигурируется файлами AGENTS.md и SKILL.md; 3 июня Microsoft — Foundry Hosted Agents и «Agent Harness» в своём фреймворке с автоуплотнением, файловой памятью и оболочкой. Обратная сторона той же волны: OpenAI закрывает визуальный конструктор агентов 30 ноября 2026 года, оставляя SDK. Конструкторы проиграли коду и рантайму одновременно.06Команда Applied AI из Anthropic рассказывала эту историю как три поколения поверхностей — Messages API, Agent SDK, Managed Agents — и главный тезис у них про сбросы контекста, которые команда встроила под «нервную» Sonnet 4.5 и которые при Opus 4.5 стали чистым оверхедом.Книжный куб · эволюция агентных поверхностей
Что при этом остаётся своим у компаний, которые прошли этот путь? У Stripe больше тысячи трёхсот PR в неделю полностью производятся агентами на форке открытой обвязки goose и проверяются людьми; своими там остались Blueprints — детерминированные каркасы процессов — и внутренний сервер инструментов. У Spotify фоновые агенты на Claude Code провели двести сорок PR миграций и сэкономили около десяти инженерных недель, а навыки и настраиваемость отключены намеренно ради ограждений. У Cloudflare сто тридцать одна тысяча прогонов ревью за месяц по доллару девятнадцать за прогон, с обходом «разбить стекло» в шести случаях из тысячи и отдельным проверяющим для файла AGENTS.md. Три компании, три разных обвязки в аренде — и во всех трёх своим осталось одно и то же: задача, контекст, критерии результата и политика. Константин Крестников сформулировал ту же мысль с другой стороны: мощным моделям сложная обвязка перестала быть нужна, достаточно положить агенту правильные файлы и инструкцию.07Доклад Крестникова с Data Fest мне дорог ещё и честным бенчмарком без модели-судьи: задачи на файлы, память и CSV с эталонными ответами, прогон за двадцать минут на любой обвязке.Книжный куб · один агент с файлами
Messages API → Agent SDK → Managed Agents: граница «что моё» сжимается до задачи, контекста, эпизодов и идентичности
Границы эффекта: где обвязка перестаёт помогать
Честная статья про обвязку обязана собрать в одном месте всё, что против неё. Первое — эффект на фронтире. Harbor-Index: родная обвязка против нейтральной — незначимо. METR: Claude Code и Codex не очевидно лучше дефолтных каркасов. Meta-Harness обещает в введении шестикратный разрыв, а в собственной таблице на Terminal-Bench даёт Opus 4.6 плюс один и семь десятых пункта. Если сложить это с двадцатью семью пунктами Claw-SWE-Bench и двадцатью-тридцатью пунктами GigaChain, получается не противоречие, а форма кривой: пропасть между сломанной и адекватной обвязкой измеряется десятками пунктов, зазор между двумя адекватными на фронтире — единицами. Именно это я в июле формулировал как «на фронтире обвязки сходятся, ниже фронтира обвязка решает»; за два месяца появились числа.
Второе — что обвязка не умеет в принципе. Dex Horthy на AI Engineer World's Fair поставил к формуле «агент равно модель плюс обвязка» сноску: хорошая обвязка резко улучшает исполнение, но не учит модель держать качество архитектуры на длинной дистанции, потому что сигнал «тесты прошли» не штрафует за лишний try/catch и расползание изменений по системе, а цена плохого дизайна проявляется через месяцы. Быстрого верификатора сопровождаемости нет, и он это честно признаёт. Его собственная команда в 2025 году попробовала «фабрику с выключенным светом» и через несколько месяцев столкнулась с инцидентом в кодовой базе, за которой люди уже не следили. DORA в майском отчёте о возврате инвестиций даёт похожую картину сверху: тридцать пять — сорок процентов выигрыша на новых задачах и около десяти на легаси, а доля неудачных изменений в модельном расчёте растёт с пяти до шести процентов.08У YC Paper Club мне запомнилась история Prime Intellect про 99,9 % на ARC-AGI, которые после чтения логов оказались жульничеством; у Horthy — оговорка, что он продаёт инструменты для того самого процесса, который описывает.Книжный куб · YC Paper Club об обвязкахКнижный куб · Dex Horthy
Третье — методология. Работа с говорящим названием «Хватит сравнивать агентов, не раскрывая обвязку» показывает, что текущие протоколы оценки систематически приписывают выигрыш от обвязки улучшениям модели. Обзор тринадцати агентов по двенадцати измерениям находит, что одиннадцать из тринадцати комбинируют несколько примитивов, а расходятся ровно там, где открыты вопросы — в уплотнении и состоянии. Для практика вывод один: обвязка в отчёте об измерении обязательна так же, как версия модели, и число без названия обвязки — не число. Это же, кстати, объясняет, почему у METR исходные «минус девятнадцать процентов» к февралю 2026 года не «перевернулись», как пишут вторичные пересказы: для исходной когорты оценка «ускорение минус восемнадцать процентов» с интервалом через ноль, для новой — минус четыре. Инструменты меняются, обвязки меняются, а измерение задачи в лаборатории по-прежнему не измеряет поставку.
Ставки лабораторий: кто на какие части обвязки ставит
В июле я раскладывал лаборатории по слоям стека, которыми они владеют, — от железа до трейсов. Здесь разрез другой: по семи частям обвязки, на которые каждый игрок ставит, и по механизму из третьего раздела, который эти ставки объясняет. Общее правило простое. Функции, которые можно натренировать, лаборатория переносит в веса и перестаёт продавать как обвязку. Функции, которые нельзя доверить модели — права, изоляцию, политику уплотнения, идентичность, — она оставляет в рантайме и продаёт как инфраструктуру. Интерфейсы между ними — протоколы и файлы инструкций — отдаёт в стандарты, потому что нейтральный интерфейс расширяет рынок для её же модели.
Anthropic ставит на обвязку как продукт на трёх высотах: Claude Code для разработчика, Cowork для сотрудника, Managed Agents для платформы; MCP и навыки отданы в открытые стандарты, а на майской конференции компания сформулировала тезис «инфраструктура, а не интеллект — узкое место». Ожидаю, что следующие пять лет она будет развивать именно рантайм — «мозг и руки», журнал сессии, встроенных оценщиков, — потому что модель и рантайм — это ров, а интерфейсы — нейтральная территория. OpenAI ставит на одну обвязку под всеми поверхностями — App Server объединил терминал, IDE и веб — и на обвязку внутри репозитория: линтеры, CI и документация как машиночитаемые ограничения. Thibault Sottiaux говорит, что Codex «становится стандартным агентом», а масштаб до миллиардов пользователей упирается в изоляцию; ожидаю, что OpenAI пять лет будет развивать песочницу и корпоративную идентичность, потому что именно они превращают инструмент разработчика в продукт для всех. Google ставит на один бренд обвязки для IDE, терминала, SDK и API и на владение средой, которую другим приходится арендовать: браузером и операционной системой. Замена открытого Gemini CLI на закрытый Antigravity CLI для бесплатного тарифа показывает готовность платить открытостью за связность платформы. Microsoft и GitHub ставят на обвязку в операционной системе и в поверхности учёта задач: агенту не нужно изобретать ветки, PR и права, они уже есть.
| Игрок | Ставка на пять лет | Свидетельства 2026 года | Почему |
|---|---|---|---|
| Anthropic | Обвязка как продукт на трёх высотах — для разработчика, для сотрудника, для платформы; протоколы — в стандарты | Claude Code, Cowork, Managed Agents; MCP и Skills переданы в открытые стандарты; «инфраструктура, а не интеллект — узкое место» | Модель и рантайм — ров, интерфейсы — нейтральная территория |
| OpenAI | Одна обвязка под всеми поверхностями и обвязка внутри репозитория | App Server объединил CLI, IDE и веб; пост «Harness engineering»; Codex Security; корпоративная платформа с идентичностью агентов | «Codex становится стандартным агентом» — масштаб через песочницу |
| Один бренд обвязки для IDE, терминала, SDK и API плюс браузер как среда | Antigravity заменил Gemini CLI для бесплатного тарифа; Managed Agents в Gemini API; WebMCP в Chrome; A2A в фонд | Владеть браузером и ОС-уровнем, которые другим приходится арендовать | |
| Microsoft и GitHub | Обвязка в ОС и в поверхности учёта задач | Agent Framework с «Agent Harness», Foundry Hosted Agents, Windows Agent Runtime; Agent HQ и Agent Plugins 1.0 | Задачи, ветки и права уже существуют — агенту не нужно их изобретать |
| Cursor и Cognition | Модель, обученная в собственной обвязке | Composer 2 тренируется «в реальных сессиях Cursor»; SWE-1.5 — «модель, инференс и обвязка как одна система» | Ров только там, где обвязка срослась с весами |
| DeepSeek и Moonshot | Открытые веса плюс собственная обвязка как обучающая среда | Минимальный пресет DeepSeek Harness воспроизводит среду обучения; Kimi K2.6 — рой до 300 субагентов | Ценовой пол для всех остальных |
| Открытые обвязки | Минимальное ядро и рынок моделей | OpenCode как слой между разработчиками и провайдерами; Pi — четыре инструмента без MCP и субагентов; mini-SWE-agent — сто строк | Модель взаимозаменяема, обвязка тонкая — конкуренция ценой |
| Российский контур | Готовая открытая обвязка плюс профиль под свою модель | GigaChain на Deep Agents с профилем GigaChat; SourceCraft CLI на OpenCode; ролевые агенты GigaCode; Т-Банк открывает торговлю агентам через MCP | Суверенитет обвязки дёшев, суверенитет модели — нет |
Вторая группа ставит на модель, обученную в собственной обвязке: Cursor, которая с августа 2026 года, по сообщениям, стала дочерней компанией SpaceX, и Cognition с SWE-1.5, где модель, инференс и обвязка спроектированы как одна система. Третья — открытые веса плюс своя обвязка как обучающая среда: DeepSeek с минимальным пресетом, воспроизводящим среду обучения, и Moonshot с роем до трёхсот субагентов в Kimi K2.6. Четвёртая — минимальное ядро и рынок моделей: OpenCode как слой между разработчиками и провайдерами с тринадцатью миллионами активных пользователей в месяц по словам её главы, Pi с четырьмя инструментами, mini-SWE-agent с сотней строк. У этой группы модель взаимозаменяема, обвязка тонкая, и конкуренция идёт ценой.09История OpenCode интересна тем, как январская попытка Anthropic отрезать чужую обвязку от подписок стала для неё ускорителем: людям захотелось посмотреть, что именно блокируют.Книжный куб · OpenCode как рынок моделей
Российский контур
Оговорка о площадке: этот текст написан к конференции Сбера, а ниже разбираются продукты Сбера, и все их цифры — заявления вендора. Российская ставка — готовая открытая обвязка плюс профиль под свою модель. GigaChain взяла Deep Agents от LangChain, подключила GigaChat правкой конфига и на внешнем соревновании получила с той же моделью шестьдесят семь задач против семидесяти у Claude Code, при том что Anthropic оптимизирует модель и обвязку друг под друга; профиль модели, описанный на Habr, поднял успех на внутреннем наборе с семидесяти семи до восьмидесяти семи процентов при вдвое меньшем расходе токенов. Yandex встроил в SourceCraft CLI открытый OpenCode. Т-Банк открыл торговлю внешним агентам через MCP — обвязка стала клиентом финансового сервиса. На Saint HighLoad++ в июле Райффайзен отчитался о четверти бэклога через агентов при четырёх процентах полностью автономных задач. Вывод для этого контура тот же, что я делал в июле, только теперь с числами: суверенитет обвязки дёшев — открытые ядра, стандартные протоколы, профиль за месяц, — суверенитет модели дорог, и обвязка его не заменяет.
Прогнозы на 2027–2031 годы: восемь ставок с признаками опровержения
Прогноз без признака опровержения — не прогноз, а настроение. Поэтому каждая из восьми ставок ниже привязана к году и к наблюдаемому признаку, по которому её можно будет назвать ошибочной. Класс всех восьми — авторский прогноз; опоры — метрики METR, отчёты DORA и JetBrains, анонсы вендоров и механизм коэволюции из третьего раздела. Общий вектор один: то, что можно натренировать, уйдёт в модель; то, что нельзя доверить, останется стеной и переедет к вендору; своим у компаний останутся задача, контекст, эпизоды и идентичность.
| Ставка | Проверяемый признак | Срок | Что опровергает |
|---|---|---|---|
| 1 · Управляемый рантайм станет способом поставки агента по умолчанию; собственный цикл — ниша комплаенса | Более половины новых корпоративных агентов у трёх крупных вендоров запускаются в их рантаймах | 2028 | Крупные компании продолжают писать общие циклы и публикуют это как норму |
| 2 · Уплотнение, консолидация памяти и порождение субагентов станут нативными в API | Три функции доступны без обвязки у двух и более лабораторий | 2027 | Обвязки продолжают нести собственные реализации как обязательные |
| 3 · Протоколы останутся нейтральными и скучными; конкуренция уйдёт в рантайм и модель | Ни один из четырёх стандартов не вернулся под контроль одной компании | 2028 | Форк протокола крупным вендором с несовместимыми расширениями |
| 4 · Цикл покинет человека: большинство запусков агентов — по событию, расписанию или сборке | В телеметрии вендоров доля запусков без интерактивного промпта выше половины | 2027 | Интерактивный терминал остаётся главным входом по числу запусков |
| 5 · Проверка станет крупнейшей частью обвязки: агент запускает продукт, а не только тесты | Экранное и браузерное подтверждение результата — стандартный шаг у ведущих обвязок | 2028 | Верификация остаётся на уровне «тесты прошли» |
| 6 · «Обвязка как ров» выживет только сросшейся с обученной моделью | Самостоятельные компании-обвязки поглощены или ушли к лабораториям | 2029 | Независимая обвязка без своей модели удерживает лидерство на своём рынке |
| 7 · Идентичность и аудит агента станут регуляторным требованием | Норматив хотя бы одной юрисдикции требует идентичность на прогон и журнал действий | 2028–2030 | Регуляторы ограничиваются моделями и не касаются рантайма |
| 8 · Эффект обвязки на фронтире сожмётся до статистического нуля, ниже фронтира — нет | Нейтральный и родной прогон фронтирных моделей не различимы; для открытых моделей разброс сохраняется | 2027 | Родные обвязки устойчиво обгоняют нейтральные на фронтире |
Несколько пояснений к ставкам, которые выглядят смелее других. Первая опирается на то, что три управляемых рантайма вышли за восемь недель, а не на веру в вендоров: когда три конкурента сходятся на одной архитектуре, архитектура становится ожиданием рынка. Вторая — на уже случившемся: рассуждение между вызовами и учёт контекста ушли в модель за год, и у уплотнения с памятью тот же тип. Четвёртая — на JetBrains, где девяносто процентов разработчиков используют агентов еженедельно и около половины кода полностью пишут агенты: следующий шаг после «каждый день» — «без меня». Седьмая — на инициативе NIST и на сентябрьском эссе Dario Amodei о «встроенных оценщиках»: когда лаборатория сама просит регулирование рантайма, оно приходит. Восьмая — прямое продолжение седьмого раздела и единственная ставка, у которой уже есть данные за 2026 год.
Горизонт всех ставок ограничен тем, что METR называет горизонтом задач: пятидесятипроцентный горизонт Opus 4.5 в январе 2026 года — триста двадцать минут с широким интервалом, удвоение за три-семь месяцев в зависимости от того, какой участок ряда брать. Если удвоение сохранится, к 2028 году агент будет держать задачу длиной в рабочую неделю, и обвязка для такой задачи — это уже не цикл, а операционная система с планировщиком, памятью и правами. Если удвоение замедлится, ставки один, четыре и пять сдвинутся на год-два, но направление не изменится: Gartner ещё в июне 2025 года обещал отмену больше сорока процентов агентных проектов к концу 2027 года, и выживут те, что наблюдаемы, ограничены и дёшевы в проверке — то есть те, у которых стены построены раньше слов.
Реестр обвязки: как вести предположения о модели
Из закона «каждая компонента кодирует предположение» следует практика, и она не чеклист. В сентябре я предлагал абляционный тест: взять характерные эпизоды, сравнить текущую модель с полной обвязкой, с упрощённой и новую модель с минимальной адаптацией, и удалить правило, которое больше ничего не улучшает. Тест — метод; ему нужна учётная форма. Я называю её реестром обвязки: для каждой компоненты — хука, правила, навыка, сброса, инструмента — записывается, какое предположение о модели она кодирует, каким доказательством оно подтверждено, при какой модели и версии, что запускает перепроверку и в каком режиме владения компонента живёт. Последняя колонка — из фреймворка границы владения: арендовать, адаптировать, владеть.10Sottiaux в интервью формулирует то же самое как инженерную дилемму: где исправлять проблему — в обвязке или ждать следующую модель, — и признаёт, что большой обходной механизм через месяц может оказаться ненужным.Книжный куб · Tibo Sottiaux о Codex
Реестр решает три задачи, которые чеклист не решает. Во-первых, он различает предположения и границы. Сброс контекста при шестидесяти процентах окна — предположение о нервной модели, и его надо перепроверять при каждой новой модели; хук, запрещающий деструктивные команды вне рабочего дерева, — граница, у которой триггер перепроверки «никогда», потому что она защищает от инъекции, а не от слабости модели. Во-вторых, он даёт срок годности: практика Cherny — каждые полгода удалять инструкции, навыки и хуки и возвращать построчно то, на чём модель спотыкается повторно, — становится не жестом смелости, а строкой с датой. Его же оценка, что эвалы переживают обвязку на одно-три поколения моделей, задаёт срок годности и доказательствам. В-третьих, он делает абляцию дешёвой: компонента без доказательства — первый кандидат на удаление, компонента с инцидентом вместо эпизодов — последний.
| Компонента | Предположение о модели | Доказательство | Дата и модель | Триггер | Режим |
|---|---|---|---|---|---|
| Сброс контекста при 60 % окна | Модель «нервничает» у границы контекста и сворачивает работу | 30 эпизодов до и после удаления: разницы нет | Введено при Sonnet 4.5, проверено при Opus 4.5 | Новая модель | Удалить |
| Хук перед вызовом: запрет деструктивных команд вне рабочего дерева | Инъекция в прочитанном тексте может дать деструктивную команду | Инцидент, не эпизоды | Любая модель | Никогда — это граница, а не предположение | Своё |
| Навык «релизный чеклист» на 400 строк | Модель забывает шаги выпуска | Не проверено | Написан под модель прошлого года | Каждые шесть месяцев | Адаптировать или удалить |
- Заводите строку реестра при добавлении любой компоненты обвязки, а не при аудите
- Доказательство — воспроизводимые эпизоды до и после; инцидент — доказательство только для границ
- Триггер «новая модель» запускает абляцию всех строк с предположениями; строки-границы абляции не подлежат
- Режим владения выбирается по фреймворку границы владения, а не по привычке
Пример в таблице условный, и это важно сказать прямо: реестр — инструмент, который я предлагаю, а не отчёт о том, что уже ведётся. Проверить его можно одним способом — завести на своём парке агентов и посмотреть, сколько строк окажется без доказательства. Мой прогноз: больше половины, и почти все они будут словами, а не стенами.
Семь выводов об обвязке
- 01Обвязка мигрирует из слов в стены. Инструкции — системный промпт, навыки, описания инструментов — сжимаются до карт, а границы и среда — хуки, права, песочницы, идентичность, устойчивое выполнение — растут. Стены не ведут модель за руку: они очерчивают поле, и внутри него модели дают больше свободы, чем год назад. Парадокс «девяносто процентов результата» и «минус восемьдесят процентов промпта» — не спор о моделях, а описание двух разных частей одной обвязки.
- 02Два смысла слова сходятся. Обвязка, в которой модель работает, и среда, в которой её обучают, всё чаще одна и та же: Cursor, Cognition и DeepSeek говорят об этом прямо. Поэтому чужая обвязка на фронтире структурно проигрывает родной — и именно поэтому разница между ними на фронтире измеряется единицами пунктов.
- 03Обвязка стала раскрываемой переменной оценки. Одна модель в разных обвязках даёт от нескольких до пятидесяти пунктов разницы, и протоколы оценки приписывают этот выигрыш модели. Обвязка в отчёте об измерении обязательна так же, как версия модели.
- 04Оркестрация и долгие циклы стали инфраструктурой. Три вендора за восемь недель выпустили управляемые рантаймы, цикл агента живёт в движках устойчивого выполнения, визуальные конструкторы уходят. «Граница своего» сжалась до задачи, контекста, эпизодов и идентичности.
- 05Каждая компонента обвязки кодирует предположение о том, чего модель не умеет. Предположения устаревают за одно-три поколения моделей, поэтому их надо вести реестром с датой перепроверки, а не чеклистом с галочками.
- 06Самомодифицирующиеся обвязки оптимизируют ту награду, которую им выдали: первая же из них удалила маркеры, по которым ловили галлюцинации. Без реестра и скрытого судьи автоэволюция обвязки — это закон Гудхарта, которому дали автомат.
- 07К 2028 году обвязка как отдельно называемый продукт растворится в API модели и управляемом рантайме. Видимыми останутся границы, эпизоды и идентичность. Признак опровержения — независимые компании-обвязки без своей модели, удерживающие лидерство на своих рынках.
Документация, исследования, записи выступлений и границы доказательности
Список сгруппирован по разделам. Рядом с каждым числом в статье названа база сравнения; у заявлений компаний указано, что это заявление. Документация продуктов и спецификации фиксируют состояние на дату проверки — 18 сентября 2026 года. Записи выступлений приведены через мои разборы в «Книжном кубе», которые фиксируют, что именно было сказано. Полное досье с классами утверждений, противоречиями между источниками и списком неподтверждённого лежит в репозитории сайта рядом с этой статьёй.
Определения и термин
- Anthropic · Claude Code docs: Glossary — 18 сентября 2026 года: «агентная обвязка — инструменты, управление контекстом и среда исполнения… Claude Code — обвязка, Claude — модель внутри»; определение вендора
- LangChain (Vivek Trivedy) · The Anatomy of an Agent Harness — 10 марта 2026 года: «обвязка — весь код, конфигурация и логика исполнения, которые не являются моделью»; формула «агент = модель + обвязка»; вендор фреймворка
- Birgitta Böckeler (martinfowler.com) · Harness engineering for coding agent users — 2 апреля 2026 года: обвязка — «всё в агенте, кроме модели»; деление на направляющие и датчики
- Anthropic (Prithvi Rajasekaran) · Harness design for long-running application development — 24 марта 2026 года: «каждая компонента обвязки кодирует предположение о том, чего модель не умеет»; Opus 4.6 снял нужду в спринтах и сбросах контекста; полная обвязка 6 часов и $200 против 20 минут и $9 у одиночного агента — один эксперимент
- Anthropic (Martin, Cemaj, Cohen) · Scaling Managed Agents: Decoupling the brain from the hands — 8 апреля 2026 года: обвязка — «цикл, который вызывает Claude и направляет вызовы инструментов к инфраструктуре»; «мозг» и «руки»; предположения обвязки «устаревают по мере роста моделей»; рассказ вендора о своём продукте
- Hugging Face (Paniego, Gosthipaty) · The Agent Glossary — 25 мая 2026 года: обвязка определена как слой исполнения, а леса — как слой поведения; авторы оговаривают, что общепринятых определений нет; определения обратны словоупотреблению Anthropic 2025 года
- Prime Intellect · verifiers v1 — 10 июля 2026 года: среда обучения = набор задач («данные, инструменты, скоринг») + обвязка («программа, которая решает задачу»); одна конфигурация для оценки и обучения; документация вендора
- Addy Osmani · The New Software Lifecycle (блог-версия whitepaper Google «The New SDLC With Vibe Coding») — 16 июня 2026 года: «агент — это модель плюс обвязка», деление «10 % модель, 90 % обвязка» — оценка авторов, не замер; из-за пределов топ-30 в топ-5 Terminal-Bench 2.0 сменой обвязки; LangChain +13,7 балла
- Книжный куб · The New SDLC: harness, factory model и экономика agentic engineering — 21 июня 2026 года: разбор второй половины отчёта Google — формула «агент = модель + обвязка», заводская модель, роли дирижёра и оркестратора
- Книжный куб · Loop Engineering: почему главная часть агентного цикла — это право сказать «нет» — 14 июля 2026 года: лестница «промпт → контекст → обвязка → цикл» и пять движений цикла; материал HuaShu — рабочий конспект, не публикация Anthropic
Эпохи и история
- EleutherAI · lm-evaluation-harness — Открыт 18 сентября 2026 года: «фреймворк для few-shot-оценки языковых моделей» — в мир моделей слово пришло как название прогонщика оценки
- Simon Willison · OpenAI function calling — 13 июня 2023 года: модели gpt-4-0613 и gpt-3.5 принимают JSON-схемы функций и возвращают структурированный вызов — первая функция обвязки, ушедшая в API
- Yang et al. (Princeton) · SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering — 6 мая 2024 года (v1): интерфейс агента с компьютером (ACI) заметно улучшает создание и правку файлов, навигацию по репозиторию и запуск тестов; в аннотации нет ни слова «обвязка», ни слова «леса»
- OpenAI · Introducing SWE-bench Verified — Август 2024 года: обёртка вокруг модели названа лесами (Agentless), а обвязкой — контейнерный прогонщик оценки; страница обновлена 24 февраля 2025 года
- Anthropic · Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku — 22 октября 2024 года: «мы учим модель общим навыкам работы с компьютером, а не делаем отдельные инструменты»; OSWorld 14,9 % по скриншотам против 7,8 % у следующей системы; «пока громоздко и подвержено ошибкам»
- Anthropic · Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet — 6 января 2025 года (дата после миграции страницы): «агент — сочетание модели и программных лесов вокруг неё»; «дать максимум контроля самой модели и держать леса минимальными»
- Anthropic · Introducing Claude 4 — 22 мая 2025 года: результаты SWE-bench получены «на том же простом каркасе с двумя инструментами — bash и редактированием файлов»; выпуск Claude Code в общую доступность
- Anthropic · Introducing Claude Sonnet 4.5 — 29 сентября 2025 года: «более 30 часов» фокуса на многошаговых задачах — заявление вендора; Agent SDK на «той же инфраструктуре, что Claude Code»; редактирование контекста и инструмент памяти в API
- Anthropic (Thariq Shihipar) · Building agents with the Claude Agent SDK — 29 сентября 2025 года: «обвязка, на которой работает Claude Code, может питать много других типов агентов»; цикл «собрать контекст → действовать → проверить → повторить»
- Anthropic (Justin Young) · Effective harnesses for long-running agents — 26 ноября 2025 года: агент-инициализатор создаёт скрипт запуска, файл прогресса и список функций; следующий экземпляр «оглядывался, видел, что прогресс есть, и объявлял работу сделанной»
- Linux Foundation · Announces the Formation of the Agentic AI Foundation — 9 декабря 2025 года: восемь платиновых членов, включая Anthropic, Google, Microsoft и OpenAI; переданы MCP, goose и AGENTS.md; «более 10 000 опубликованных MCP-серверов»; AGENTS.md «принят более чем 60 000 проектов»
- Andrej Karpathy · 2025 LLM Year in Review — 19 декабря 2025 года: «Claude Code стал первой убедительной демонстрацией того, как выглядит LLM-агент»
- Mitchell Hashimoto · My AI Adoption Journey — 5 февраля 2026 года: «не знаю, есть ли принятый термин, но я стал называть это инженерией обвязки»; правило — каждую ошибку агента превращать в решение, после которого она невозможна
- Книжный куб · Harness: почему один агент с файлами вытесняет сложные обвязки (Крестников, Data Fest 2026) — 15 августа 2026 года: периодизация от чистых LLM до одного агента в пространстве файлов; «LLM — тяговая сила, файлы — поле, обвязка — упряжка»; Claude Code с Sonnet — 70 из 104 задач, DeepAgents с той же моделью — 67; заявления команды GigaChain (Сбер)
Коэволюция модели и обвязки
- Simon Willison · OpenAI Structured Outputs — 6 августа 2024 года: схема компилируется в контекстно-свободную грамматику; прежний JSON-режим обещал только валидный синтаксис, а не соответствие схеме, и, по словам автора, «ни один из этих режимов не гарантировал валидный JSON»
- Anthropic · Claude docs: Extended thinking — 18 сентября 2026 года: рассуждение между вызовами инструментов требовало beta-заголовка в Claude 4, в 4.6 и новее включается автоматически, в 4.7 и новее ручной режим отклоняется — флаг обвязки растворился в поведении модели
- Anthropic · Claude docs: Context windows — 18 сентября 2026 года: окно в миллион токенов по умолчанию и по стандартной цене у моделей 4.6 и новее; деградация с ростом длины входа названа в документации своим именем; Sonnet 4.5–5 получают теги остатка бюджета от API, Opus 4.7 и новее — нет
- Simon Willison · GPT-5.1-Codex-Max — 19 ноября 2025 года: OpenAI — «первая модель, обученная работать через несколько контекстных окон с помощью уплотнения»; Willison напоминает, что Claude Code уже делал авто-суммаризацию в обвязке
- Anthropic · Claude docs: Compaction — 18 сентября 2026 года: серверное уплотнение с порогом по умолчанию 150 000 токенов и минимумом 50 000; промпт сводки «зависит от модели» и заменяется разработчиком; уплотнение в SDK помечено устаревшим
- Anthropic · Claude Code CHANGELOG — 18 сентября 2026 года, версия 2.1.271: «инструменты трекинга задач теперь предлагаются только Claude 3.x и Opus 4.0–4.7» — компонент обвязки снят для моделей новее
- Cursor · Composer: Building a fast frontier model with RL — 29 октября 2025 года: в обучении с подкреплением модель «может вызывать любой инструмент обвязки Cursor Agent»; «сотни тысяч параллельных песочниц»; заявление вендора
- Cursor · Composer 2 technical report — 27 марта 2026 года: «обучение проходит в реалистичных сессиях Cursor с теми же инструментами и обвязкой, что у развёрнутой модели»; заявление вендора
- Cursor · Real-time RL for Composer — 26 марта 2026 года: контрольные точки модели «примерно каждые 5 часов»; пользователь — часть среды обучения; +2,28 % устойчивости правок, −3,13 % недовольных ответов, −10,3 % задержки — внутренние метрики
- Cognition · SWE-1.5 — 29 октября 2025 года: «обучение с подкреплением на реальных средах задач с нашей обвязкой Cascade»; «переобучили модель на обновлённой обвязке»; 950 токенов в секунду; заявление вендора
- VentureBeat · OpenAI unveils GPT-5-Codex, optimized for agentic coding — 15 сентября 2025 года: модель «обучена на реальной инженерной работе»; рекомендована «только для агентных задач в Codex или Codex-подобных средах»; сама обвязка обучения не названа
- Qwen · Qwen3-Coder — 22 июля 2025 года: «долгогоризонтное RL (Agent RL)» в «20 000 независимых средах параллельно»; терминальный клиент адаптирован из Gemini CLI; заявление вендора
- Zhipu · GLM-5 — 17 февраля 2026 года: более 10 000 верифицируемых сред в формате Harbor, точность сборки Docker выше 90 % — обучающие среды буквально в формате бенчмарка; заявление вендора
- DeepSeek · deepseek-harness — 18 сентября 2026 года: сессия как журнал типизированных событий только для дописывания; минимальный пресет описан как композиция RL-агента с постоянной оболочкой и редактором строк; открытый код показывает возможность, а не политику данных
- Книжный куб · DeepSeek Harness: когда история агента становится частью экономики инференса — 18 августа 2026 года: почему уплотнение повторяет прежний префикс байт в байт, и почему контур «обвязка → траектории → дообучение → та же обвязка» — архитектурная возможность, а не доказанная практика
- Anthropic · Introducing Claude Opus 4.6 — 5 февраля 2026 года: Terminal-Bench 2.0 — «все прогоны в обвязке Terminus-2, кроме Codex CLI»; многоагентная обвязка подняла BrowseComp до 86,8 %; правка промпта дала 81,42 % на SWE-bench; заявление вендора
- arXiv 2604.25850 · Agentic Harness Engineering — 28 апреля 2026 года: GPT-5.4 на Terminal-Bench 2.0 — 69,7 % с исходной обвязкой, 71,9 % с Codex CLI, 77,0 % с эволюционировавшей; перенос обвязки на другие модели даёт +2,3…+10,1 п.п.
- arXiv 2606.25514 · icat-agent — 24 июня 2026 года: GPT-5.4-xhigh на SWE-bench Pro — 59,1 % у лучшего прежнего каркаса против 67,4 % у нового
- Sakana AI · Darwin Gödel Machine — 30 мая 2025 года: самомодифицирующийся агент поднял SWE-bench с 20,0 до 50,0 % и Polyglot с 14,2 до 30,7 %; при этом «удалил маркеры, по которым функция награды ловила галлюцинации, вопреки прямой инструкции»
- Hu, Lu, Clune · Automated Design of Agentic Systems — 15 августа 2024 года: «мета-агент итеративно программирует новых агентов на основе растущего архива прежних находок» — предшественник самомодифицирующихся обвязок
- Google DeepMind · AlphaEvolve impact — 7 мая 2026 года: −30 % ошибок в DeepConsensus, −20 % write amplification в Spanner — результаты вендора на собственных системах
- arXiv 2604.16968 · On Safety Risks in Experience-Driven Self-Evolving Agents (ACL 2026) — 18 апреля 2026 года: опыт, накопленный на безобидных задачах, «всё равно может подорвать безопасность в рискованных сценариях»; опыт «усиливает склонность действовать, а не отказываться»
- Manus (Peak Ji) · Context Engineering for AI Agents: Lessons from Building Manus — 18 июля 2025 года: «мы перестроили каркас агента четыре раза»; «если прогресс моделей — прилив, мы хотим быть лодкой, а не сваей»
- Philipp Schmid · The importance of Agent Harness in 2026 — 5 января 2026 года: обвязка — «инфраструктура вокруг модели для долгих задач, не сам агент»; модель как процессор, контекст как память, обвязка как операционная система; пять рефакторингов Manus за полгода
- Anthropic · Effective context engineering for AI agents — 29 сентября 2025 года: «более умные модели требуют менее предписывающей инженерии»; контекст — конечный ресурс с «бюджетом внимания»; уплотнение, заметки и субагенты как три техники для задач длиннее окна
Инструкции, цикл и контекст
- YC Root Access · Boris Cherny: Building Claude Code — 27 июля 2026 года: «мы удалили 80 % системного промпта — Opus 5 просто это делает»; переменная, отключающая все промпты; «удалить целиком и возвращать построчно»; «каждые полгода удаляйте инструкции, навыки, хуки»; «эвалы переживают обвязку на одно-три поколения»; самоотчёт сотрудника вендора
- Книжный куб · Boris Cherny: We Cut 80% of Claude Code's Prompt (YC Startup School 2026) — 17 августа 2026 года: разбор выступления на следующий день после релиза Opus 5 — «без измеримой потери качества на их кодинг-эвалах» со слов докладчика; нераскрытый потенциал модели; сдвиг от промптов через контекст к постановке задачи
- Книжный куб · Nick Nisi про agent skills: меньше инструкций, больше доказательств (доклад «How I deleted 95% of my agent skills and got better results») — 11 июля 2026 года: доклад о том, как автор удалил 95 % навыков агента и получил результат лучше (AI Engineer Europe, 10 апреля 2026); 10 739 строк сгенерированных инструкций; управление потоком перенесено в машину состояний с обязательными проверками; самоотчёт инженера
- Vercel · We removed 80% of our agent's tools — 22 декабря 2025 года: агент сведён к одному инструменту bash — в 3,5 раза быстрее, −37 % токенов, −42 % шагов, успех 80 → 100 % на пяти внутренних запросах; «модель принимает лучшие решения, когда мы перестаём принимать их за неё»; заявление вендора
- Книжный куб · Andrew Qu (Vercel): How We Solved Agent Building — 16 сентября 2026 года: путь d0 от большого промпта через цепочку специалистов к одному агенту с рабочим каталогом; вклад архитектуры и более сильной модели в удвоение оценки не разделён
- Книжный куб · Kyle Mistele: Loop Engineering from First Principles — 30 августа 2026 года: цикл агента как контур управления — уставка, датчик, регулятор, исполнитель; модель нужна далеко не везде; докладчик — сооснователь вендора
- AGENTS.md — 18 сентября 2026 года: «используется более чем 60 000 открытых проектов» (цифра декабря 2025 года); 24 поддерживающих инструмента; стандарт под управлением фонда AAIF
- Lulla et al. · AGENTS.md study (arXiv 2601.20404) — 28 января 2026 года (v2 — 30 марта): на 124 PR из 10 репозиториев наличие AGENTS.md связано с −28,64 % медианного времени и −16,58 % выходных токенов при сопоставимом завершении задач; корреляция, не эксперимент
- Vercel · AGENTS.md outperforms skills in our agent evals — 27 января 2026 года: сжатый индекс документации на 8 КБ в AGENTS.md дал 100 % на эвалах по API Next.js 16, навыки — максимум 79 %; внутренний эвал вендора
- Agent Skills · Specification — 18 сентября 2026 года: файл SKILL.md с именем до 64 и описанием до 1024 символов; прогрессивное раскрытие — метаданные (~100 токенов) → инструкции (до 5 000 токенов) → ресурсы по требованию; на витрине 46 клиентов
- Geoffrey Huntley · Ralph Wiggum as a “software engineer” — 14 июля 2025 года: «в чистом виде Ralph — это bash-цикл», который снова и снова подаёт один промпт агенту
- Anthropic · claude-code/plugins/ralph-wiggum — 18 сентября 2026 года: официальный плагин реализует цикл через Stop-хук, «блокируя обычный выход из сессии», с ограничением итераций и обещанием завершения
- Anthropic · Claude Code docs: /goal — 18 сентября 2026 года: критерий завершения проверяет «свежая модель, а не та, что делает работу» (по умолчанию Haiku); условия должны называть проверку, а не намерение
- Anthropic · Claude Code docs: Scheduled tasks (/loop) — 18 сентября 2026 года: повтор по фиксированному интервалу или в самотемпе от минуты до часа, привязка к сессии, срок семь дней
- Anthropic · Claude Code docs: Checkpointing — 18 сентября 2026 года: каждая реплика создаёт контрольную точку, хранятся 100 последних; «изменения файлов командами bash не отслеживаются»
- Anthropic · A harness for every task: dynamic workflows in Claude Code — 2 июня 2026 года: «Claude теперь может писать собственную обвязку на лету под конкретную задачу» — сценарий оркестрации порождается на каждую задачу; заявление вендора
- Anthropic · Agent SDK docs: The agent loop — 18 сентября 2026 года: цикл завершается ответом без вызовов инструментов; жёсткие пределы по числу ходов и по бюджету в долларах, бюджет покрывает субагентов
- Chroma (Hong, Troynikov, Huber) · Context Rot — 14 июля 2025 года: 18 моделей; «модели не сохраняют стабильное качество при росте длины входа» даже на простых задачах
- Anthropic · Claude Code docs: Context window — 18 сентября 2026 года: автоуплотнение сначала очищает старые выводы инструментов, затем суммирует; порог около 967 000 токенов на моделях с миллионным окном; после уплотнения перечитываются до пяти изменённых файлов
Границы, инструменты и стандарты
- Anthropic · Claude Code docs: Permissions — 18 сентября 2026 года: «правила прав исполняет Claude Code, а не модель. Инструкции в промпте или CLAUDE.md определяют, что Claude пытается сделать, но не меняют того, что Claude Code разрешает»
- Anthropic · Claude Code docs: Memory — 18 сентября 2026 года: CLAUDE.md «не является слоем жёсткого принуждения»; «чтобы заблокировать действие независимо от решения Claude, используйте хук PreToolUse»; цель — файл короче 200 строк
- Anthropic · Claude Code docs: Hooks guide — 18 сентября 2026 года: таблица из 33 событий; код выхода 2 блокирует действие; решение deny/defer/ask/allow, самое строгое побеждает; «некоторые действия происходят всегда, а не по выбору модели»
- Anthropic · Claude Code docs: Permission modes — 18 сентября 2026 года: шесть режимов; в режиме auto «отдельная модель-классификатор проверяет действия до выполнения и блокирует всё, что выходит за рамки запроса»; некоторые действия не автоодобряются ни в одном режиме
- Anthropic · Beyond permission prompts: making Claude Code more secure and autonomous — 20 октября 2025 года: песочница на bubblewrap и Seatbelt «сокращает запросы на подтверждение на 84 %» и покрывает «любые скрипты, программы и подпроцессы»; внутренняя телеметрия вендора
- OpenAI · Codex docs: Sandboxing — 18 сентября 2026 года: два слоя вне модели — режим песочницы (что технически возможно) и политика подтверждений (когда спрашивать); «вы доверяете не намерениям агента, а тому, что он действует внутри принудительных границ»
- Anthropic · Claude Code docs: Security — 18 сентября 2026 года: сетевые команды не автоодобряются, веб-загрузка идёт в отдельном окне контекста, учётные данные маскируются, «все операции в облачных сессиях журналируются»; Anthropic «не аудирует MCP-серверы»
- Anthropic · Claude docs: Tool search tool — 18 сентября 2026 года: до 10 000 отложенных инструментов; определения на ~55 000 токенов сокращаются «более чем на 85 %»; точность падает «после 30–50 доступных инструментов»; заявление вендора
- Anthropic · Claude docs: Programmatic tool calling — 18 сентября 2026 года: модель пишет код в контейнере и вызывает инструменты из него, в контекст возвращается только вывод скрипта; «в среднем +11 % качества при −24 % входных токенов»; заявление вендора
- Cloudflare (Varda, Pai) · Code Mode — 26 сентября 2025 года: инструменты MCP превращаются в TypeScript API, модель пишет код, который исполняется в изоляте; «модели видели много кода и мало вызовов инструментов»
- Model Context Protocol · Specification 2026-07-28: Changelog — 28 июля 2026 года: протокол стал stateless — убраны рукопожатие и идентификатор сессии; появились обнаружение серверов и подписки; задачи вынесены в расширение; динамическая регистрация OAuth-клиентов устарела; контекст трассировки в метаданных; минимум двенадцать месяцев на вывод функции
- Linux Foundation · Agentic AI Foundation adds 43 new members — 18 мая 2026 года: 190 членов; среди новых золотых — F5, GoDaddy, Stripe; среди государственных — U.S. Army, PNNL, Sandia
- Linux Foundation · Agentic AI Foundation launches MCPA certification — 14 сентября 2026 года: первая сертификация фонда; SDK на TypeScript и Python — «более миллиарда суммарных загрузок»; «MCP быстро стал стандартом подключения агентов к внешним системам»
- Linux Foundation · A2A protocol surpasses 150 organizations — 9 апреля 2026 года: более 150 организаций, 22 000+ звёзд, SDK на пяти языках, версия 1.0 с подписанными карточками агентов; 27 августа 2026 года протокол принят в фонд AAIF
- Okta · Agent SSO — 24 августа 2026 года: Cross App Access «формально включён как официальное расширение Enterprise-Managed Authorization для MCP»; агенты как «полноправные идентичности в каталоге» с общей доступности 30 апреля 2026 года
- NIST/CAISI · Announcing the AI Agent Standards Initiative — 17 февраля 2026 года: три опоры — отраслевые стандарты, открытые протоколы, исследования безопасности и идентичности агентов; концепт-документ по идентичности и авторизации
- OWASP · Top 10 for Agentic Applications for 2026 — 9 декабря 2025 года: от захвата цели агента (ASI01) до мошеннических агентов (ASI10); более ста экспертов
- OpenTelemetry · Semantic conventions for generative AI — 18 сентября 2026 года: конвенции перенесены в отдельный репозиторий; на середину июля 2026 года все элементы gen_ai в статусе «Development» — стабильного релиза нет
- InfoQ · Claude Code source leak — 7 апреля 2026 года: пакет версии 2.1.88 содержал source map с ~1 906 файлами TypeScript; Anthropic назвала это «ошибкой упаковки релиза, а не нарушением безопасности»; содержимое в статью не берётся
- Anthropic · Demystifying evals for AI agents — 9 января 2026 года: задача, прогон, оценщик, транскрипт, результат; метрика хотя бы одного успеха из k попыток против метрики всех k успехов — «вероятность, что все k попыток успешны»; начинать с 20–50 задач из реальных отказов
- Docker · Docker Sandboxes: run Claude Code and other coding agents unsupervised but safely — 30 января 2026 года: песочницы на выделенных микро-ВМ «добавляют жёсткую границу безопасности»; поддержаны Claude Code, Copilot CLI, Codex CLI, Gemini CLI, Kiro
- Anthropic · Claude Code docs: Worktrees — 18 сентября 2026 года: отдельное рабочее дерево на сессию или субагента; четыре проверки блокируют правки и git-операции в основном checkout; Cursor 2.0 (29 октября 2025 года) запускал до восьми агентов на рабочих деревьях или удалённых машинах
- SWE-agent · mini-SWE-agent — 18 сентября 2026 года: около ста строк, «нет никаких инструментов, кроме bash», линейная история; «выше 74 % на SWE-bench Verified»
- Mario Zechner · pi-mono — 18 сентября 2026 года: четыре инструмента, короткий промпт, расширения на TypeScript; намеренно без MCP и субагентов; лицензия MIT
Оркестрация и инфраструктура
- Anthropic · Claude Code docs: Subagents — 18 сентября 2026 года: субагент работает в своём окне контекста и «возвращает только сводку»; вложенность до трёх уровней, до 20 параллельных; изоляция в рабочем дереве
- Anthropic · Claude Code docs: Agent teams — 18 сентября 2026 года: ведущий и участники с общим списком задач и почтовыми ящиками; «команды используют значительно больше токенов, чем одна сессия»; «участник не может одобрить запрос прав от вашего имени»
- Anthropic · Claude Code docs: Projects — 18 сентября 2026 года (публичная бета): одна координирующая беседа порождает потоки — облачные сессии на своих ветках; общие инструкции до 16 000 символов и память проекта
- Anthropic · Claude Code docs: Routines — 18 сентября 2026 года (research preview): запуск по расписанию, событию GitHub или API; без запросов прав во время прогона; текст API-триггера приходит помеченным как недоверенный
- Temporal · Temporal raises $550M at a $12.55B valuation — 14 сентября 2026 года: раунд E на $550 млн при оценке $12,55 млрд «на фоне спроса на надёжную инфраструктуру для AI»; в феврале — $300 млн при $5 млрд; заявление компании
- Cloudflare · Workflows GA: production-ready durable execution — 7 апреля 2025 года: шаги с ожиданием события и сна — пауза цикла ради подтверждения человеком встроена в движок
- Inngest (Charly Poly) · Durable execution: the key to harnessing AI agents — 19 февраля 2026 года: «это особенно ценно для вызовов моделей, где повторное исполнение означает повторную оплату токенов»; блог вендора
- Книжный куб · Cursor Cloud Agents: что отдать агенту, а что оставить платформе — 14 августа 2026 года: по июньскому разбору Cursor — процедурная логика переезжает из обвязки в инструменты, среда стала частью качества, цикл живёт в Temporal, а «один агент» распадается по времени жизни и владельцу состояния
- Anthropic · Claude Managed Agents — 8 апреля 2026 года: «готовая настраиваемая обвязка агента в управляемой инфраструктуре»; агент, среда, сессия, события; облачные или собственные песочницы; $0,08 за час активной сессии сверх токенов; ранние клиенты Notion, Rakuten, Asana, Sentry
- Книжный куб · Evolution of Agentic Surfaces: harness становится инфраструктурой — 21 августа 2026 года: три поколения поверхностей — Messages API, Agent SDK, Managed Agents; тревога Sonnet 4.5 у границы контекста и сброс контекста, ставший оверхедом при Opus 4.5; разделение «мозга» и «рук» дало −60 % времени до первого токена в медиане; рассказ вендора
- Google Developers Blog · All the news from the Google I/O 2026 developer keynote — 19 мая 2026 года: Managed Agents в Gemini API — один вызов поднимает удалённую Linux-песочницу, конфигурация через AGENTS.md и SKILL.md; Antigravity 2.0, CLI и SDK с «программным управлением обвязкой»; WebMCP в Chrome 149
- Microsoft (Shawn Henry) · Microsoft Agent Framework at Build 2026 — 3 июня 2026 года: «Agent Harness» с автоуплотнением, файловой памятью и оболочкой; Foundry Hosted Agents; CodeAct — агент пишет Python для вызова инструментов, задержка −52,4 %; заявление вендора
- OpenAI · Agent Builder guide — 18 сентября 2026 года: визуальный конструктор «планируется закрыть 30 ноября 2026 года»; ChatKit и Agents SDK остаются
- Anthropic · How we built our multi-agent research system — 13 июня 2025 года: оркестратор с исполнителями на 90,2 % лучше одиночного Opus 4 на внутренних эвалах при примерно 15-кратном расходе токенов; заявление вендора
- Cognition (Walden Yan) · Don't Build Multi-Agents — 12 июня 2025 года: «делитесь контекстом и полными трейсами, а не отдельными сообщениями»; действия несут неявные решения, и конфликтующие решения дают плохой результат; позиция вендора
- Stripe (Alistair Gray) · Minions: Stripe's one-shot, end-to-end coding agents — 9 февраля 2026 года: «более 1 300 PR в неделю» полностью произведены агентами и проверены людьми; форк goose; Blueprints сочетают детерминизм процессов с гибкостью агентов; самоотчёт компании
- Spotify Engineering · Background coding agents: dataset migrations (Honk, part 4) — 22 апреля 2026 года: агенты на Claude Code провели 240 PR миграций и сэкономили около десяти инженерных недель; навыки и настраиваемость отключены «намеренно ради ограждений»; самоотчёт компании
- Cloudflare (Ryan Skidmore) · AI code review at scale — 20 апреля 2026 года: 131 246 прогонов на 48 095 запросов на слияние за месяц, $1,19 за прогон в среднем, 0,6 % обходов «break glass», отдельный проверяющий для AGENTS.md; самоотчёт компании
- Simon Willison · Code w/ Claude 2026 (live blog) — 6 мая 2026 года: многоагентные Managed Agents, целевые результаты, «сновидения» памяти, Routines; «большинство людей будут взаимодействовать с AI через то, что вы построили на платформе Claude» (Ami Vora)
Границы эффекта
- METR · Measuring time horizon using Claude Code and Codex — 13 февраля 2026 года: «Claude Code и Codex не очевидно лучше дефолтных каркасов, которые мы используем»; Opus 4.5 в Claude Code лучше ReAct в 50,7 % бутстрэп-выборок, GPT-5 в Codex лучше Triframe в 14,5 %
- Terminal-Bench · Harbor-Index — 29 июня 2026 года: «родная обвязка обычно чуть впереди Terminus-2… но ни одно сравнение не является статистически значимым»
- arXiv 2609.04298 · Harbor adapters: Terminus-2 vs native harnesses — 3 сентября 2026 года: каждая модель прогнана в Terminus-2 и в одной из трёх родных обвязок; лучший результат — GPT-5.5 с Codex, 28,0 %
- Lee et al. (Stanford) · Meta-Harness — 30 марта 2026 года: во введении — «смена обвязки вокруг фиксированной модели может дать шестикратный разрыв»; собственные числа на Terminal-Bench 2.0 скромнее: Opus 4.6 — 74,7 → 76,4 %, Haiku 4.5 — 33,7 → 37,6 %
- arXiv 2606.12344 · Claw-SWE-Bench — 10 июня 2026 года: GLM 5.1 — 19,1 % с минимальным адаптером против 73,4 % с полным; при фиксированной модели выбор обвязки сдвигает результат в среднем на 27,4 п.п.
- arXiv 2605.23950 · Stop Comparing LLM Agents Without Disclosing the Harness — 7 мая 2026 года: «текущие протоколы оценки систематически приписывают выигрыш от обвязки улучшениям модели»
- TechCrunch · Nvidia just showed that the harness, not the AI model, is now the real hero — 21 августа 2026 года: по работе исследователей Nvidia Opus 5 на ARC-AGI-3 даёт 100 % с обвязкой против 30 % без неё; верификация ARC Prize в статье не упомянута
- Книжный куб · Harness Engineering is not Enough: Why Software Factories Fail (Dex Horthy) — 25 августа 2026 года: сноска к формуле «агент = модель + обвязка» — обвязка улучшает исполнение, но не учит держать качество архитектуры на длинной дистанции; быстрого верификатора сопровождаемости нет; докладчик — сооснователь вендора
- Книжный куб · YC Paper Club: Why The Harness Matters More Than The Model — 15 сентября 2026 года: четыре инженерных выступления о том, что меняется, когда той же модели дают больше среды; история про 99,9 % на ARC-AGI, оказавшиеся жульничеством после просмотра логов
- Thoughtworks · Technology Radar Vol. 34 — 15 апреля 2026 года: темы «посадить кодовых агентов на поводок» и «обезопасить жадных до прав агентов»; «команды начинают итерировать обвязки кодовых агентов» — направляющие вроде навыков и спецификаций, датчики вроде мутационного тестирования
- InfoQ (Matt Saunders) · DORA report on the ROI of AI-assisted software development — 11 мая 2026 года: 35–40 % выигрыша на новых задачах и около 10 % на легаси; модельный расчёт на 500 инженеров — 39 % ROI, окупаемость около восьми месяцев, доля неудачных изменений 5 → 6 %
- METR · Uplift update — 24 февраля 2026 года: для исходной когорты «ускорение −18 % с интервалом от −38 % до +9 %», для новой — −4 % (от −15 % до +9 %); 30–50 % разработчиков не сдавали часть задач без AI
Ставки лабораторий
- VentureBeat (Michael Nuñez) · Anthropic says it hit a $30 billion revenue run rate — 8 мая 2026 года: run-rate $30 млрд; Claude Code — «более $2,5 млрд» run-rate к февралю, бизнес-подписки ×4 с начала года; «большинство кода теперь пишет Claude Code» внутри компании; цифры компании
- Fortune (Jeremy Kahn) · OpenAI touts Codex growth — 4 марта 2026 года: 1,6 млн еженедельных пользователей; Thibault Sottiaux: Codex «становится стандартным агентом»; «если мы сумеем правильно его изолировать… дать силу кодовых агентов миллиардам пользователей»
- Constellation Research (Larry Dignan) · OpenAI touts broadening Codex usage — 2 июня 2026 года: более 5 млн еженедельных пользователей Codex, пятая часть — не разработчики; цифры компании
- The Deep View (Jason Hiner) · OpenAI's secret weapon underneath Codex — 29 июля 2026 года: Joe Gershenson — «обвязка — это то, как модель взаимодействует с миром и как мы выражаем её возможности»
- Книжный куб · Building Codex with Tibo Sottiaux (The Pragmatic Engineer) — 12 сентября 2026 года: ядро Codex на Rust отделено от интерфейсов; «часть обвязки должна уметь отмирать» — напоминание запускать тесты уходит в модель; «за выходные к проекту можно подключить сотню агентов»
- TechRadar via Yahoo · OpenAI says it built an automated research intern — 10 сентября 2026 года: OpenAI объявила «автоматизированного исследователя-стажёра» и признала, что «всё ещё учится измерять» такую работу; самодекларация
- Gemini CLI · уведомление о переходе на Antigravity CLI — 18 сентября 2026 года: «для бесплатного тарифа и пользователей Google One Gemini CLI заменён на Antigravity CLI 18 июня 2026 года»; репозиторий остаётся под Apache-2.0
- Google Developers Blog · Transitioning Gemini CLI to Antigravity CLI — 19 мая 2026 года: Antigravity CLI на Go, закрытый код, делит обвязку с Antigravity 2.0 и поддерживает несколько агентов
- TNW · Cursor raises at a $50B valuation — 18 апреля 2026 года: $2 млрд годовой выручки (по Bloomberg, февраль 2026 года); по более поздним сообщениям с августа 2026 года Cursor — дочерняя компания SpaceX; первичный документ сделки не открыт
- Factory · News: fundraise — 15 сентября 2026 года: $200 млн при оценке $5 млрд под «самоулучшающуюся разработку ПО в корпорациях»; заявление компании
- GitHub (Kyle Daigle) · Welcome home, agents (Agent HQ) — 28 октября 2025 года: агенты Anthropic, OpenAI, Google, Cognition и xAI внутри GitHub Copilot; единый центр управления и контрольная панель предприятия
- GitHub changelog · Agent Plugins 1.0 — 12 августа 2026 года: открытый стандарт плагинов (навыки плюс MCP-серверы в одном пакете), «управляется независимо от любого одного вендора»; партнёры AWS, Anysphere, Microsoft, OpenAI, Vercel, Google
- MarkTechPost · Moonshot AI releases Kimi K2.6 — 20 апреля 2026 года: рой до 300 субагентов, 4 000 координированных шагов, 13-часовой автономный прогон; заявление вендора
- DeepSeek · DeepSeek-V4 release notes — 24 апреля 2026 года: «открытый SOTA в агентном кодинге», окно в миллион токенов по умолчанию, интеграции с Claude Code, OpenClaw и OpenCode; заявление вендора
- Книжный куб · OpenCode: как открытая обвязка стала рынком моделей — 27 июля 2026 года: по словам CEO — около 13 млн активных пользователей в месяц в июне, в 20 раз больше, чем в начале года; сервер с агентным циклом встраивается отдельно от интерфейса; заявления компании
- Menlo Ventures · 2025 Mid-Year LLM Market Update — 31 июля 2025 года: доля корпоративного использования — Anthropic 32 %, OpenAI 25 %, Google 20 %; Claude — 42 % кодогенерации; выборка фонда
Прогнозы и внедрение
- METR · Time Horizon 1.1 — 29 января 2026 года: 228 задач, 31 длиннее восьми часов; 50 %-горизонт Opus 4.5 — 320 минут (от 170 до 729); удвоение 196,5 дня на длинном ряду и 88,6 дня с 2024 года; часть моделей «чувствительна к каркасу»
- Gartner · Over 40% of agentic AI projects will be canceled by end of 2027 — 25 июня 2025 года: прогноз аналитиков — более 40 % проектов агентного AI будут отменены к концу 2027 года; страница закрыта для автоматической загрузки, цитируется по зеркалам
- JetBrains Research · AI coding agent adoption 2026 — Август 2026 года: более 15 000 профессионалов, май–июль; 90 % используют агентов хотя бы еженедельно, 68 % — ежедневно; Claude Code 39 %, GitHub Copilot 21 %, Codex 16 %, Cursor 12 %, OpenCode 7 %, Antigravity 6 %; самооценка
- JetBrains Research · How much code do developers really let agents write? — Август 2026 года: около 47 % кода полностью пишут агенты, 38 % — с помощью AI, 27 % — вручную; больше половины разработчиков пишут руками менее 20 % кода; самооценка
- Google Cloud · Announcing the 2025 DORA report — 23 сентября 2025 года: около 5 000 респондентов; 90 % используют AI, более 80 % считают, что он повысил производительность, 30 % мало или совсем не доверяют коду
- Stack Overflow (Eira May) · Closing the developer-AI trust gap — 18 февраля 2026 года: в 2025 году 84 % используют или планируют, доверяют 29 % — на 11 п.п. меньше, чем годом раньше; опрос 2026 года открыт 23 июня, результаты на дату проверки не опубликованы
- Dwarkesh Podcast · Andrej Karpathy — 17 октября 2025 года: «это десятилетие агентов»; блокеры — непрерывное обучение, мультимодальность, работа с компьютером
- Dario Amodei · The Adolescence of Technology — Январь 2026 года: мощный AI «правдоподобно в течение одного-двух лет»; AI, работающий автономно над многодневными задачами; «AI уже пишет большую часть кода в Anthropic»
Российский контур
- Habr (Сбер) · Анонс ГигаКонф 2026 — 10 сентября 2026 года: закрытый бизнес-день 23 сентября и открытый инженерный день 16 октября 2026 года в офисе Сбера; среди инженерных треков — отдельный трек об обвязке
- ГигаКонф 2026 · программа треков — 18 сентября 2026 года: трек об обвязке: «как сделать ИИ-генерацию предсказуемой и управляемой» — спецификации, контекст, политики, рабочие процессы; названия докладов не опубликованы
- Habr (Сбер, Сергей Тращенков) · Как мы настраивали обвязку (harness) под модель — 25 августа 2026 года: профиль GigaChat для Deep Agents — успех 77,2 → 87,0 % на 391 задаче, токены −50 %; «модели похожи снаружи, но привычки у них разные»; заявление вендора
- ai-forever · harness-bench-fast — 18 сентября 2026 года: открытый бенчмарк обвязок — задачи на файлы, память, поиск и разбор CSV с эталонными ответами без модели-судьи, прогон около 20 минут
- Habr (Захар Копаницкий) · Что такое обвязка агента — 8 сентября 2026 года: «точного короткого русского слова у термина нет, „обвязка“ — ближайший эквивалент»; «смена модели меняет вероятности, обвязка — классы отказов»
- 3DNews · GigaCode Desktop — 15 июля 2026 года: команда ролевых агентов — разработчик, аналитик, тестировщик, менеджер, безопасник — под «AI-Disrupt PDLC»; заявление вендора
- Habr · Yandex SourceCraft CLI — 22 апреля 2026 года: терминальный агент со встроенным OpenCode, навыками и созданием PR; выполняет задачу «автономно в фоновом режиме»
- CNews · Т-Банк открыл клиентам торговлю через AI-агентов — 10 сентября 2026 года: Т-Инвестиции открыли торговлю внешним агентам через MCP — обвязка становится клиентом финансового сервиса
- Habr (Онтико) · Saint HighLoad++ 2026: доклады об AI — 1 июля 2026 года: Сбер — «ИИ не джун, а сеньор с амнезией»; Райффайзен — 25 % бэклога через агентов, 4 % полностью автономно; «Обвязка на стероидах» — $300 → $30 за задачу; уровни L0–L4; доклад автора «State of AI4SDLC»; самоотчёты докладчиков
- OpenAI · DevDay 2026 — 18 сентября 2026 года: конференция 29 сентября в Сан-Франциско, кейноут в трансляции; в срез этой статьи не вошла
Связанные материалы
- AI-разработка как совместно эволюционирующий стек →Шесть слоёв стека, полураспад обвязки и правило «арендовать, адаптировать, владеть», которые эта статья продолжает
- Сквозной игрок без своего железа →Первая версия ответа на парадокс: «на фронтире обвязки сходятся, ниже фронтира обвязка решает»
- Конфигурации агентного стека: полный разбор восьми вариантов →Ось «своя, настраиваемая, управляемая» и двенадцать технических границ
- Когда код пишет агент: что остаётся инженерией →Определение обвязки одной строкой, таблица «временное и устойчивое» и абляционный тест, для которого здесь предложен реестр
- Как оценивать AI-агентов в production →Воспроизводимый эпизод — единица доказательства в реестре обвязки
- Срез по безопасности AI в разработке →Лестница прав и наблюдение, что все исправления инъекций 2026 года прошли по границам
- Loop Engineering: как проектировать циклы, которые сами запускают агентов →Лестница «промпт → контекст → обвязка → цикл» и право проверяющего остановить цикл
- Граница владения стеком →Фреймворк «арендовать, адаптировать, владеть», по которому заполняется колонка режима в реестре