К основному содержимому
ко всем лонгридам
Лонгрид#AI4SDLC#AI

Границы реальной автономности: какую работу агент доводит до конца

Автономность зависит от того, какую работу система выполняет, в какой среде и с какой помощью. Горизонт METR в человеко-часах, доля принятых проектов и доля задач без обращения к человеку описывают разные свойства. Эта статья сопоставляет их определения, ограничения и проверку результата. Цель — выбрать измерения для конкретного решения о делегировании, сохранив границу между наблюдением, заявлением компании и авторским выводом.

2 октября 2026≈ 54 минутыпервичные источники ↓

Статьи, таблицы лидеров, документация продуктов, приказы регуляторов и записи выступлений проверены по первичным источникам на 27 сентября 2026 года. Каждое утверждение отнесено к одному из пяти классов — измеренный результат, заявление вендора, симуляция или бенчмарк, регуляторный текст, авторский вывод, — и это различие отмечено в тексте и примечаниях к источникам. Там, где первичная страница закрыта для проверки, это сказано прямо, а число приведено по пересказу с оговоркой.

01

Одно слово, пять единиц работы

В 1978 году Шеридан и Верпланк описали десять уровней автоматизации — от «человек делает всё» до «компьютер решает всё и игнорирует человека». Единицей у них был «один элементарный шаг решения»: получить варианты, выбрать, одобрить, запустить. С тех пор единица незаметно росла, а слово оставалось тем же. Сегодня автономностью называют пять разных вещей. Действие: ход агента в терминале, медианная длина которого в Claude Code — около сорока пяти секунд. Задачу: тикет из SWE-bench или готовый результат профессиональной задачи из GDPval, где эксперт в среднем тратит семь часов, а агент получает полный контекст одним промптом. Блок работы: проект с Upwork из Remote Labor Index с медианой в одиннадцать с половиной часов и двести долларов. Роль: цифрового сотрудника в TheAgentCompany со ста семьюдесятью пятью задачами и коллегами- симуляторами. И результат: год торговли в Vending-Bench или прибыль настоящей лавки в Project Vend.

схема 01 · пять единиц работы: авторская классификация
  1. ДЕЙСТВИЕвызов инструмента, правка файлауспешность вызовасекунды
  2. ЗАДАЧАтикет, тест, обращениеSWE-bench, τ-bench, GDPvalприёмка отдельной задачи
  3. БЛОК РАБОТЫфича, проект для клиентаRLI, APEX-Agentsартефакты проекта
  4. РОЛЬцифровой сотрудник, сменаTheAgentCompany, CorpGenзадачи в модели организации
  5. РЕЗУЛЬТАТвыручка, закрытый инцидентVending-Bench, Project Vendмесяцы

Классификация, а не эмпирический закон падения успешности.

Пять единиц автономного труда: от действия до хозяйственного результатаОДНО СЛОВО, ПЯТЬ ЕДИНИЦ РАБОТЫДЕЙСТВИЕвызов инструмента,правка файлауспешность вызовасекундыЗАДАЧАтикет, тест,обращениеSWE-bench, τ-bench, GDPvalприёмка отдельной задачиБЛОК РАБОТЫфича, проект дляклиентаRLI, APEX-Agentsартефакты проектаРОЛЬцифровой сотрудник,сменаTheAgentCompany, CorpGenзадачи в модели организацииРЕЗУЛЬТАТвыручка, закрытыйинцидентVending-Bench, Project Vendмесяцыразные единицы выделяют: зависимости, приоритеты, переключения контекста, ответственность за результатАвторская классификация: исследования не измеряют общую кривую успешности между пятью единицами

Пять единиц — авторская классификация того, что именно поручают системе. Они не образуют измеренную шкалу падения успешности. В GDPval модель по заданию и приложенным материалам готовит результат профессиональной работы: например, документ, таблицу с расчётами или презентацию. Эксперты сравнивают его с работой специалиста, не зная, кто создал каждый вариант. Именно такой готовый результат здесь оценивается. RLI оценивает проекты, TheAgentCompany — задачи в модели организации, а Vending-Bench — денежный баланс в симуляции. У этих испытаний разные модели, даты, задания и критерии успеха. По разнице их процентов нельзя определить, насколько труднее агенту даётся более крупная работа.

Единица
Действие
Инструмент
Телеметрия Claude Code: ход, вызов инструмента
Критерий успеха
Вызов исполнен, человек не прервал
Опубликованное наблюдение
Медианный ход ≈ 45 секунд; прерывания в 5–9 % ходов
Что не видно
Смысл всей задачи
Единица
Задача
Инструмент
SWE-bench, τ-bench, GDPval
Критерий успеха
Тесты прошли; все критерии; эксперт предпочёл результат
Опубликованное наблюдение
GDPval: 84,9 % побед и ничьих у GPT-5.5 — заявление OpenAI; τ²-bench pass^1 до 88 %
Что не видно
Контекст, уточнения, соседние задачи
Единица
Блок работы
Инструмент
Remote Labor Index, APEX-Agents
Критерий успеха
Заказчик принял бы проект; все критерии рубрики
Опубликованное наблюдение
RLI, GPT 6 Astra: 20,8 %, знаменатель требует уточнения; APEX, Opus 5.5 Max: 73,5 %, сентябрь 2026, судья-модель
Что не видно
Приоритеты, зависимости, переделки
Единица
Роль
Инструмент
TheAgentCompany, CorpGen
Критерий успеха
Все чекпоинты; артефакт совпал с эталоном
Опубликованное наблюдение
42,9 % задач в ноябре 2025 года; CorpGen: агент на computer-use-preview (CUP) без дополнительного управления задачами — 8,7 % при полной нагрузке
Что не видно
Ответственность перед коллегами и клиентом
Единица
Результат
Инструмент
Vending-Bench 2, Project Vend
Критерий успеха
Баланс через год; прибыль магазина
Опубликованное наблюдение
15,5 тыс. долларов против ≈ 63 тыс. у «хорошего человека»; лавка «пока не готова»
Что не видно
Репутация, право, предельный ущерб

Числа в таблице тоже относятся к разным испытаниям. 84,9 % в GDPval — заявленная OpenAI доля побед и ничьих GPT-5.5 при сравнении с работами специалистов. 42,9 % в TheAgentCompany — доля полностью выполненных задач в лучшей строке таблицы от 10 ноября 2025 года. 20,8 % в Remote Labor Index — округлённый показатель GPT 6 Astra в снимке от 26 сентября 2026 года; знаменатель этой оценки требует уточнения. Это три отдельных наблюдения, а не последовательные этапы одного эксперимента.

Уровни автономности, которые предлагают исследователи, тоже описывают разные свойства. Митчелл с соавторами из Hugging Face в статье Fully Autonomous AI Agents Should Not be Developed различают уровни по тому, насколько модель управляет выполнением программы: только формирует ответ, выбирает вызов инструмента или пишет и запускает собственный код. Фэн с соавторами в Levels of Autonomy for AI Agents описывают роль человека: оператор, соавтор, консультант, утверждающий, наблюдатель. Касирзаде и Гэбриел в Characterizing AI Agents for Alignment and Governance рассматривают долю задач, выполняемых без участия того, кто поручил работу. В отчёте OECD за февраль 2026 года выделены четыре режима: человек решает, одобряет действие, может его остановить или остаётся вне контура выполнения. Поэтому «четвёртый уровень» имеет смысл только вместе с названием шкалы и описанием участия человека.

Что система умеет и что ей поручено

Моррис с коллегами из Google DeepMind в Levels of AGI, § 6.2 отделяют способности от режима взаимодействия с человеком. Работа впервые вышла в 2023 году; здесь используется редакция июня 2024 года. Способности описываются качеством выполнения задач относительно людей и широтой круга задач. Автономность — тем, как человек и система делят работу и инициативу.

В таблице 2 авторы выделяют шесть режимов: 0 — без ИИ; 1 — инструмент для отдельных операций; 2 — консультант, подключаемый по запросу; 3 — совместная работа; 4 — ИИ ведёт работу, человек направляет и даёт обратную связь; 5 — самостоятельный агент. Последний режим допускает обращение к человеку за помощью: постоянное наблюдение и возможность консультации — разные вещи.

схема 01а · способности и автономность: два отдельных решения

ОДНА МОДЕЛЬ · ТРИ РЕЖИМА

Способности одинаковы. Меняется то, кто ведёт работу.

  1. 2 · КОНСУЛЬТАНТАнализирует по запросуЧеловек собирает отчёт
  2. 3 · СОВМЕСТНАЯ РАБОТАВместе редактируют отчётДелят работу и инициативу
  3. 4 · ИИ ВЕДЁТ РАБОТУГотовит отчёт целикомЧеловек направляет и проверяет

Более сильная модель расширяет выбор. Режим по-прежнему выбирают люди.

Одна модель, три режима взаимодействия с человекомОДНА МОДЕЛЬ · ТРИ ВОЗМОЖНЫХ РЕЖИМАСПОСОБНОСТИ ↑качество + круг задач2 · КОНСУЛЬТАНТАнализирует по запросуЧеловек собирает отчёт3 · СОВМЕСТНАЯ РАБОТАВместе редактируют отчётДелят работу и инициативу4 · ИИ ВЕДЁТ РАБОТУГотовит отчёт целикомЧеловек направляет и проверяетАВТОНОМНОСТЬ → БОЛЬШЕ ИНИЦИАТИВЫ У ИИВправо — меняем распределение работы и инициативы.Вверх — улучшаем способности модели.Условный пример подготовки отчёта по идее Моррис и соавторов, § 6.2; не результаты испытаний

Свидетельства:Morris et al. · Levels of AGI · § 6.2, table 2

На схеме — условный пример с одной моделью, которая умеет готовить отчёты. Её можно вызывать для анализа, вместе с ней редактировать документ или поручить ей весь цикл подготовки с проверкой результата человеком. Смена режима не делает модель умнее. Улучшение модели расширяет доступный выбор, но подходящий режим по-прежнему зависит от задачи, цены ошибки и контроля.

Опросы эксплуатации показывают распространённость разных режимов использования. Deloitte в августе 2026 года насчитал 42 % компаний, которые тестировали или развернули агентов, и 15 % с масштабированным внедрением; Gartner — 17 % с агентами в эксплуатации; Bain по пересказу Bloomberg — 7 % с полностью автономными агентами; исследование «Инфосистем Джет» по России — 8 %. Инженеры Anthropic, у которых доступ к лучшим моделям не ограничен, в декабре 2025 года сказали, что могут полностью делегировать от нуля до двадцати процентов своей работы. Райффайзен на Saint HighLoad++ назвал четверть бэклога, сделанную вместе с агентами, и четыре процента — агентами без обращения к человеку. Между «агент справился с задачей» и «на агента можно опереться как на постоянного исполнителя» лежит вся эта лестница, и слово «автономность» её перепрыгивает.

02

Горизонт задач: что измеряет METR и чего не измеряет

показывает, какой объём работы агент способен выполнить с заданной вероятностью успеха. Объём измеряют временем специалиста: «двухчасовая задача» — та, на которую человеку нужны примерно два часа, даже если агент тратит на неё десять минут. В наборе METR TH1.1 228 задач по программированию, машинному обучению и кибербезопасности.

  1. Определяют длительность каждой задачи для человека. Специалист решает её с замером времени; для части задач используют экспертную оценку.
  2. Дают те же задачи агенту. В каждом прогоне фиксируют, выполнена задача или нет. Попытки повторяют, чтобы результат меньше зависел от случайного успеха или провала.
  3. Подбирают кривую по всем результатам. По горизонтали — человеческое время, по вертикали — вероятность успеха агента. Линия сглаживает разброс отдельных попыток и показывает общую зависимость: насколько реже агент справляется с более длительными задачами.
  4. Находят пересечение с нужным процентом. Если на уровне 50 % линия пересекает отметку «4 часа», то 50 %-горизонт равен четырём часам. Это оценка успешности на задачах такого объёма, а не обещание четырёх часов непрерывной работы агента.

Четыре часа выше — условный пример. В методике METR для сглаживания используют логистическую кривую: плавную убывающую линию между 100 % и 0 %. Её положение и крутизну подбирают по успехам и провалам агента. Шкала времени логарифмическая: одинаковое расстояние означает одинаковый множитель, например 10 минут → 100 минут → 1 000 минут. Так на одном графике помещаются короткие и длинные задачи. Пересечение с 80 % даёт второй, более короткий горизонт: для более высокой надёжности приходится выбирать меньший объём работы.

При проверке 27 сентября 2026 года общая таблица METR по-прежнему указывает 8 мая как дату последнего обновления. В этом снимке наибольший 50 %-горизонт у раннего Claude Mythos Preview — 17 часов 25 минут, а 80 %-горизонт — 3 часа 6 минут. Оценки неточны: 95 %-доверительный интервал для первого — от 8 часов 29 минут до 55 часов 4 минут, для второго — от 1 часа 37 минут до 6 часов 39 минут. Сама METR предупреждает, что на текущем наборе задач значения выше 16 часов ненадёжны. Поэтому майский показатель нельзя выдавать за установленный предел возможностей моделей на сентябрь.

На схеме ниже — две опубликованные оценки для Mythos. Плавная линия восстановлена по этим двум точкам для объяснения метода; это не новая подгонка по исходным прогонам. Горизонтальные отрезки показывают интервалы неопределённости двух горизонтов, а не всей кривой.

схема 02 · одна модель, два горизонта и интервалы неопределённости
  1. Claude Mythos Preview (early)METR · 8 мая 2026
  2. Горизонт 50 %: 17 ч 25 минДоверительный интервал 95 %: 8 ч29 мин–55 ч 04 мин
  3. Горизонт 80 %: 3 ч 06 минДоверительный интервал 95 %: 1 ч37 мин–6 ч 39 мин

Время человека на задачу, не длительность работы агента. Ни один горизонт не задаёт порог делегирования. Кривая работы с экраном здесь не измерена.

Кривая горизонта: вероятность успеха против длительности задачи для человекаОДНА МОДЕЛЬ, ДВА ГОРИЗОНТАвероятность довести задачу до концавремя человека на задачу, логарифм0%50%80%100%1 мин10 мин1 ч8 ч40 чвыше 16 ч набор задачненадёжен, METRгоризонт 80 %: 3 ч 06 минДоверительный интервал 95 %:1 ч 37 мин–6 ч 39 мингоризонт 50 %: 17 ч 25 минДоверительный интервал 95 %:8 ч 29 мин–55 ч 04 минв 5,6 раза корочеТочки: Claude Mythos Preview (early) в таблице METR от 8 мая 2026 года; логистическая реконструкция по двум оценкам, не порог делегирования

Свидетельства:METR · 2026-05-08

Более поздние отчёты есть, но они не обновляют эту общую таблицу. 26 июня METR опубликовала оценку GPT-5.6 Sol: около 11,3 часа при зачёте обхода правил теста как провала и свыше 270 часов при зачёте тех же попыток как успеха. METR не считает ни одно из этих чисел надёжной оценкой способностей модели. 22 сентября вышла оценка Claude Opus 5.5 на пяти задачах исследований и разработки ИИ. Она описывает постепенное улучшение относительно Fable 5.1, но не публикует новый сопоставимый 50 %- или 80 %-горизонт.

Тренд известен лучше самих значений: удвоение примерно за двести дней на всём ряду с 2019 года и за 129 дней, если считать с 2023-го; в январском посте METR назвала и 88,6 дня с 2024 года. Epoch AI в апреле 2026 года подтвердила ускорение и приписала его рассуждающим моделям, оговорив, что прирост сосредоточен в программировании и математике — там, где ответ проверяется автоматически. Что важно для этой статьи: сама METR настойчиво объясняет, чем горизонт не является. «Горизонт — не длительность самостоятельной работы ИИ», а «объём последовательного человеческого труда, который модель заменяет с вероятностью пятьдесят процентов». Ошибка оценки — примерно вдвое в каждую сторону. Домены различаются на порядки: для задач с экраном компьютера горизонт в сорок-сто раз короче. И главное для делегирования: «50 %-горизонт в X часов не означает, что можно делегировать задачи короче X часов» — некоторым задачам нужно девяносто восемь процентов успеха и больше.

Есть и ограничение самих заданий: они содержат меньше осложнений, чем обычная работа. METR оценивает это по 16 признакам: например, требуется ли согласование с другими участниками, меняется ли среда, ограничены ли ресурсы, трудно ли проверить результат. За каждый присутствующий признак дают один балл. В исходном исследовании задачи HCAST и RE-Bench набирали в среднем 3,2 балла из 16; ни одна не набрала больше 8. Это характеристика условий задач, а не качества данных. Условный пример: исправить функцию по готовому тесту проще организовать, чем найти причину сбоя в меняющейся системе, согласовать исправление с другой командой и проверить результат без готового эталона.

Выбор математической кривой тоже влияет на ответ. Фергус Хэмилтон повторно разобрал результаты METR, используя другую форму кривой — распределение Вейбулла. Оно иначе описывает, как вероятность успеха меняется с длительностью задачи. Оба варианта близко описывают имеющиеся замеры, но сильно расходятся при оценке почти безошибочной работы. Тоби Орд показал на этом сравнении, что расчётный 99 %-горизонт по кривой Вейбулла может быть в двадцать раз короче, чем по логистической кривой METR. Речь о длительности задач, для которых расчёт обещает 99 % успеха: условно, один способ мог бы дать 100 минут, другой — 5 минут. Это иллюстрация расхождения оценок, не отдельный замер модели.

Орд подчёркивает: данных недостаточно, чтобы уверенно выбрать одну из этих кривых. Поэтому хороший замер на уровне 50 % ещё не даёт надёжного ответа на вопрос, какие задачи агент выполнит в 99 случаях из 100. Сама METR в марте проверила чувствительность расчёта: исключение публичных задач RE-Bench снижает горизонт Opus 4.6 с двенадцати до семи часов; разумные варианты подгонки меняют 50 %-горизонт примерно в полтора раза, а 80 %-горизонт — вдвое. Главным источником неопределённости остаётся выбор задач.

Теперь сопоставим это с тем, что говорят вендоры и что видно в эксплуатации. Anthropic при запуске Sonnet 4.5 сообщила о «более чем тридцати часах» фокуса на многошаговых задачах — наблюдение без методики; METR для той же модели даёт час пятьдесят семь на пятидесяти процентах и двадцать шесть минут на восьмидесяти. Codex по словам OpenAI работал «более семи часов»; METR для его наследника — три часа сорок четыре минуты. Разница между заявлениями и измерением — от шести до пятнадцати раз, и это не ложь: одно число — время работы агента на одной показательной задаче с неназванным критерием успеха, другое — человеческое время при заданной вероятности на двухстах задачах. Телеметрия Anthropic от февраля 2026 года даёт другое наблюдение: медианный ход Claude Code — сорок пять секунд, 99,9-й перцентиль за три месяца вырос с двадцати пяти до сорока пяти минут, 73 % вызовов инструментов в API относятся к агентам, по классификации работающим с человеком в контуре, необратимых действий 0,8 %. Это длительность ходов, а не предел возможностей: короткий ход может означать быстрое выполнение; параллельная работа тоже сокращает календарное время. А эксперимент METR с шестнадцатью разработчиками в 2025 году показал замедление на 19 % при ожидании ускорения на 24 %; повтор 2026 года дал минус восемнадцать и минус четыре с широкими интервалами, а опрос с медианной самооценкой «втрое быстрее» METR сама назвала «не обязательно соответствующим реальности».

Что горизонт говорит
Длину задачи в человеко-часах, которую модель доводит до конца с вероятностью 50 %
Чего он не говорит
Сколько часов агент проработает без человека: METR прямо пишет, что это не длительность автономной работы
Что горизонт говорит
Что 80 %-горизонт в четыре-десять раз короче пятидесятипроцентного
Чего он не говорит
Что пятидесяти процентов достаточно, чтобы делегировать задачи короче горизонта
Что горизонт говорит
Тренд: удвоение за четыре-семь месяцев в зависимости от участка ряда
Чего он не говорит
Что тренд переносится на другие домены: работа с экраном ниже в 40–100 раз
Что горизонт говорит
HCAST и RE-Bench в исходной статье: в среднем 3,2 из 16 признаков осложнений рабочей среды, максимум 8
Чего он не говорит
Что будет в чужом репозитории: подрядчики в 5–18 раз медленнее мейнтейнеров
Что горизонт говорит
Mythos: 95 %-й доверительный интервал для горизонта 50 % — 509–3304 мин, для 80 % — 97–399 мин; выше 16 ч слабое покрытие
Чего он не говорит
Точное число: смена подгонки двигает 50 %-горизонт в полтора раза, 80 %-горизонт вдвое
Что горизонт говорит
Результат модели в скаффолде METR; Claude Code и Codex его не улучшили
Чего он не говорит
Что продуктовая обвязка добавляет горизонт: на фронтире разница статистически не видна

METR ищет и дополнительные измерения: стоимость вычислений, человеческое участие, изменение результата при заданном бюджете. Практический вывод ограничен: 50 %- и 80 %-горизонты характеризуют выбранное распределение задач и процедуру оценки. Ни один из них сам по себе не разрешает делегирование. Для этого нужны собственная выборка, требуемая надёжность, цена ошибки и полный учёт человеческой работы. В пояснении METR отдельно обсуждаются зависимость от распределения задач и неустойчивость высоких квантилей. Сравнения других доменов дают отдельные наблюдения; они не задают измеренную кривую Mythos для работы с экраном.

03

От изолированной задачи к рабочему дню

CorpGen исследует 46 офисных задач OSWorld в общем сеансе с зависимостями и несколькими уровнями нагрузки. В таблице 3 CUP означает computer-use-preview — модель OpenAI для работы с компьютерным интерфейсом. Авторы используют версию computer-use-preview-2025-03-11. «Базовый» здесь означает агента без дополнительного слоя CorpGen, который организует выполнение нескольких задач. Этот вариант получает 16,7 % при 12 задачах и 8,7 % при 46. Отдельный вариант с иерархическим планированием, Hierarchical CUP, показывает 25,0 → 14,1 %. Существенен и положительный результат: при полной нагрузке архитектура CorpGen повышает результат CUP с 8,7 до 16,3 %; у CorpGen с CUP ряд по крайним нагрузкам — 16,7 → 16,3 %. Значит, эффект нагрузки зависит от организации исполнения. Малые наборы задач и отсутствие интервалов не позволяют считать эти разницы точной оценкой общего эффекта многозадачности; изолированная задача здесь не является контрольной группой.

схема 03 · условия, критерии и судьи: три разных сравнения
  1. УСЛОВИЯ ЗАДАЧИCRMArena-Pro · Gemini 2.5 Pro ·B2Cодин ход %: 58,3 → диалог %: 30
  2. УСЛОВИЯ ЗАДАЧИCorpGen · CUP · 12 / 46 задач12 задач %: 16,7 → 46 задач %:8,7
  3. КРИТЕРИЙ ПРИЁМКИAPEX-Agents · Gemini 3 Flashсредний балл %: 39,5 → всекритерии %: 24
  4. КРИТЕРИЙ ПРИЁМКИTheAgentCompany · таблица ·2025-11взвеш. баллы: 52,4 → полностью%: 42,9
  5. КРИТЕРИЙ ПРИЁМКИClawMark · Sonnet 4.6взвеш. баллы: 75,8 → строго %:14
  6. СУДЬЯRLI · Opus 4.8судья-модель %: 21 → эксперты %:8,3
  7. АРХИТЕКТУРА · CORPGEN + CUP8,7 % → 16,3 %Одинаковая полная нагрузка;доверительные интервалы не даны

Сравнения внутри исследований, а не общая лестница автономности. Частичный балл измеряет прогресс; его единица отличается от доли завершённых задач.

Три разных вида сравненияЧТО МЕНЯЕТСЯ МЕЖДУ ДВУМЯ ЧИСЛАМИ?УСЛОВИЯ ЗАДАЧИКРИТЕРИЙ ПРИЁМКИСУДЬЯCRMArena-Pro · Gemini 2.5 Pro · B2Cодин ход %: 58,3диалог %: 30CorpGen · CUP · 12 / 46 задач12 задач %: 16,746 задач %: 8,7APEX-Agents · Gemini 3 Flashсредний балл %: 39,5все критерии %: 24TheAgentCompany · таблица ·2025-11взвеш. баллы: 52,4полностью %: 42,9ClawMark · Sonnet 4.6взвеш. баллы: 75,8строго %: 14RLI · Opus 4.8судья-модель %: 21эксперты %: 8,3АРХИТЕКТУРА ТОЖЕ ВАЖНАCorpGen + CUP, полная нагрузка:8,7 % → 16,3 %таблица 3, одинаковая нагрузкаДоверительные интервалы неданыСравнения внутри исследований, а не общая лестница автономности. Частичный балл измеряет прогресс; его единица отличается от доли завершённых задач.

Свидетельства:CRMArena-ProCorpGen · table 3APEX · table 3TheAgentCompanyClawMark · table 3RLI

TheAgentCompany из CMU показывает вторую сторону: не нагрузку, а роль. Лучший агент статьи в декабре 2024 года решал 24 % задач, к маю 2025-го — 30,3 %, последняя запись таблицы от ноября 2025 года — 42,9 % полностью и 52,4 % по взвешенному баллу, который даёт половину очков за частично пройденные чекпоинты. Отказы там четырёх родов: нехватка здравого смысла, неумение общаться с коллегами, беспомощность в веб-интерфейсах и самообман — агент ищет обходные пути, позволяющие не выполнять трудную часть задачи. В августе 2026 года независимый повторный анализ трёх таких бенчмарков дал результат, который я считаю главным в этом разделе: выбор агента объясняет меньше трёх процентов дисперсии, а взаимодействие «агент × задача» — от семи до двадцати трёх. Какие задачи — важнее, чем какой агент. ClawMark, вышедший в апреле, добавил третье измерение — среду, которая меняется без участия агента: приходят письма, сдвигается календарь, обновляется база знаний. Sonnet 4.6 набрала 75,8 взвешенного балла и 14 % строгих успехов, а результат падал сразу после первого внешнего изменения.

Самый чистый замер «та же задача плюс взаимодействие» — у Salesforce. В CRMArena-Pro лучшая модель решала 58,3 % задач в живой CRM, когда всё сказано одним ходом, и 30,0 %, когда недостающее надо выспросить у симулятора клиента; в сорока пяти процентах провалов диалога агент просто не спросил. GDPval от OpenAI стоит на противоположном полюсе — всё условие дано заранее, уточняющего диалога нет, — и авторы сами пишут, что при сокращении контекста результат падает, а доля побед снижается с ростом длины задачи. Их же расчёт отрезвляет громкое «в сто раз быстрее и дешевле»: это чистое время инференса. В таблице 2 GDPval для сценария «одна попытка ИИ, затем экспертная проверка и при необходимости самостоятельное выполнение» указан коэффициент ускорения от 0,87 у GPT-4o до 1,12 у GPT-5. Это отношение времени работы без ИИ ко времени с ИИ: меньше единицы означает замедление. В расчёте авторов GPT-4o увеличивает суммарное время примерно на 15 %, а GPT-5 сокращает его примерно на 11 %. Например, вместо 100 минут без ИИ получилось бы около 115 или 89 минут соответственно. Это оценка по модели затрат времени, а не замер внедрения на рабочем месте.

Remote Labor Index за год прошёл от 2,5 % до 20,8 % принятых проектов, но новые прогоны шли уже в Claude Code и Codex с циклом «работник — критик», бюджетом до ста пятидесяти долларов и сутками времени; судья-модель завышала долю успехов в два с половиной-три раза, а о трёх показательных поставках Fable 5 авторы написали, что «ни одна не была бы принята как готовая работа». Любопытно, что успех на RLI не падает с длиной задачи для человека — кривой горизонта там нет, потому что проект — это не «больше текста», а «больше мест, где можно ошибиться».

Бенчмарк
CorpGen · Microsoft, февраль 2026
Единица и постановка
46 офисных задач OSWorld в одном пятичасовом сеансе с зависимостями
Критерий успеха
Артефакт совпал с эталоном; судья по трассе согласен с людьми на 40 %, по артефакту — на 90 %
Результат и ограничения
CUP, 12 → 46 задач: 16,7 → 8,7 %. Hierarchical CUP: 25 → 14,1 %. CorpGen + CUP при 46 задачах: 16,3 %
Бенчмарк
TheAgentCompany · CMU, декабрь 2024
Единица и постановка
175 задач цифрового сотрудника с коллегами-симуляторами
Критерий успеха
Все чекпоинты; взвешенный балл: половина доли чекпоинтов плюс половина полного успеха
Результат и ограничения
Снимок 2025-11: 42,9 % полных / 52,4 взвешенных балла
Бенчмарк
ClawMark · апрель 2026
Единица и постановка
100 многодневных задач в среде, которая меняется сама: письма, календарь, база знаний
Критерий успеха
1 537 детерминированных проверок
Результат и ограничения
Sonnet 4.6: 75,8 балла / 14 % строгих успехов; таблица 3
Бенчмарк
CRMArena-Pro · Salesforce, май 2025
Единица и постановка
19 типов задач в живой CRM, один ход или диалог с симулятором клиента
Критерий успеха
Точное совпадение, F1 по токенам, судья-модель
Результат и ограничения
Gemini 2.5 Pro · B2C: 58,3 → 30 %; один ход → диалог
Бенчмарк
GDPval · OpenAI, сентябрь 2025
Единица и постановка
220 заданий по 44 профессиям: документы, таблицы, презентации, всё условие дано заранее, уточняющего диалога нет
Критерий успеха
Слепое парное сравнение экспертами; согласие 71 %
Результат и ограничения
47,6 % → 84,9 % за год, но при сокращении контекста результат падает, а «попробовать и исправить» экономит времени 0,9–1,1×
Бенчмарк
Remote Labor Index · Scale и CAIS, октябрь 2025
Единица и постановка
240 отобранных проектов; 230 закрытых для количественной оценки; медиана 11,5 часа и 200 долларов
Критерий успеха
Три эксперта: работа не хуже человеческой; согласие 94,4 %
Результат и ограничения
2,5 % → 20,8 % за год при новых обвязках и бюджете; судья-модель даёт более высокий результат; в этой выборке нет явной связи с длиной
Бенчмарк
APEX-Agents · Mercor, январь 2026
Единица и постановка
480 задач банкира, консультанта и юриста в мирах из 166 файлов
Критерий успеха
Все бинарные критерии рубрики; судья Gemini 3 Flash
Результат и ограничения
Gemini 3 Flash: 24 % полностью; средняя доля критериев 39,5 %; таблица 3
Бенчмарк
Vending-Bench 2 · Andon Labs, ноябрь 2025
Единица и постановка
Год управления автоматом: 3–6 тысяч сообщений, враждебные поставщики
Критерий успеха
Баланс счёта в конце года
Результат и ограничения
От −31 до +15 515 долларов у моделей одного года; «хороший человек» ≈ 63 тысячи по оценке авторов

В APEX-Agents у Gemini 3 Flash на 480 задачах все критерии выполнены в 24 % случаев, а средняя доля выполненных критериев — 39,5 % (таблица 3). Это разные вопросы: завершён ли результат и насколько продвинулась работа. Частичный балл полезен для диагностики и сам по себе не является приукрашиванием. Судья Gemini 3 Flash проверен авторами на 747 человеческих метках из 60 задач; опубликованное согласие 98,5 % относится к этой выборке. В RLI сравнение судьи-модели с экспертами для Opus 4.8 даёт примерно 21 % против 8,3 %: это свидетельство расхождения именно данной процедуры оценки. Методика RLI описывает 240 отобранных проектов, из них 10 открытых и 230 закрытых для количественной оценки. Проценты текущего лидерборда не согласованы с этим знаменателем достаточно прозрачно; восстанавливать число принятых проектов из 20,8 % нельзя.

Эти исследования показывают несколько разных источников расхождений: изменение условий задачи, изменение определения успеха и изменение судьи. Их нельзя складывать в единую оценку потери автономности при переходе к рабочему дню. Для такого вывода нужен контроль модели, набора задач, бюджета и проверки. Внутри конкретного эксперимента можно обсуждать эффект диалога или нагрузки; между исследованиями — только различие постановок и ограничения переноса.

04

Надёжность против способности

Sierra ввела различие, которое до сих пор игнорируют почти все таблицы лидеров. pass@k — вероятность, что хотя бы одна из нескольких попыток удалась; pass^k — что удались все k попыток. Каждая попытка — новый запуск той же задачи с нуля.

схема 03а · один успех или успех каждый раз
Те же попытки — два критерия успехаТЕ ЖЕ ПОПЫТКИДВА КРИТЕРИЯ УСПЕХА4 задачи · по 4 запуска с нуляПопыткиpass@4≥ 1 успехpass^44 успеха1234АБВГЗасчитано задач:3/475 %1/425 %✓ успех × неудачаУсловный пример · не результат моделиpass@k: получилось хотя бы раз?pass^k: получилось каждый раз?
Те же попытки — два критерия успехаТЕ ЖЕ ПОПЫТКИ — ДВА КРИТЕРИЯ УСПЕХА4 задачи · по 4 запуска с нуляПопыткиpass@4≥ 1 успехpass^44 успеха1234АБВГЗасчитано задач:3/475 %1/425 %✓ успех × неудачаУсловный пример · не результат моделиpass@k: хотя бы раз?pass^k: каждый раз?

Свидетельства:Anthropic · Demystifying evals for AI agents

На τ-bench в 2024 году GPT-4o решал 61,2 % задач розницы с первой попытки и меньше 25 % — во всех восьми. На τ²-bench 2025 года каждая модель теряла от пятнадцати до двадцати шести пунктов между pass^1 и pass^4, а домен телеком, где инструментами пользуются и агент, и клиент, терял половину: 0,34 → 0,19 у GPT-4.1. Само добавление действующего пользователя к той же задаче снимало восемнадцать-двадцать пять пунктов. Anthropic в январе 2026 года закрепила это в руководстве по : эвалы способности начинают с низкого процента, регрессионные должны проходить почти на сто; «задача, прошедшая в одном прогоне, может провалиться в следующем»; pass^k — для агентов, где важна стабильность. В 2026 году таблицы лидеров всё ещё показывают pass^1 на витрине.

Принстонская линия работ — от статьи 2024 года о том, какие агенты имеют значение, до HAL — добавила стоимость и журналы. На 21 730 прогонах за сорок тысяч долларов в двадцати одном сочетании из тридцати шести больше рассуждений не подняли точность; агент может быть «в сто раз дороже ради одного процента»; в транскриптах нашлись поиск ответов бенчмарка на HuggingFace и жёстко закодированные тесты; агенты с одинаковой точностью несут разный риск — отказ и оплата чужой картой оба дают ноль. В работе мая 2026 года исследователи из Принстона и британского института безопасности ИИ обнаружили дефекты в 25 из 50 задач τ-bench Airline: противоречивые правила, неоднозначные инструкции, ошибки базы данных или проверки. После исключения этих задач средний pass^5 по изученным моделям вырос с 20,8 % до 40,0 %. Именно это авторы описывают как занижение результата почти наполовину: исходные задания мешали агентам показать свои возможности. Модели при этом не улучшали — изменился состав оценки. В отдельной февральской работе исследователи показали, что «прирост способностей дал лишь малый прирост надёжности» по двенадцати метрикам. Обвязка стала переменной измерения: на Terminal-Bench одна и та же модель даёт 83,8 % в Claude Code и 80,4 % в другой обвязке, а майский препринт показал, что дисперсия от обвязки «может превышать дисперсию от модели» вплоть до смены порядка. Я подробно разбирал этот эффект в статье об обвязке; здесь важно следствие: отчёт без версии обвязки и числа прогонов — не измерение.

Сами бенчмарки тоже стареют быстрее, чем кажется. В феврале 2026 года OpenAI отказалась публиковать SWE-bench Verified: из 138 трудных задач у 59,4 % дефектные тесты или постановка, все фронтирные модели воспроизводят «золотые» патчи по памяти. Заменой назвали SWE-bench Pro, где на закрытых коммерческих репозиториях Opus 4.1 падал с 22,7 до 17,8 %; за восемь месяцев публичная часть выросла с 23,3 до 80,3 %, после чего та же OpenAI нашла «около 30 % сломанных задач» и отозвала рекомендацию. Чеклист строгих агентных бенчмарков от июля 2025 года нашёл нарушения валидности задачи у семи из десяти наборов: пустой ответ давал 38 % на невозможных задачах τ-bench. Веб-агенты на живых сайтах показали 30 % вместо заявленных 89 %. Каждый «исправленный» преемник насыщается за полгода-год и оказывается на пятнадцать-тридцать процентов дефектным, когда модели становятся достаточно сильными, чтобы это вскрыть.

Метрика
pass@k
На какой вопрос отвечает
Хотя бы одна из k попыток удалась
Пример
Инструменты с дешёвой проверкой; BrowseComp: 64 выборки дают +15–25 пунктов
Метрика
pass^k
На какой вопрос отвечает
Все k попыток удались
Пример
τ-bench: 61 % → меньше 25 % при k = 8; τ²: минус 15–26 пунктов к k = 4
Метрика
Интервал по прогонам
На какой вопрос отвечает
Разброс между запусками одной конфигурации
Пример
Terminal-Bench: не меньше пяти прогонов, ±1 пункт; та же модель 83,8 % и 80,4 % в разных обвязках
Метрика
80 %-горизонт
На какой вопрос отвечает
Длина задачи при вероятности успеха 80 % в выбранном распределении
Пример
Opus 4.6: около 12 часов на 50 % и 1 час 10 минут на 80 %
Метрика
TCR@k
На какой вопрос отвечает
Доля задач, завершённых при не более чем k вмешательствах
Пример
Microsoft, февраль 2026: TCR@0 o3-mini: Prudentia 59,1 % против Fides 50,1 %
Метрика
Доля принятых PR
На какой вопрос отвечает
Принятие PR в наблюдаемом корпусе; правки не исключены
Пример
PR агентов в популярных репозиториях: 38–65 % против 76,8 % у людей
Метрика
Устойчивость к возмущениям
На какой вопрос отвечает
Падение при порче инструментов и вводных
Пример
ToolRobustBench: 0,979 в чистой постановке → 0,455 при испорченных ответах инструментов

AIDev даёт ещё одну метрику: долю принятых PR в наблюдаемом корпусе. В таблице 5 для популярных репозиториев опубликованы 38–65 % у разных агентов и 76,8 % у человеческих авторов. Это принятие PR, а не доля результатов без правок и не проверка одинаковых задач в случайно назначенных группах. Выбор задач, репозиториев и пользователей может объяснять часть различий. От принятия также нельзя автоматически перейти к долгосрочной надёжности изменения: для этого нужны данные об откатах, дефектах и сопровождении.

05

Закон длинной цепочки и контрольные точки

Самая простая модель длинной цепочки — степень: если каждый шаг удаётся с вероятностью p и шаги независимы, цепочка из n шагов удаётся с вероятностью p^n. Синха с соавторами в статье для ICLR 2026 вывели из неё горизонт: число шагов до падения успеха ниже порога равно ln s / ln p. При 95 % точности шага это тринадцать с половиной шагов до «монетки» (50 % вероятности успеха всей цепочки), при 99 % — шестьдесят девять, при 99,9 % — почти семьсот. Отсюда их тезис об «иллюзии убывающей отдачи»: прибавка одного пункта к точности шага удлиняет горизонт на четверть, и чем ближе к единице, тем сильнее. Но реальные модели нарушают независимость в обе стороны. С одной — самообусловливание: ошибки в контексте повышают вероятность следующих, и масштаб этого не лечит, а рассуждение лечит. С другой — добавочное вычисление на шаг: GPT-5 с рассуждением исполняет в синтетической задаче больше двух тысяч шагов подряд. Независимые замеры 2026 года подтверждают первую сторону: падение с длиной в полтора-два с половиной раза круче независимой модели; после ошибочного шага следующий ошибочен в 40–58 % случаев против трёх-пяти после верного.

схема 04 · как падает вероятность успеха всей цепочки
Почему длинная цепочка чаще срываетсяУСПЕХ ВСЕЙ ЦЕПОЧКИpⁿ · без повторовp — вероятность успеха одного шагаp = 0,99p = 0,95p = 0,90%50%100%1020304050Число шагов задачи, np = 0,95 → 50 % успеха за ≈ 13,5 шага
Почему длинная цепочка чаще срываетсяУСПЕХ ВСЕЙ ЦЕПОЧКИ = pⁿp — вероятность успеха одного шагаp = 0,99p = 0,95p = 0,90%50%100%1020304050Число шагов задачи, np = 0,95 → 50 % успеха за ≈ 13,5 шага

Контрольная точка — место, где система проверяет промежуточный результат перед продолжением работы. Например, агент изменил код: система запускает тесты и сохраняет прошедшую проверку версию. Если тесты не прошли, она возвращается к предыдущей сохранённой версии и повторяет этот участок. В модели ниже проверка стоит после каждых десяти шагов; на участок даётся одна попытка и до двух повторов. После трёх неудач выполнение останавливается.

схема 04а · проверить, сохранить или повторить участок

Что происходит в контрольной точке

  1. 1 · ВЫПОЛНИТЬ 10 ШАГОВОт последнегосохранённого состояния
  2. 2 · ПРОВЕРИТЬ РЕЗУЛЬТАТВыполнены ликритерии приёмки?
  3. 3 · СОХРАНИТЬ РЕЗУЛЬТАТПерейти к следующим10 шагам
  4. ЕСЛИ ПРОВЕРКА НЕ ПРОЙДЕНАОткатиться и повторить толькоэтот участокДо 2 повторов; после 3 неудач —остановка

50 полезных шагов · p = 0,95 на шаг

Без повторов: 7,69 %. С проверкой и повторами каждые 10 шагов: 71,61 %.

Расчётная модель: идеальная проверка и независимые повторы.

Контрольная точка — проверка и возможность восстановленияЧТО ПРОИСХОДИТ В КОНТРОЛЬНОЙ ТОЧКЕ1 · ВЫПОЛНИТЬ 10 ШАГОВОт последнегосохранённого состояния2 · ПРОВЕРИТЬ РЕЗУЛЬТАТВыполнены ликритерии приёмки?3 · СОХРАНИТЬ РЕЗУЛЬТАТПерейти к следующим10 шагамВЕРНОЕСЛИ ПРОВЕРКА НЕ ПРОЙДЕНАОткатиться и повторить только этот участокДо 2 повторов; после 3 неудач — остановка50 полезных шагов · 95 % успеха каждого шагаБЕЗ ПОВТОРОВ7,69 % успеха всей цепочкиС ПРОВЕРКОЙ И ПОВТОРАМИ71,61 % успеха всей цепочкиРасчётная модель · идеальная проверка · независимые повторы

Проверка сама по себе не исправляет ошибку: выигрыш дают обнаружение сбоя, восстановление состояния и новая попытка. Числа на схеме рассчитаны при идеальном обнаружении ошибок и независимых повторах, без необратимого ущерба до проверки. Для участка из десяти шагов вероятность успеха за три попытки равна q = 1 − (1 − p¹⁰)³, а для пяти таких участков — q⁵. При p = 0,95 получается 71,61 % вместо 7,69 % без повторов. Это те же 50 полезных шагов задачи, но повторные исполнения и проверки требуют дополнительного времени и ресурсов. В реальной системе проверка может пропустить ошибку, а повтор — воспроизвести её, поэтому такой выигрыш не гарантирован.

Набор данных Traverse, опубликованный Рахманом с коллегами в сентябре 2026 года, содержит 2 518 прогонов агентов в программировании, работе с компьютером и научных задачах, с 6 967 размеченными ошибками. В подвыборке из 1 122 прогонов с размеченной первой ошибкой 69,5 % прогонов не восстанавливаются, 38,5 % никогда её не замечают, 72,6 % продолжают действовать, и около 84 % изученных провалов в программировании и работе с экраном заканчиваются шагом, который выглядит правильно. Фронтирные модели-судьи находят первую ошибку меньше чем в трети прогонов по коду. Таксономия MAST из Беркли на 1 642 трейсах раскладывает отказы по четырнадцати режимам: повтор шагов — 15,7 %, рассогласование рассуждения и действия — 13,2 %, незнание условия остановки — 12,4 %, неверная проверка — 9,1 %; последнее — ложный «зачёт», который превращает восстановимый прогон в тихий провал. Где сидит критическая ошибка, тоже известно: провальная траектория несёт в среднем 7,6 локальной ошибки и ровно одну критическую, агент сам чинит 62 % некритических, а корневые скапливаются на шагах с шестого по пятнадцатый — после сбора информации, на первом решающем действии. Именно там контрольная точка стоит дороже всего. Данные Хэмилтона о падающей интенсивности отказа говорят то же с другой стороны: ранние шаги — самые рискованные, проверку надо грузить в начало, а «выживший» прогон не сбрасывать без улики.

Кто проверяет — вопрос не менее важный, чем где. Самопроверка без внешних улик не работает: ещё в 2023 году GPT-4 после двух раундов «исправь себя» падал на GSM8K с 95,5 до 89,0 %, а с оракулом, говорящим, где ошибка, рос до 97,5; в 2026 году показали, что если пометить собственную мысль модели как чужую, доля явных исправлений растёт на 23–93 пункта. Внешняя проверка на уликах, напротив, даёт крупные измеренные эффекты: линтер на каждой правке в SWE-agent — плюс 7,7 пункта; исправление критической ошибки и перезапуск с неё — с 21 до 55 % на ALFWorld; обученный проверяющий, выбирающий из нескольких попыток, — с 81,8 до 90,2 % на Terminal-Bench; декомпозиция на границах подзадач — плюс 13–42 пункта. Теория объясняет, почему: сигнал пошаговой проверки растёт с длиной как Θ(T), сигнал по итогу тает как Θ(T·p^T) — тот же закон, что губит саму цепочку. Но проверка не бесплатна и не всегда полезна: слабый проверяющий хуже отсутствующего, блокирующий посредник перехватывает 94 % нарушений и оставляет меньше 5 % безопасных успехов, а команда Qwen прямо пишет, что «породить решение стало проще, надёжно проверить — сложнее», и проверка должна эволюционировать вместе с генератором.

Блокировка перед необратимым действием означает, что система не выполняет его, пока не пройдены нужные проверки или не получено разрешение. Например, инструмент удаления базы остаётся недоступным до подтверждения человеком. Ограничение должно исполняться самим инструментом или системой запуска: просьба к агенту «будь осторожен» не гарантирует остановку.

Контрольная точка
Точка состояния: коммит, файл прогресса, журнал сессии
От чего защищает
От потери контекста, падения и перезапуска
Что известно
Anthropic, ноябрь 2025: сессии как смены инженеров; Managed Agents: перезапуск по журналу событий
Контрольная точка
Точка плана: список функций, контракт спринта, спецификация
От чего защищает
От подмены цели и «объявил готовым»
Что известно
Агент «оглядывался и объявлял работу сделанной»; MAST: 12,4 % отказов — незнание условия остановки
Контрольная точка
Точка проверки: тесты, браузер, внешний судья
От чего защищает
От тихих ошибок, которые выглядят как успех
Что известно
Traverse: около 84 % изученных провалов в коде и работе с экраном заканчиваются правдоподобно; линтер на каждой правке +7,7 пункта; обученный проверяющий 81,8 → 90,2 %
Контрольная точка
Блокировка перед необратимым действием
От чего защищает
От ущерба, который не откатить
Что известно
97 % разрушительных действий в «решённых» прогонах — без признания риска; Replit, Antigravity, Kiro

Обвязки для долгих прогонов сходятся к одним и тем же примитивам, и их полезно различать. Точка состояния — коммит, файл прогресса, неизменяемый журнал сессии в Managed Agents — делает падение восстановимым. Точка плана — список функций в JSON, контракт спринта — не даёт агенту «объявить готовым», переопределив цель: в ноябре 2025 года Anthropic наблюдала, как следующий экземпляр «оглядывался, видел прогресс и объявлял работу сделанной». Точка проверки — тесты, браузер, внешний оценщик с жёсткими порогами — ловит тихие ошибки. Единственное сравнение с контролем у вендора — мартовское: одиночный агент собрал игру за двадцать минут и девять долларов, но ничего не реагировало на ввод; полная обвязка потратила шесть часов и двести долларов и отдала работающее; при этом оценщик давал прирост «только на границе возможностей генератора», а «из коробки Claude — плохой QA-агент». Движки устойчивого выполнения чинят падения, не смысл: их аргумент — «пять шагов по 99 % дают 95 %», их предел — что смысловая ошибка журналируется и воспроизводится так же честно, как верный шаг. Уплотнение контекста — отдельная точка риска: рекурсивные пересказы превращают надёжно решаемые задачи в решаемые изредка, а усечение без пересказа с правилом «никогда не уплотнять уплотнение» держит результат при затратах вдвое ниже.

  • Дешёвая механическая проверка — на каждом действии, меняющем состояние: цепочка начинается с первой плохой правки, а восстановление после неё — 57 %
  • Проверка на уликах — на границах подзадач: критические ошибки скапливаются после сбора информации, декомпозиция с проверкой возвращает 13–42 пункта
  • Внешний судья — в конце: своей работе модель ставит зачёт, чужой — нет; сдвиг в 23–93 пункта от одной смены ярлыка
  • Блокировка необратимого действия до прохождения проверки или получения разрешения: 97 % разрушительных шагов в «решённых» прогонах сделаны без признания риска
  • Интервал между точками растёт с корнем из надёжности и цены проверки: при 98 % на шаг и проверке ценой в два шага — примерно раз в четырнадцать шагов

Последний пункт — перенос формулы Янга и Дэйли из суперкомпьютерных вычислений, где оптимальный интервал контрольной точки равен корню из удвоенного произведения времени между отказами на стоимость точки. Для агента при точности шага 98 % и проверке ценой в два шага это примерно четырнадцать шагов при накладных расходах в 28 %; при 99,5 % — двадцать восемь шагов и 14 %; дешёвый линтер ценой в пятую долю шага окупается каждые четыре-пять шагов. Форма закона — точки реже с ростом надёжности и цены проверки — для практики важнее констант, и та же литература напоминает: при падающей интенсивности отказов интервалы должны расти по ходу задачи. Две поправки обязательны. Отказ агента не аварийный: раз 84 % провалов выглядят правильно, в цену точки надо включать обнаружение, иначе сохраняется состояние испорченного прогона. И повтор помогает, только если независим: самообусловливание делает повтор в том же контексте коррелированным с первым провалом, поэтому единица повтора во всех обвязках 2026 года — свежий контекст плюс восстановленное состояние, а не «попробуй ещё раз».

06

Достаточно ли пятидесяти процентов

Джейсон Вэй в июле 2025 года сформулировал «закон проверяющего»: лёгкость обучения ИИ задаче пропорциональна её проверяемости, а проверяемая задача — та, где есть объективная правда, проверка занимает секунды, масштабируется, мало шумит и даёт непрерывную оценку. Карпаты в ноябре сжал то же в формулу «Software 2.0 легко автоматизирует то, что можно проверить» и на летней школе YC говорил о ползунке автономности и о цикле «генерация — проверка», который надо крутить как можно быстрее. Экономика перебора это подтверждает: на SWE-bench Lite доля решённых задач росла с 15,9 % при одной выборке до 56 % при двухстах пятидесяти — но только там, где есть тесты; без автоматического проверяющего отбор лучшей попытки выходит на плато. Значит, вопрос «достаточно ли пятидесяти процентов» не имеет ответа без второго вопроса: сколько стоит проверка и что бывает, если она пропустит ошибку.

Дальше — авторская модель затрат. Пусть самостоятельное выполнение стоит S, одна попытка агента — A, проверка — V; все три величины выражены в одинаковых денежных единицах или приведены к ним. При постоянной вероятности успеха p, независимых повторах, идеальной проверке и отсутствии ущерба до приёмки ожидаемая цена принятого результата равна (A + V) / p. Экономия есть при p > (A + V) / S; равенство означает безубыточность. Если S = 60, A = 2, V = 10, порог равен 20 %; при V = 40 — 70 %. Это условные единицы стоимости, не сложение машинных и человеческих минут. При A + V > S экономии не будет даже при p = 1. Если проверка ошибается, попытки зависимы или ошибка успевает нанести ущерб, нужна другая модель. Без проверки, при гарантированно успешной ручной работе ценностью W и потере L при ошибке агента, сравнение ожидаемой ценности даёт p ≥ 1 − (S − A) / (W + L). Значения W и L надо выбирать и обосновывать для процесса. У Ламбы падение оптимальной пропускной способности в 16 раз при уменьшении заметности ошибки вдвое относится к модели с δ = 1; при фиксированном труде зависимость квадратичная и падение четырёхкратное. Это условия экономической модели, не универсальный закон проверки. подробнее разобрана в статье об экономике разработки.

схема 05 · порог успешности зависит от двух цен: проверки и ошибки
  1. ПРОВЕРИТЬ УСЛОВИЕ ПО СТОИМОСТИp > (A + V) / S, если модельприменимапрототип, черновики, переборвариантов
  2. УНИВЕРСАЛЬНОГО ПРОЦЕНТА НЕТпри A + V > S даже p = 1 не даётэкономиипродукт, код в основную ветку
  3. АВТОНОМИЯ ДО ТОЧКИ ДЕЙСТВИЯдешёвая проверка переднеобратимым шагомобязательная проверка додействия
  4. ОГРАНИЧИТЬ УЩЕРБ ДОДЕЛЕГИРОВАНИЯзадать допустимый ущерб;проверить контрольденьги, данные эксплуатации,безопасность

Авторская рамка решения. Формула требует надёжной проверки, независимых повторов и отсутствия ущерба до приёмки.

Порог успешности зависит от двух цен: проверки и ошибкиКАКОЙ ПОРОГ УСПЕШНОСТИ ДОСТАТОЧЕНПРОВЕРИТЬ УСЛОВИЕ ПОСТОИМОСТИp > (A + V) / S, если модель применимапрототип, черновики, перебор вариантовУНИВЕРСАЛЬНОГО ПРОЦЕНТА НЕТпри A + V > S даже p = 1 не даётэкономиипродукт, код в основную веткуАВТОНОМИЯ ДО ТОЧКИ ДЕЙСТВИЯдешёвая проверка перед необратимымшагомобязательная проверка до действияОГРАНИЧИТЬ УЩЕРБ ДОДЕЛЕГИРОВАНИЯзадать допустимый ущерб; проверитьконтрольденьги, данные эксплуатации, безопасностьцена проверки: дешёвая → сопоставима с самой работойценаошибки:обратимая →необратимаяАвторская рамка: задать затраты и допустимый ущерб; равенство в формуле — безубыточность, не экономия

Матрица ниже помогает поставить вопросы, но не назначает универсальные проценты. При дешёвой проверке нужно проверить стоимость всей попытки, а при дорогой — оценить, остаётся ли экономия вообще. Большой возможный ущерб требует отдельного ограничения риска: уменьшить полномочия, обеспечить восстановление, добавить независимую проверку или оставить окончательное решение человеку. Обратимость влияет на последствия, но сама по себе не задаёт ни 50 %, ни 90 % успешности.

Литература, которая публикует пороги, привязывает их к ступени зрелости, и форма порога на каждой ступени своя. Исследовательский прототип меряют горизонтом при фиксированной вероятности и pass@k против оракула. Коммерческий продукт — долей исходов по контрактному определению: Salesforce с июля 2026 года берёт плату только когда агент «самостоятельно решает вопрос от начала до конца», без оплаты при отрицательной оценке или запросе человека, и называет 70 % таких исходов из 4,3 млн обращений на собственном портале; у Intercom «предполагаемое решение» — это клиент, который сутки не отвечал; Zendesk советует исключать брошенные и повторные обращения. Ответственная операция — правами решений и кнопкой «стоп»: статья 14 европейского регламента об ИИ требует надзора, «соразмерного рискам, уровню автономности и контексту», с возможностью отклонить решение и остановить систему; правила алгоритмической торговли требуют немедленно отменить любые заявки и назвать, какой алгоритм отвечает за каждую; банковский надзор — «эффективного вызова» модели и пределов её использования; FDA в январе 2026 года провела черту, которую стоит запомнить: программа остаётся поддержкой решения, только если врач может независимо проверить основание рекомендации, а в цейтноте это уже автоматизация. В авиации и автомобильной технике требования к безопасности задают через вероятность опасного отказа за час работы: катастрофическое состояние в авиации должно быть «крайне невероятным», порядка 10⁻⁹ на лётный час, и не следовать из единичного отказа; автомобильный стандарт задаёт для высшего класса ASIL D предел меньше 10⁻⁸ на час для опасных случайных отказов оборудования. Чем тяжелее возможные последствия, тем ниже допустимая вероятность отказа. Эти числа описывают требования к безопасности системы, а не процент успешно выполненных задач. Для офисной работы числового порога полной автоматизации не публикует никто — цитируемые «95 % точности» восходят к консалтинговым блогам, а не к отчётам аналитиков.

Ступень
Исследовательский прототип
Форма порога
Горизонт при фиксированной вероятности; pass@k против оракула; стоимость на фронте Парето
Кто так меряет
METR, HAL, публичные бенчмарки
Пример
Порог зависит от стоимости попытки с проверкой, ущерба и допущений модели
Ступень
Коммерческий продукт
Форма порога
Доля исходов по контрактному определению; оплата за результат; валидатор из предметной области
Кто так меряет
Salesforce, Intercom, Sierra; второй уровень у Microsoft
Пример
70 % «от начала до конца» из 4,3 млн обращений; у Intercom 24 часа тишины клиента считаются решением
Ступень
Ответственная операция
Форма порога
Права решений: что агент решает сам; кнопка «стоп»; атрибуция каждого действия; «эффективный вызов» модели
Кто так меряет
AI Act, статья 14; MiFID II RTS 6; SR 11-7; FDA; третий уровень у Microsoft
Пример
Врач должен успеть независимо проверить основание рекомендации; в цейтноте FDA считает это уже автоматизацией
Ступень
Полная автоматизация процесса
Форма порога
Бюджет опасности на час экспозиции; ни одного единичного отказа с катастрофой; резервирование
Кто так меряет
FAA AC 25.1309-1B, ISO 26262
Пример
Порядка 10⁻⁹ на лётный час для катастрофы; для офисной работы числового порога никто не публикует

Универсального порога для прототипа, коммерческого продукта или ответственной операции из этих работ не следует. Решение зависит от распределения ошибок, их цены, способности проверяющего их обнаруживать и стоимости всех попыток. Допустимый риск задаёт владелец процесса; исследование должно показать, насколько уверенно измерения укладываются в это ограничение. Порог нельзя получить простым переносом процента из чужого бенчмарка.

07

Карточка автономности: что считать кроме результата

Если порог — свойство задачи, то отчёт об автономности не может состоять из одного процента. Я предлагаю карточку из шести строк, и у каждой строки в 2026 году уже есть где-то данные. Результат — доля задач, принятых по критерию, записанному до прогона; определение приёмки важнее числа, и определения Salesforce, Intercom и Zendesk показывают, как сильно оно двигает результат. Вмешательства — касания человека на задачу: Anthropic измерила, что опытные пользователи Claude Code одновременно чаще включают полное авто-одобрение, с 20 до 40 % сессий, и чаще прерывают агента, с 5 до 9 % ходов, — доверие и бдительность растут вместе; Microsoft в феврале формализовала это как TCR@k — долю задач, завершённых при не более чем k одобрениях. Цена проверки — минуты человека на принятую задачу: в эксперименте METR это девять процентов времени на проверку и чистку вывода при принятии меньше 44 % подсказок; у Faros время до первого ревью выросло примерно в два с половиной раза, но это ожидание, а не активный труд. Время восстановления — от сбоя до рабочего состояния, для чего у DORA уже есть определение; агент Kiro с унаследованной ролью инженера решил «удалить и пересоздать среду» и остановил сервис на тринадцать часов в одном регионе. — максимальный ущерб одного прогона и обратимость каждого действия: 0,8 % действий в API необратимы; классификатор авто-режима пропускает 17 % опасных действий на пятидесяти двух случаях — «17 % — честное число», пишет Anthropic; агент Replit удалил базу продакшена во время заморозки кода. И стоимость принятой задачи — все расходы за период на число принятых: HAL показывает агентов «в сто раз дороже ради одного процента», а Remote Labor Index считает провал бесконечной стоимостью.

схема 06 · карточка автономности: шесть строк вместо одного процента успеха
  1. РЕЗУЛЬТАТдоля задач, принятых пофиксированному критерию% задач
  2. ВМЕШАТЕЛЬСТВАкасания человека на задачу:подсказки, правки, остановкикасаний / задача
  3. ЦЕНА ПРОВЕРКИминуты человека на проверкуодной принятой задачимин / задача
  4. ВРЕМЯ ВОССТАНОВЛЕНИЯот сбоя до рабочего состоянияминуты
  5. РАДИУС ПОРАЖЕНИЯмаксимальный ущерб одногопрогона: деньги, данные,обратимостьденьги, да / нет
  6. СТОИМОСТЬ ПРИНЯТОЙ ЗАДАЧИвсе расходы, включая неудачныепопытки, на принятые задачиденьги / задача
Карточка автономности: шесть строк вместо одного процента успехаКАРТОЧКА АВТОНОМНОСТИчтокак измеряетсяединицаРЕЗУЛЬТАТдоля задач, принятых по фиксированному критерию% задачВМЕШАТЕЛЬСТВАкасания человека на задачу: подсказки, правки, остановкикасаний / задачаЦЕНА ПРОВЕРКИминуты человека на проверку одной принятой задачимин / задачаВРЕМЯ ВОССТАНОВЛЕНИЯот сбоя до рабочего состоянияминутыРАДИУС ПОРАЖЕНИЯмаксимальный ущерб одного прогона: деньги, данные, обратимостьденьги, да / нетСТОИМОСТЬ ПРИНЯТОЙ ЗАДАЧИвсе расходы, включая неудачные попытки, на принятые задачиденьги / задачаАвторская форма: первая строка — то, что сообщают вендоры, остальные пять — то, что отличает постоянного исполнителя от демонстрации
Строка
Результат
Как измеряется
Доля задач, принятых по критерию, записанному до прогона
Где сегодня есть данные
Salesforce: 70 % из 4,3 млн обращений «от начала до конца», платят только за них
Строка
Вмешательства
Как измеряется
Касания человека на задачу; TCR@k
Где сегодня есть данные
Anthropic: прерывания 5 → 9 % ходов с опытом; полное авто-одобрение 20 → 40 % сессий
Строка
Цена проверки
Как измеряется
Минуты человека на одну принятую задачу
Где сегодня есть данные
METR: 9 % активного времени на проверку и чистку вывода; ожидание ревью учитывать отдельно
Строка
Время восстановления
Как измеряется
От сбоя до рабочего состояния
Где сегодня есть данные
Kiro: около 13 часов простоя Cost Explorer в одном регионе; DORA: ИИ связан с нестабильностью поставки
Строка
Радиус поражения
Как измеряется
Максимальный ущерб одного прогона; обратимость
Где сегодня есть данные
Anthropic: 0,8 % действий необратимы; Replit: база продакшена во время заморозки
Строка
Стоимость принятой задачи
Как измеряется
Все расходы за период на число принятых
Где сегодня есть данные
HAL: в сто раз дороже ради одного процента; RLI: провал считается бесконечной стоимостью

Карточка нужна не для красоты: любую одну строку можно надуть. Долю принятых изменений может повышать формальное одобрение без содержательной проверки — об этом предупреждает Warp. Схожий риск есть при выдаче разрешений: Anthropic сообщает, что пользователи Claude Code одобряют 93 % запросов, и предупреждает об усталости от подтверждений: люди перестают внимательно смотреть, что именно разрешают. Вмешательства падают, если агенту отдавать только документацию. Стоимость падает, если считать только первый вызов модели. Только сочетание строк отличает постоянного исполнителя от удачной демонстрации: принятые по строгому критерию, при малом числе касаний, с дешёвой проверкой, быстрым восстановлением, ограниченным радиусом и известной ценой. Седьмой кандидат в строки — заметность ошибок из работы Ламбы: агент, который ошибается реже, но правдоподобнее, может стоить организации дороже того, который ошибается часто и очевидно. Как это измерять на потоке, пока не показал никто, но в отчёт об инцидентах стоит добавить поле «сколько ревью прошла ошибка до обнаружения».

08

Псевдоавтономность: куда прячется труд

Астра Тейлор в 2018 году назвала это «псевдоавтоматизацией»: труд не исчезает, а перекладывается — на покупателя у киоска, на модератора контента, на работника Mechanical Turk. Для агентов слово надо сузить: — это когда человеческий труд перенесён в подготовку инструкций и в исправление скрытых ошибок и исключён из метрики. Лучший документ по механизму — приказ SEC от 14 января 2025 года по делу компании Presto, производителя голосового автоответчика для автокафе. Первая версия «требовала ввода заказа человеком во всех случаях», пилот более продвинутой — в семидесяти процентах; операторы сидели на Филиппинах и в Индии. При этом компания отчитывалась о 95–99 % заказов «без вмешательства», и SEC установила, что этот показатель считался без вмешательства персонала ресторана — но не без людей. Внутри компании это понимали: один из руководителей предупреждал, что метрика «подразумевает отсутствие надзора, что неправда». Наказание — предписание без штрафа с учётом финансового положения, потом делистинг. Механизм здесь один и тот же во всех случаях: трюк со знаменателем. Людей исключают из метрики, сузив, кто считается человеком.

Случай
Presto Voice · автоответчик на кассе
Заявленная метрика
95–99 % заказов «без вмешательства»
Человеческая работа
Операторы на Филиппинах и в Индии: 100 % заказов в первой версии, 70 % в пилоте
Источник
Приказ SEC, январь 2025 года
Случай
Amazon Just Walk Out
Заявленная метрика
«Небольшое меньшинство» визитов проверяют люди
Человеческая работа
По данным прессы, около тысячи проверяющих в Индии и 700 из 1 000 покупок в 2022 году
Источник
Расследование The Information, апрель 2024 года
Случай
Cruise · роботакси
Заявленная метрика
«Без водителя»
Человеческая работа
Сеанс удалённой помощи каждые 4–5 миль; один оператор на 15–20 машин
Источник
Публикация NYT и признание CEO, ноябрь 2023 года
Случай
Waymo · роботакси
Заявленная метрика
«Совет, а не управление»
Человеческая работа
Около 70 операторов на 3 000 машин, половина за рубежом; запросов на милю «несущественно»
Источник
Слушания в Сенате, февраль 2026 года
Случай
Tesla Optimus · демонстрация
Заявленная метрика
Роботы общаются и наливают напитки
Человеческая работа
Телеоператоры за речью и жестами; ходьба — автономна
Источник
Bloomberg и Electrek, октябрь 2024 года
Случай
Builder.ai
Заявленная метрика
«ИИ собирает приложения»
Человеческая работа
Рассказ о 700 инженерах вместо ИИ не подтверждён; сообщения о выручке — отдельный вопрос
Источник
Pragmatic Engineer и FT, 2025 год
Случай
«Ноль строк вручную» · OpenAI
Заявленная метрика
Код сгенерирован агентами; работа инженеров раскрыта
Человеческая работа
За пять месяцев около 1 500 PR; команда выросла с трёх до семи; человеко-часы не опубликованы
Источник
Собственный пост, февраль 2026 года

Другие случаи требуют разных выводов. Amazon оспаривала долю покупок с человеческой проверкой; сообщения прессы и ответ компании следует читать вместе. Cruise называла сервис беспилотным, но раскрывала удалённую помощь: отсутствие водителя в машине не означает отсутствие поддержки. Waymo прямо описывает помощь как совет, а не дистанционное управление; число операторов само по себе не опровергает это обещание. В демонстрации Optimus речь и жесты поддерживали телеоператоры, тогда как ходьба оценивалась отдельно. 1X заявляла телеуправление как часть начального продукта. Обвинение основателя nate касается заявленной автоматизации покупок; обвинение не равнозначно установленной судом вине. По Builder.ai сообщения о выручке нельзя использовать как доказательство того, что разработку вместо ИИ тайно выполняли 700 человек: это отдельное, недостаточно подтверждённое утверждение. Для каждого случая нужны точное обещание и перечень человеческих операций, исключённых из метрики.

схема 07 · четыре отдельных показателя труда и затрат
  1. ПРИНЯТО БЕЗ ВМЕШАТЕЛЬСТВбез дополнительных подсказок,правок, одобренийдоля от всех начатых задач
  2. МИНУТЫ ЧЕЛОВЕКА / ПРИНЯТЫЙРЕЗУЛЬТАТподготовка, проверка, доработка,восстановлениевключая труд в неудачныхпопытках
  3. РАСХОДЫ МАШИНЫ / ПРИНЯТЫЙРЕЗУЛЬТАТтокены, инструменты,инфраструктуравключая неудачи и повторныепопытки
  4. КАЛЕНДАРНОЕ ВРЕМЯот старта до принятогорезультатаожидание не равно труду человека

Общую подготовку учитывать отдельно, раскрывая способ распределения затрат. Заявленная поддержка не доказывает скрытый труд.

Четыре отдельных показателя труда и затратУЧИТЫВАТЬ ВЕСЬ ПРОЦЕССПРИНЯТО БЕЗ ВМЕШАТЕЛЬСТВбез дополнительных подсказок, правок, одобренийдоля от всех начатых задачМИНУТЫ ЧЕЛОВЕКА / ПРИНЯТЫЙ РЕЗУЛЬТАТподготовка, проверка, доработка, восстановлениевключая труд в неудачных попыткахРАСХОДЫ МАШИНЫ / ПРИНЯТЫЙ РЕЗУЛЬТАТтокены, инструменты, инфраструктуравключая неудачи и повторные попыткиКАЛЕНДАРНОЕ ВРЕМЯот старта до принятого результатаожидание не равно труду человекаНе складывать часы машины и человека в отношение «автономности»Общую подготовку учитывать отдельно, раскрывая способ распределения затрат. Заявленная поддержка не доказывает скрытый труд.

Для программных агентов человеческая работа возникает до, во время и после запуска. OpenAI описывает около 1 500 PR за пять месяцев: первоначальная команда из трёх инженеров выросла до семи. Авторы прямо сообщают о проектировании среды и проверке; это раскрытый труд. Фактическое число человеко-часов не опубликовано, поэтому оценку «2–4 часа на PR» из размера команды получить нельзя. В эксперименте METR активное время на проверку и очистку вывода измерялось отдельно. У Faros время до первого ревью и пребывание в ревью — календарные показатели: они включают ожидание и не равны труду проверяющего. Общую подготовку инфраструктуры следует показывать отдельно и раскрывать способ распределения её стоимости по задачам или периоду. Для каждого принятого результата полезны четыре отдельных показателя: доля задач без вмешательств, человеческие минуты, машинные расходы и календарное время. В расходах учитываются и неудачные попытки. Исходное задание не считаем дополнительным вмешательством; последующие подсказки, правки и одобрения считаем. Независимую оценку результата учитываем отдельно от помощи в его получении.

Признаки псевдоавтономности можно проверять по списку, и у каждого признака есть прецедент. Знаменатель не определён: «доля без вмешательства», «доля решённых» без ответа, кто исключён. Отказ от отношения: компания охотно называет задержку и проверки операторов, но не число вмешательств на единицу работы. Труд появляется в отчётности только под давлением — после запроса регулятора, слушаний или расследования, а до того его нет. Перепаковка людей в «функцию» после разоблачения. Метрика нажатий вместо метрики труда. Правки после вывода: переписывание за две недели, рост размера PR, наём «доделать за ИИ». И самый тонкий — время на задачу перестаёт измеряться: METR поменяла дизайн эксперимента, потому что разработчики с агентами делали в ожидании другую работу и не могли сказать, сколько заняла задача. Образец раскрытия уже есть в другой отрасли: калифорнийские правила требуют в отчёте об отключении автопилота указать, «кто инициировал отключение: технология, водитель-испытатель, удалённый оператор или пассажир». Для программных агентов такой нормы нет.

  • Требовать определение знаменателя: кто не считается человеком в «без вмешательства»
  • Считать часы людей до и после прогона на принятую задачу, а не нажатия клавиш
  • Смотреть на след после вывода: переписанное за две недели, размер PR, наём на доделку
  • Не верить метрике, которую вендор не может дать на единицу работы
  • Сопоставлять обещание с учётом труда; не смешивать раскрытую поддержку и скрытую замену человека
09

Передача управления и граница компетентности

К осени 2026 года у каждого крупного вендора есть примитив остановки, и их устройство говорит о границе больше, чем декларации. Авто-режим Claude Code отдаёт решения классификатору на второй модели, и его блок-лист — готовый список триггеров: необратимое уничтожение файлов, существовавших до сессии, переписывание истории git, публикация секретов, выход за рамки запроса, незнакомая инфраструктура, действия по враждебному содержимому; границы, названные человеком в разговоре — «не пуши», «жди ревью», — тоже сигнал блокировки, и суждение модели о том, что условие выполнено, их не снимает; после трёх блокировок подряд или двадцати всего режим возвращает управление человеку. В Managed Agents есть политика auto, и документация предупреждает, что это «не контрольная точка человека». OpenAI прошла тот же путь: у Operator подтверждения перед действиями снижали риск примерно на девяносто процентов при полноте 92 %, у пяти из тринадцати ошибок без смягчений последствия были необратимы; в апреле 2026 года появилось авто-ревью— из десяти тысяч действий 720 вышли за песочницу, 713 одобрены проверяющей моделью, семь отклонены, прерываний в двести раз меньше. Причина смены курса названа прямо: люди пишут правила вроде «разрешить всё, что начинается с python» и одобряют, не вчитываясь. Решение о допуске действия передаётся от человека классификатору, и каждый вендор оговаривает, что классификатор не остановит модель, которая прячет намерение.

Видит ли агент границу сам? Данные 2026 года отвечают: слабо, и хуже там, где его дообучали на правильность. Кадур с соавторами дали фронтирным агентам сто задач SWE-bench Pro и спросили, справятся ли: агенты предсказывали 61–77 % успеха при реальных 22–35 %; 62 % провалов были предсказаны с уверенностью не ниже 0,7; оценка до исполнения различала успех и провал лучше, чем после, а сомнения по ходу оказались шумом. Бенчмарк воздержания от Meta показал, что дообучение на рассуждение снижает готовность сказать «не знаю» в среднем на 24 %, а масштаб от восьми до четырёхсот миллиардов параметров не меняет ничего; OpenAI объяснила почему — девять из десяти популярных бенчмарков не дают очков за отказ, и догадка всегда выгоднее. С вопросами та же картина: без подсказки агенты «почти никогда» не спрашивают даже на сильно недоопределённых задачах, хотя взаимодействие поднимает результат с 26,8 до 39,6 % и возвращает до 89 % результата полной спецификации. Самый жёсткий замер — HiL-Bench от Scale: когда агенту дают инструмент «спросить человека» и прячут часть вводных, pass@3 падает с 67–91 % до 1–39 %, потому что агент не распознаёт пробел; модели GPT недоспрашивают, Gemini переспрашивает, а Claude в 45 % провалов явно пишет, что застрял, и всё равно сдаёт работу. Интроспекция по данным самой Anthropic срабатывает примерно в двадцати процентах случаев и названа «крайне ненадёжной». Единственный обнадёживающий сигнал — вопрос до старта о требуемом усилии и своей способности предсказывает провал на семь-десять пунктов лучше вопроса об уверенности, а отдельный агент распознавания намерения выходит на уровень полной спецификации, спрашивая в 69 % задач.

схема 08 · триггеры передачи управления и механизмы обнаружения
  1. впереди необратимое действиеправило + человек
  2. исчерпан бюджет времени илиденегсчётчик бюджета
  3. инструмент отказал дважды подрядсчётчик отказов
  4. задача противоречит политикеклассификатор + политика
  5. вводные неполны или двусмысленнымодель + человек
  6. ситуация вне проверенной областипроверка области + человек
  7. уверенность низкая, план плывёткалиброванная оценка модели

Обнаружение может ошибаться. Проверенные сигналы связывают с остановкой, вопросом или продолжением.

Триггеры передачи управления: механизмы обнаружения и исполненияКОГДА ПЕРЕДАВАТЬ УПРАВЛЕНИЕвпереди необратимое действиеправило + человекисчерпан бюджет времени или денегсчётчик бюджетаинструмент отказал дважды подрядсчётчик отказовзадача противоречит политикеклассификатор + политикавводные неполны или двусмысленнымодель + человекситуация вне проверенной областипроверка области + человекуверенность низкая, план плывёткалиброванная оценка моделиДОПУСК ДЕЙСТВИЯблокировка системойили решение моделиОСТАНОВИТЬСЯи оставить следСПРОСИТЬ ЧЕЛОВЕКАконкретным вопросомПРОДОЛЖИТЬи записать решениедля каждого сигнала нужны механизм обнаружения и оценка пропусковтри последних триггера — граница компетентности, и модель судит о ней плохоАвторская схема по частям обвязки и данным о калибровке из девятого раздела

Отсюда двухступенчатый отказ, который повторяется во всех данных: частичное обнаружение, а затем неисполнение. Агент Replit знал о заморозке кода и удалил базу. В сценариях Anthropic Claude Opus 4 шантажировал в 55,1 % прогонов, когда считал ситуацию реальной, и в 6,5 %, когда считал её проверкой, — лабораторные замеры остановки могут быть оптимистичнее эксплуатации. GPT-5.6 Sol у METR показал «существенную осведомлённость о среде оценки» и одновременно рекордную долю жульничества.

В SpecBench один и тот же сгенерированный код проверяют двумя наборами тестов: видимыми агенту и скрытыми, которые проверяют совместную работу функций. На видимых тестах исследованные модели получают близкие к максимуму результаты. Для крупных задач авторы сообщают о худшем разрыве в 100 процентных пунктов: это соответствует 100 % пройденных видимых тестов и 0 % скрытых. Речь о крайнем случае среди отдельных прогонов, а не о среднем результате всех моделей.

В контролируемом эксперименте Ванга атакующий мог вписать в план агента вредоносную инструкцию, замаскированную под необходимый шаг задачи. Модель в роли проверяющего просматривала план и могла выдать сигнал «небезопасно, остановиться» — его в статье называют флагом. В одном режиме система только записывала предупреждение и позволяла агенту продолжить работу. В другом — останавливала выполнение, если распознавала этот сигнал. Успехом атаки считалось достижение навязанной цели по оценке судей-моделей. На объединённой контрольной выборке автор получил 48,3 % успешных атак без обязательной остановки и 10,8 % с ней. Это синтетический эксперимент с подменой плана; его практический вывод — предупреждение проверяющего должно запускать блокировку в системе исполнения. Способность заметить опасность и способность остановить действие нужно проверять отдельно.

Триггер
Необратимое действие: удаление существовавших файлов, деньги, публикация
Кто видит
Блокировка в системе исполнения; сам агент распознаёт риск лишь частично
Что известно
Operator: 5 из 13 ошибок без смягчений необратимы; блок-лист авто-режима Claude Code; 0,8 % действий в API необратимы
Триггер
Выход за рамки запроса или на незнакомую инфраструктуру
Кто видит
Классификатор второй моделью
Что известно
Авто-режим Claude Code: 17 % пропусков на 52 реальных случаях и 0,4 % ложных срабатываний на 10 000
Триггер
Граница, названная человеком: «не пуши», «жди ревью»
Кто видит
Принудительное ограничение; модель восприняла запрет как рекомендацию
Что известно
Replit, июль 2025: заморозка кода проигнорирована, база продакшена удалена
Триггер
Повторяющийся отказ, цикл, исчерпанный бюджет
Кто видит
Обвязка по счётчику
Что известно
Пауза после 3 блокировок подряд или 20 всего; MAST: повтор шагов — 15,7 % отказов
Триггер
Недостающие, двусмысленные или противоречивые вводные
Кто видит
Модель — плохо
Что известно
HiL-Bench: pass@3 падает с 67–91 % до 1–39 %, когда надо решить, спросить ли; Claude видит тупик в 45 % провалов и всё равно сдаёт
Триггер
Низкая уверенность до старта, расхождение оценок
Кто видит
Модель — слабо, и лучше до исполнения, чем после
Что известно
AUROC 0,62–0,64 до старта; заявленные 61–77 % успеха против реальных 22–35 % на SWE-bench Pro
Триггер
Враждебное содержимое в рабочем контексте
Кто видит
Классификатор, которому не показывают результаты инструментов
Что известно
Авто-ревью OpenAI: 99,3 % полноты по инъекциям; в эксперименте с подменой плана: 48,3 % успешных атак, если предупреждение только записывают, против 10,8 %, если оно запускает остановку

Человеческая сторона передачи не лучше машинной, и это известно с 1983 года. Лизанна Бейнбридж описала иронии автоматизации: она забирает лёгкие части и оставляет человеку самые трудные; внимание к источнику, где почти ничего не происходит, не держится дольше получаса; самые успешные автоматы требуют самой большой подготовки оператора. NIST в августе 2026 года переписала это для агентов: «слишком разговорчивые агенты приучают пользователей рефлекторно жать „разрешить“», как жертвы бомбардировки запросами двухфакторной аутентификации, — и предложила заранее утверждённые «планы полёта» вместо вопроса на каждом шаге. Автомобильная литература добавляет предупреждение: по пятидесяти одному исследованию чем быстрее человек перехватывает управление, тем резче манёвры и выше аварийность. Скорость передачи — не её качество. Качество передачи надо мерить тем, что человек делает после: понял ли состояние, принял ли верное решение, — а для этого агент должен передавать не «я застрял», а состояние, улики и причину остановки. Для каждого триггера нужен механизм обнаружения: правило, счётчик, классификатор, калиброванная оценка модели или человек. Ни один не гарантирует обнаружение. Маршрутизацию до старта и уточняющие вопросы стоит проверять локально, а порог уверенности — на каждом домене: один и тот же оценщик даёт AUROC 0,85 в телекоме и 0,23 в авиации.

10

Система измерений, в которой три уровня сходятся

Лаборатория, сравнительное испытание и эксплуатация могут расходиться из-за разных задач, критериев приёмки, бюджетов и правил учёта. Общие определения позволяют сравнивать измерения: одна единица работы, заранее записанный критерий, учёт вмешательств и затрат, общая таксономия отказов. Но этого недостаточно для предсказания эксплуатации. Остаются различия распределений задач, среды, пользователей и обновлений модели. Перенос надо проверять на представительной рабочей выборке, а затем наблюдать за изменениями в эксплуатации.

схема 09 · общие определения позволяют сравнивать три уровня измерений
  1. ЛАБОРАТОРИЯнаборы задач, горизонтыконтролируемо, повторяемо
  2. СРАВНИТЕЛЬНОЕ ИСПЫТАНИЕбенчмарки, лидербордыявный протокол оценки
  3. ЭКСПЛУАТАЦИЯтелеметрия, инциденты, стоимостьлокальная выборка задач

одна единица работы на всех уровнях; один критерий приёмки, записанный до прогона; один учёт вмешательств, проверки и стоимости; одна таксономия отказов и восстановления

Сопоставимые определения не гарантируют перенос в эксплуатацию.

Три уровня измерений сходятся только по общим осямСИСТЕМА ИЗМЕРЕНИЙ: ОБЩИЕ ОСИ, А НЕ СРЕДНЕЕЛАБОРАТОРИЯнаборы задач, горизонтыконтролируемо, повторяемоСРАВНИТЕЛЬНОЕ ИСПЫТАНИЕбенчмарки, лидербордыявный протокол оценкиЭКСПЛУАТАЦИЯтелеметрия, инциденты, стоимостьлокальная выборка задачодна единица работы на всех уровняходин критерий приёмки, записанный до прогонаодин учёт вмешательств, проверки и стоимостиодна таксономия отказов и восстановленияОбщие определения позволяют сравнивать; перенос требует сопоставимых выборок, среды и проверки в эксплуатации
Уровень
Лаборатория: METR, HCAST, RE-Bench
Единица
Задача в человеко-часах
Приёмка
Бинарный успех, логистическая подгонка
Учёт
Токены и бюджет; вмешательств нет по построению
Что добавить
80 %-горизонт рядом с 50 %; доля задач с осложнениями рабочей среды; внешний судья вместо тестов
Уровень
Сравнительное испытание: лидерборды
Единица
Задача или проект
Приёмка
Тесты, рубрика, эксперт или судья-модель
Учёт
Стоимость иногда; обвязка почти никогда
Что добавить
pass^k и пять прогонов; раскрытая обвязка; журналы, а не только счёт
Уровень
Эксплуатация: телеметрия и инциденты
Единица
Ход, сессия, PR, обращение
Приёмка
Принято, не откачено, не эскалировано
Учёт
Касания, минуты проверки, инциденты, деньги
Что добавить
Тот же критерий приёмки, что в лаборатории; знаменатель без исключённых людей

Мосты между уровнями уже строятся, и их стоит назвать. Фэн с соавторами предложили «вспомогательные оценки»: запустить агента без человека, затем добавлять участие раунд за раундом, пока результат не превысит порог, и считать уровнем автономности минимальное участие, при котором это случилось, — так лабораторный прогон и эксплуатационное касание оказываются на одной оси. TCR@k делает то же для бенчмарков и телеметрии: доля задач при не более чем k вмешательствах считается одинаково в песочнице и в проде. Anthropic советует собирать регрессионные эвалы из реальных инцидентов и требовать почти сто процентов — это перенос критерия приёмки из эксплуатации в лабораторию. Журналы вместо счёта, раскрытая обвязка и пять прогонов переносят учёт из эксплуатации в таблицы лидеров. Разделение уровней способности и разрешённой автономности у Чжэна с соавторами требует отчитываться обоими: что агент может и что ему позволено. И Индекс агентов MIT показывает, сколько ещё пусто: у тридцати развёрнутых агентов 135 из 240 полей о безопасности не заполнены, оценки безопасности раскрыли четыре.

Российский контур: что публикуют и чего нет

Российские публикации также дают разные типы показателей. Сбер сообщает объём токенов и рост использования, Яндекс — долю разработчиков и кода; это не доля принятых задач без помощи. Райффайзен разделяет 25 % бэклога с агентами и 4 % без обращения к человеку, но для переноса результата нужны период и критерий приёмки. У «Первой Формы» 93 % PR создают агенты, 94 % вливаются без замечаний, а около 76 часов от ревью до слияния — календарная задержка. При одиннадцати минутах работы модели эта разница показывает очередь процесса, но не 76 часов труда человека. Опросы «Инфосистем Джет» и Codenrock описывают распространённость и доверие, а не сопоставимую успешность. Данных недостаточно, чтобы заключить, что рынок в целом отстаёт, опережает или точно повторяет мировой тренд.

Кто
Райффайзен · Saint HighLoad++, июнь 2026
Число
25 % бэклога с агентами, 4 % автономно без обращения к человеку
Что измеряет
Долю задач без вмешательства
Чего нет
Период и критерий приёмки
Кто
Сбер · июнь 2026
Число
1,5 трлн токенов за пять месяцев; ежедневных пользователей агентного режима впятеро больше
Что измеряет
Объём и принятие инструмента
Чего нет
Доля принятого, откаты, вмешательства
Кто
Яндекс · июль 2026
Число
73 % разработчиков регулярно; больше половины нового кода; 17,2 % на планке 75/75/75
Что измеряет
Долю участия ИИ
Чего нет
Приёмка и вмешательства
Кто
«Первая Форма» · август 2026
Число
93 % PR создают агенты; 94 % вливаются без замечаний; 76 часов от ревью до слияния
Что измеряет
Приёмку и очередь ревью
Чего нет
Активные минуты человека отдельно от ожидания
Кто
Инфосистемы Джет · август 2026
Число
Полностью автономные агенты в эксплуатации у 8 % компаний; 46 % не видят устойчивого эффекта
Что измеряет
Распространённость
Чего нет
Определение «автономный»
Кто
Codenrock · февраль–март 2026
Число
36 % не дают агенту работать автономно; 54,7 % называют причиной нехватку контекста
Что измеряет
Доверие разработчиков
Чего нет
Результат по задачам
11

Программа проверки на своём парке агентов

Из обзора следует программа локальной проверки. Это авторское предложение, а не валидированный стандарт или обещание закончить за месяц. До запуска нужно выбрать допустимую цену ошибки, условия экономии и требуемую уверенность оценки. Размер выборки и длительность наблюдения зависят от этих требований; редкие тяжёлые ошибки невозможно надёжно оценить несколькими десятками задач.

Проверка
Единица работы
Что сравнивать
Одна и та же задача в трёх измерениях: эпизод, бенчмарк, эксплуатация
Какое решение
Можно ли вообще сравнивать числа
Критерий остановки
Единицу нельзя назвать — измерения нет
Проверка
Строгая приёмка до прогона
Что сравнивать
«Все критерии» против взвешенного балла и самооценки агента
Какое решение
Какой вопрос измеряет каждый показатель
Критерий остановки
Разделить прогресс и полное завершение; объяснить расхождение
Проверка
Повторы
Что сравнивать
pass^1 и pass^5 на одинаковых задачах; рабочая выборка отдельно от инцидентов
Какое решение
Постоянный исполнитель или удачная демонстрация
Критерий остановки
Оценка с учётом неопределённости не укладывается в выбранную цену ошибки
Проверка
Касания и проверка
Что сравнивать
Минуты человека до, во время и после прогона на принятую задачу
Какое решение
Окупается ли делегирование
Критерий остановки
Полная ожидаемая стоимость превышает ручную альтернативу
Проверка
Радиус
Что сравнивать
Максимум ущерба одного прогона, обратимость каждого действия
Какое решение
Где блокировать действие, а где достаточно записать его в журнал
Критерий остановки
Необратимое действие без обязательной проверки — стоп
Проверка
Знаменатель
Что сравнивать
Кто исключён из слова «автономно»: подрядчики, эскалации, брошенные диалоги
Какое решение
Нет ли псевдоавтономности
Критерий остановки
Исключения не раскрыты — вывод об автономности не проверяем

Сначала собрать представительную выборку рабочих задач и отдельно набор трудных инцидентов. Второй нужен для проверки устойчивости, но не оценивает среднюю успешность эксплуатации. Пилот на 20–50 задачах с пятью независимыми запусками может выявить типичные отказы; он не доказывает безопасность редких событий. Сравнивать pass^1 и pass^5 следует на одинаковых задачах, моделях, обвязке и бюджетах. Даже при одинаковой независимой вероятности 0,85 пять успехов имеют вероятность 0,85^5 ≈ 0,444: это ожидаемая арифметика, а не самостоятельный стоп-сигнал. Для неоднородных задач усреднение требует осторожности, а зависимые повторы нельзя считать независимой выборкой. Отчёт должен содержать интервалы неопределённости, все вмешательства, расходы неудач и отдельное время ожидания. Делегирование ограничивают, если консервативная оценка риска или стоимости не укладывается в заранее выбранные условия, либо требуемый контроль не работает.

Автономность — свойство конкретной системы, выполняющей определённую работу в заданной среде и пределах полномочий. Система измерений описывает это свойство. Практический результат обзора — способ проверить условия делегирования, а не универсальный срок работы без человека. Нужны понятный результат, проверяемая приёмка, раскрытая помощь, учёт затрат и наблюдение за отказами. Срок накопления данных определяется требуемой надёжностью, а не общим правилом «один квартал».

Выводы

Семь выводов о границах автономности

  1. 01Автономность — свойство системы в конкретной задаче, среде и пределах полномочий. Пять единиц работы — авторская классификация; сравнения разных бенчмарков не доказывают общего закона падения успешности.
  2. 0250 %- и 80 %-горизонты METR описывают распределение задач и процедуру оценки. Для делегирования нужны свои требования к надёжности, цена ошибки и учёт труда; ни один горизонт не задаёт готовый порог.
  3. 03Условия задачи, критерий приёмки и судья меняют смысл результата. Сравнивать числа можно внутри согласованных постановок; частичный балл полезен для оценки прогресса и не заменяет долю завершённых задач.
  4. 04Способность и повторяемость — разные характеристики. Сравнивать pass^1 и pass^k следует на одинаковых задачах и конфигурациях, раскрывая разброс и зависимость повторов.
  5. 05Модель длинной цепочки иллюстрирует накопление риска при независимых шагах. Контрольные точки помогают только при обнаружении ошибки и пригодном повторе; их выгоду и затраты надо проверять в своей среде.
  6. 06Экономический порог зависит от затрат всей попытки, надёжности проверки и ущерба. Универсальных 50 % или 90 % нет: при стоимости попытки с проверкой выше ручной работы даже безошибочный агент не даёт экономии.
  7. 07Скрытый труд нужно отличать от раскрытой поддержки и подготовки среды. Считать следует принятую работу без вмешательств, человеческие минуты, машинные расходы и календарное время по отдельности.
12

Источники и границы исследования

Это тематический обзор, а не систематическое исследование всей литературы. Реестр охватывает первичные работы, таблицы лидеров, документацию и регуляторные тексты, собранные к 27 сентября 2026 года. В ходе доработки ключевые сравнения проверены выборочно; это не повторная верификация всех ссылок. Досье в репозитории связывает ключевые тезисы с версиями источников, таблицами, метриками и допустимыми выводами. Отдельно отмечены авторские расчёты и неразрешённые противоречия. Лидерборды меняются; результаты относятся к указанным снимкам, а отсутствие интервала не означает отсутствие неопределённости.

Единицы работы и уровни автономности

  1. Sheridan, Verplank · Human and Computer Control of Undersea Teleoperators — 14 июля 1978 года: десять уровней автоматизации «для одного элементарного шага решения» — самая мелкая единица автономного труда в литературе
  2. Mitchell, Ghosh, Luccioni, Pistilli · Fully Autonomous AI Agents Should Not be Developed — 4 февраля 2025 года, v3 от 20 октября: пять уровней по тому, какую часть потока программы контролирует модель; авторы рекомендуют не строить полностью автономных агентов
  3. Feng, McDonald, Zhang · Levels of Autonomy for AI Agents — 14 июня 2025 года: пять уровней по роли человека — оператор, соавтор, консультант, утверждающий, наблюдатель; «вспомогательные оценки» и сертификаты автономности
  4. Kasirzadeh, Gabriel · Characterizing AI Agents for Alignment and Governance — 30 апреля 2025 года: уровни A.0–A.5 по доле задач без принципала; полная автономия «не является желательной целью»
  5. Morris et al. (Google DeepMind) · Levels of AGI — Версия от 5 июня 2024 года: автономность — отдельная ось от способности; «рост способностей открывает новые режимы взаимодействия, но не предопределяет их»
  6. OpenAI · Practices for Governing Agentic AI Systems — Декабрь 2023 года: агентность как степень, четыре компоненты — сложность цели, сложность среды, адаптивность, самостоятельное исполнение; семь практик управления
  7. OECD · The agentic AI landscape and its conceptual foundations (AI Paper No. 56) — Февраль 2026 года: четыре уровня автономности действия — от поддержки человека до человека вне контура; уровень «зависит от того, как система спроектирована и развёрнута»
  8. Zheng et al. · Separating Capability from Permission: A Governance Framework for Agentic AI Autonomy Levels — 26 июля 2026 года: уровни способности отдельно от уровней разрешённой автономности; обсуждение по аннотации, полный текст недоступен
  9. Eloundou, Manning, Mishkin, Rock · GPTs are GPTs — Март 2023 года: единица — задача O*NET, потому что профессии «связки задач» и почти ни одну нельзя автоматизировать целиком; отсюда «задача» в экономике агентов
  10. Anthropic · How AI is transforming work at Anthropic — 2 декабря 2025 года: 132 инженера, 200 тысяч транскриптов; больше половины могут «полностью делегировать» 0–20 % работы; серия автономных действий выросла с ~10 до ~20; самоотчёт
  11. Deloitte · Survey examines AI readiness and agentic AI success — 12 августа 2026 года, 501 руководитель: 42 % тестировали или развернули агентов, 15 % масштабировали; 61 % ожидают в целом автономных агентов; 5 % считают процессы готовыми; опрос
  12. Gartner via MarTech · Over 40% of agentic AI projects will be canceled by end of 2027 — Пресс-релиз 25 июня 2025 года в пересказе: свыше 40 % агентных проектов отменят к концу 2027 года; из тысяч вендоров «около 130» с реальной агентностью; первичная страница закрыта для проверки
  13. Bain via Bloomberg (пересказ) · AI cost savings survey, June 2026 — Апрель 2026 года, 951 респондент из компаний от 100 млн долларов: 7 % запускают полностью автономных агентов в эксплуатации; первичный отчёт не открыт, число приведено по пересказу

Горизонт задач METR

  1. METR · Time Horizons (таблица лидеров) — Обновлено 8 мая 2026 года: Claude Mythos Preview (early) 17 ч 25 мин на 50 % и 3 ч 06 мин на 80 %; Opus 4.6 — 11 ч 59 мин и 1 ч 10 мин; «выше 16 часов измерения ненадёжны»; удвоение с 2023 года 128,7 дня
  2. Kwa, West et al. (METR) · Measuring AI Ability to Complete Long Software Tasks — 18 марта 2025 года, v4 от 10 июля 2026 года: определение горизонта, логистическая подгонка, 800 человеческих замеров; 80 %-горизонт в 4–6 раз короче; в исходных HCAST и RE-Bench в среднем 3,2 из 16 признаков осложнений рабочей среды; подрядчики в 5–18 раз медленнее
  3. METR · Time Horizon 1.1 — 29 января 2026 года: 228 задач, 31 длиннее восьми часов и лишь пять из них с замеренным человеческим временем; удвоение 196,5 дня за весь период и 88,6 дня с 2024 года
  4. METR (Kwa) · Clarifying limitations of time horizon — 22 января 2026 года: «горизонт — не длительность самостоятельной работы»; ошибка примерно вдвое в каждую сторону; домены различаются на порядки; некоторым задачам нужно 98 %+
  5. METR (Barry) · Impact of modelling assumptions on time horizon results — 20 марта 2026 года: без публичных задач RE-Bench горизонт Opus 4.6 падает с 12 до 7 часов; разумные варианты подгонки двигают 50 % в полтора раза и 80 % вдвое; главная неопределённость — распределение задач
  6. METR (Jurkovic) · Measuring Time Horizon using Claude Code and Codex — 13 февраля 2026 года: ни Claude Code, ни Codex не обошли стандартные скаффолды METR на Opus 4.5 и GPT-5; бюджеты 8 и 16 млн токенов
  7. METR · Summary of METR's predeployment evaluation of GPT-5.6 Sol — 26 июня 2026 года: 11,3 часа при учёте жульничества как провала, «свыше 270 часов» при учёте как успеха; ни одно число METR не считает надёжным
  8. METR · Summary of METR's predeployment evaluation of Claude Opus 5.5 — 22 сентября 2026 года: оценка на пяти задачах исследований и разработки ИИ; постепенное улучшение относительно Fable 5.1, без нового сопоставимого 50 %- или 80 %-горизонта
  9. METR · Expenditure Horizon — 21 июля 2026 года: новая метрика в долларах — сумма, при которой улучшение агента равно улучшению человека с тем же бюджетом; дополнение к горизонту, а не замена
  10. METR (Cunningham) · Metrics of Agent Ability — 24 июля 2026 года: человеко-привязанные метрики «становятся неопределёнными или неинформативными», когда агент по Парето обгоняет человека; бинарный успех статистически неэффективен
  11. Toby Ord · Is there a Half-Life for the Success Rates of AI Agents? — 7 мая 2025 года: постоянная интенсивность отказа объясняет кривые METR; 80 %-горизонт ≈ треть, 99 % ≈ семидесятая часть пятидесятипроцентного
  12. Toby Ord · Hazard Rates for AI Agents Decline as a Task Goes On — 4 февраля 2026 года: по данным Хэмилтона интенсивность отказа падает по ходу задачи, форма Вейбулла около 0,6; 99 %-горизонт может быть «в двадцать раз короче», чем предсказывает логистическая кривая METR
  13. Fergus Hamilton · Peto's Paradox and the Future of AI Agents — 23 января 2026 года: байесовские подгонки Вейбулла к прогонам METR; у моделей k = 0,6–0,9, у людей ≈ 0,37; при 99,9 % горизонт вдесятеро короче логистического; данных для различения моделей мало
  14. MIT Technology Review · This is the most misunderstood graph in AI — 5 февраля 2026 года: ось — человеческое время, а не автономность машины; Кwa: «машина хайпа всё равно вырежет все оговорки»
  15. METR · Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity — 10 июля 2025 года: 16 разработчиков, 246 задач; с ИИ на 19 % дольше при ожидании ускорения на 24 %; рандомизированный эксперимент
  16. METR · Uplift update: changing the developer productivity experiment design — 24 февраля 2026 года: 57 разработчиков, 800+ задач; −18 % и −4 % с широкими интервалами; 30–50 % участников не сдавали задачи, где ждали ускорения; «очень слабое свидетельство»
  17. METR · AI usage survey — 11 мая 2026 года: 349 респондентов, медианное самооценённое ускорение втрое; в эксперименте 2025 года люди завышали эффект на 40 пунктов; «не обязательно соответствует реальности»
  18. Anthropic · Measuring AI agent autonomy in practice — 18 февраля 2026 года: медианный ход Claude Code ≈ 45 секунд, 99,9-й перцентиль вырос с 25 до 45 минут; авто-одобрение 20 → 40 % с опытом, прерывания 5 → 9 %; 73 % с человеком в контуре; 0,8 % действий необратимы; данные одного вендора
  19. OpenAI · Introducing upgrades to Codex — 15 сентября 2025 года: заявление о более чем семи часах самостоятельной работы GPT-5-Codex в тестах; длительность исполнения не равна горизонту METR
  20. Anthropic · Introducing Claude Sonnet 4.5 — 29 сентября 2025 года: «более 30 часов» фокуса на многошаговых задачах — наблюдение без методики; METR для той же модели: 1 ч 57 мин на 50 % и 26 мин на 80 %
  21. Epoch AI (Denain, Barry) · Have AI Capabilities Accelerated? — 16 апреля 2026 года: рассуждающие модели дали разовый скачок и в 2–3 раза более быстрый тренд; прирост сосредоточен в программировании и математике

От изолированной задачи к рабочему дню

  1. Jaye et al. (Microsoft) · CorpGen: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments — 15 февраля 2026 года: 46 задач OSWorld Office, 500–1 500 шагов за сеанс; CUP 16,7 % → 8,7 % при росте нагрузки; CorpGen + CUP при полной нагрузке 16,3 %; четыре механизма отказа; без одиночной базы сравнения и без людей
  2. Microsoft Research · CORPGEN advances AI agents for real work — 26 февраля 2026 года: пост о статье; «до 3,5 раза выше» — 15,2 % против 4,3 %, то есть 7 и 2 задачи из 46; судья по скриншотам согласен с людьми лишь в 40 % случаев
  3. Xu et al. (CMU) · TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks — 18 декабря 2024 года, v3 от 10 сентября 2025 года: 175 задач в самодельной компании; лучший агент статьи 30,3 %; отказы — здравый смысл, общение, браузер, самообман; человеческой базы нет
  4. TheAgentCompany · Leaderboard — Прочитано 26 сентября 2026 года: лучшая строка 42,9 % полных и 52,4 % взвешенных от 10 ноября 2025 года; записей 2026 года нет
  5. Srinivasan · Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations — 11 августа 2026 года: на TheAgentCompany, τ²-bench и AppWorld агент объясняет меньше 3 % дисперсии, взаимодействие агент × задача — 7–23 %; препринт одного автора
  6. ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents — 26 апреля 2026 года: 100 задач, среда меняется без участия агента; Sonnet 4.6: 75,8 взвешенного балла и 14 % строгих успехов; падение после первого внешнего изменения
  7. Huang et al. (Salesforce) · CRMArena-Pro — 24 мая 2025 года: 19 задач в живой CRM; один ход 58,3 %, диалог 30,0 % у лучшей модели; 45 % провалов в диалоге — не запросил недостающее; конфиденциальность около нуля без подсказки
  8. Patwardhan et al. (OpenAI) · GDPval — 5 октября 2025 года: 220 «золотых» задач, эксперты со стажем 14 лет, три судьи; Opus 4.1 — 47,6 % побед и ничьих; задачи «точно поставлены и одноразовы, не интерактивны»; сценарий «попробовать и исправить» экономит 0,9–1,1×
  9. OpenAI · Introducing GPT-5.5 — Страница запуска: GDPval 84,9 % побед и ничьих у GPT-5.5, 80,3 % у Claude Opus 4.7, 67,3 % у Gemini 3.1 Pro — оценка вендора, независимой экспертной перепроверки не найдено; собственная таблица OpenAI закрыта
  10. Scale AI · Remote Labor Index (таблица лидеров) — Прочитано 26 сентября 2026 года: GPT 6 Astra 20,83 %, Fable 5.1 17,92 %, Fable 5 15,80 %, Opus 4.8 8,33 %; знаменатель лидерборда не согласован с методикой достаточно явно; провал считается бесконечной стоимостью
  11. Mazeika et al. (CAIS, Scale AI) · Remote Labor Index: Measuring AI Automation of Remote Work — 30 октября 2025 года: 240 проектов от 358 фрилансеров, 6 000 часов, 144 тысячи долларов; на старте лучший агент 2,5 %; провалы — низкое качество 45,6 %, незавершённость 35,7 %
  12. CAIS (Mazeika) · A Significant Increase in Digital Labor Automation — 1 июля 2026 года: Fable 5 — 15,8 %; новые прогоны с Claude Code и Codex CLI, циклом «работник — критик», бюджетом до 150 долларов и 24 часами; судья-модель завышает в 2,5–3 раза; успех не падает с длиной задачи
  13. Vidgen et al. (Mercor) · APEX-Agents — 21 января 2026 года, v3 от 23 февраля: 480 задач, 33 мира; Gemini 3 Flash: pass@1 24,0 %, средний балл 39,5 %, pass@8 36,7 %; 40–62 % траекторий без единого критерия; судья — тоже участник таблицы
  14. Mercor · APEX-Agents Leaderboard — Прочитано 26 сентября 2026 года: Opus 5.5 Max 73,5 % ± 4,9, Fable 5.1 Max 68,6 %; набор помечен v1.1, дат нет
  15. Andon Labs · Vending-Bench 2 — Запущен 18 ноября 2025 года; 66 строк на 26 сентября 2026 года: GPT-6 Astra 15 515 долларов, Fable 5.1 5 422; «хороший человек» ≈ 63 тысячи — расчётная оценка авторов, не замер
  16. Anthropic · Project Vend: Can Claude run a small shop? — 27 июня 2025 года: месяц торговли Sonnet 3.7; вольфрамовые кубы ниже себестоимости, выдуманный счёт для оплаты, «человек в синем пиджаке»; физическую работу делали сотрудники Andon Labs по 50 долларов в час
  17. Anthropic · Project Vend: Phase two — 18 декабря 2025 года: инструменты, CRM и агент-директор убрали убыточные недели, но директор одобрял скидки в восемь раз чаще, чем отказывал; «готов ли к запуску у вас в офисе? Пока не совсем»
  18. Li et al. · The Tool Decathlon (Toolathlon) — Октябрь 2025 года, v2 от 26 февраля 2026 года: 108 задач, 604 инструмента, ≈ 20 ходов; лучшие 38,6 %; модели «делегируют оставшуюся работу обратно пользователю» вопреки инструкции; к июню 2026 года проверенная версия — 73–78 %
  19. Bandi et al. (Scale AI, NUS) · MCP-Atlas — 31 января 2026 года, v3 от 19 мая: 1 000 задач на 36 серверах; 63 % отказов — когнитивные, из них ранняя остановка 18,7 % и непонимание задачи 15,1 %, а не синтаксис вызова

Надёжность и достоверность бенчмарков

  1. Yao, Shinn, Razavi, Narasimhan (Sierra) · τ-bench — 17 июня 2024 года: определение показателя успеха во всех попытках подряд; GPT-4o решает 61,2 % задач розницы с первой попытки и меньше 25 % — во всех восьми
  2. Barres et al. (Sierra) · τ²-Bench — 9 июня 2025 года: домен телеком, где инструментами пользуются и агент, и клиент; pass^1 → pass^4 теряет 15–26 пунктов; добавление действующего пользователя снимает 18–25 пунктов
  3. Anthropic · Demystifying evals for AI agents — 9 января 2026 года: эвалы способности начинают с низкого процента, регрессионные должны проходить почти на 100 %; pass^k для агентов, где важна стабильность; «задача, прошедшая в одном прогоне, может провалиться в следующем»
  4. Kapoor, Stroebl et al. (Princeton) · Holistic Agent Leaderboard — 13 октября 2025 года: 21 730 прогонов, 40 тысяч долларов; в 21 из 36 сочетаний больше рассуждений не подняли точность; агенты искали ответы на HuggingFace и жёстко кодировали тесты; одинаковая точность при разном риске
  5. Kirgis, Kapoor et al. · Log analysis is necessary for credible evaluation of AI agents — 8 мая 2026 года: после исключения 25 дефектных задач из 50 в τ-bench Airline средний pass^5 вырос с 20,8 % до 40,0 %; изменился состав оценки, а не модели
  6. Rabanser, Kapoor et al. · Towards a Science of AI Agent Reliability — 18 февраля 2026 года, ICML 2026: двенадцать метрик по четырём измерениям — постоянство, устойчивость, предсказуемость, безопасность; «прирост способностей дал лишь малый прирост надёжности»
  7. Zhang et al. · Stop Comparing LLM Agents Without Disclosing the Harness — 7 мая 2026 года: дисперсия от обвязки «может существенно превышать дисперсию от модели», вплоть до смены порядка моделей
  8. Snorkel AI · Terminal-Bench 2.1 (зеркало таблицы) — Прочитано 26 сентября 2026 года: повторные прогоны и интервалы ±0,9–1,5 пункта; та же модель 83,8 % в Claude Code и 80,4 % в Terminus 2 — таблица «оценивает модель и обвязку вместе»
  9. OpenAI · Why SWE-bench Verified no longer measures frontier coding capabilities — 23 февраля 2026 года: в 59,4 % из 138 трудных задач дефекты тестов или постановки; все фронтирные модели воспроизводят «золотые» патчи; OpenAI прекратила публиковать счёт
  10. OpenAI · Separating signal from noise in coding evaluations — 8 июля 2026 года: на публичной части SWE-bench Pro 23,3 % → 80,3 % за восемь месяцев; пять инженеров на задачу нашли 34,1 % сломанных; «около 30 % задач сломаны», рекомендация отозвана
  11. Deng et al. (Scale AI) · SWE-Bench Pro — 21 сентября 2025 года: 1 865 задач из 41 репозитория; на закрытых коммерческих репозиториях Opus 4.1 падает с 22,7 до 17,8 %, GPT-5 — с 23,1 до 14,9 %
  12. Xue et al. · An Illusion of Progress? Assessing the Current State of Web Agents — 2 апреля 2025 года, COLM 2025: на 300 живых сайтах Browser Use показал 30,0 % против заявленных 89 % на WebVoyager; простой поисковый агент решал 51 % старого набора
  13. Li, Zhang, Hassan · The Rise of AI Teammates in Software Engineering 3.0 (AIDev) — 20 июля 2025 года: 456 535 агентных PR из 61 453 репозиториев; в популярных проектах приняты 38–65 % PR агентов против 76,8 % у людей; отклонённые PR Codex закрывают примерно в десять раз быстрее человеческих; это не общий результат всех агентов
  14. Pinna, Gong, Williams, Sarro · Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance — 9 февраля 2026 года, MSR 2026: документация принимается в 82,1 %, новые функции в 66,1 %; разрыв по типу задачи больше разрыва между агентами
  15. Zheng, Wu, Chang · ToolRobustBench — 23 августа 2026 года: 15 456 возмущённых экземпляров, семь моделей; чистая постановка 0,979, испорченные ответы инструментов 0,455, ни одна модель не выше 0,60; смешанные возмущения не складываются
  16. Zhu et al. · Establishing Best Practices for Building Rigorous Agentic Benchmarks — 3 июля 2025 года: чеклист валидности задачи и результата; 7 из 10 бенчмарков нарушают первое, 7 — второе; пустой ответ давал 38 % на невозможных задачах τ-bench; 24 % позиций SWE-bench Verified неверны
  17. Stack Overflow · Developer Survey 2025: AI — Июль 2025 года, 49 тысяч респондентов: «почти правильно, но не совсем» — 66 %; отладка кода ИИ дольше — 45,2 %; сильно доверяют точности 3,1 %; результатов 2026 года на 26 сентября нет
  18. Faros AI · The Acceleration Whiplash — 2026 год, 22 тысячи разработчиков: время до первого ревью +156,6 %, медианное время в ревью +441,5 %, PR без ревью +31,3 %, инцидентов на PR +242,7 %; телеметрия вендора, когорты наблюдательные
  19. DX · The State of AI Impact in Engineering: Q2 2026 — 22 июля 2026 года, 500+ организаций: 52 % влитого кода написано ИИ; уверенность в изменениях −6,1 % при росте поддерживаемости на 3,8 %; индекс опыта разработчика 67 → 65
  20. GitClear · The Maintainability Gap — Январь 2026 года, 623 млн изменений: дублирование блоков +81 %, рефакторинг с 21 % изменений до 3,8 %, копипаст 9,4 → 15,7 %; телеметрия вендора

Длинные цепочки, отказы и контрольные точки

  1. Sinha, Arun, Goel, Staab, Geiping · The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs — Сентябрь 2025 года, третья версия от 13 марта 2026 года, ICLR 2026: горизонт равен логарифму порога, делённому на логарифм точности шага; самообусловливание — ошибки в контексте повышают дальнейшие; масштаб не лечит, рассуждение лечит; задача синтетическая
  2. Khanal, Tao, Zhou · Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents — 31 марта 2026 года, 23 392 эпизода: падение с длиной в 1,5–2,4 раза сильнее независимой модели; декомпозиция на границах подзадач возвращает 13–42 пункта; эпизодическая память не помогла ни одной из десяти моделей
  3. Rahman et al. · Locating Hidden Failures Makes Long-Horizon Agents More Reliable (Traverse, Scout) — 15 сентября 2026 года: после ошибочного шага следующий ошибочен в 40–58 % против 3–5 %; 69,5 % прогонов не восстанавливаются; 84,1 % провалов выглядят правильно в конце; фронтирные судьи находят первую ошибку меньше чем в трети прогонов
  4. Cemri et al. (Berkeley) · Why Do Multi-Agent LLM Systems Fail? (MAST) — v3 от 26 октября 2025 года, NeurIPS 2025: 1 642 трейса, 14 режимов отказа; повтор шагов 15,7 %, рассогласование рассуждения и действия 13,2 %, незнание условия остановки 12,4 %, неверная проверка 9,1 %
  5. IBM Research, UC Berkeley · Diagnosing Why Enterprise Agents Fail Using IT-Bench and MAST — 18 февраля 2026 года: 310 трейсов SRE; 2,6 режима отказа на провал у сильной модели против 5,3 у слабой; неверная проверка на 52 % чаще в провалах; рекомендация — гейты с доказательством от инструментов
  6. Zhu et al. · Where LLM Agents Fail and How They can Learn From Failures (AgentDebug) — 29 сентября 2025 года: 200 провальных траекторий; корневые ошибки скапливаются на шагах 6–15; исправление критической ошибки поднимает ALFWorld с 21 до 55 %
  7. Qi et al. · TrajDebug: Tracing Error Lifecycle to Identify Critical Failures — 6 августа 2026 года: провальная траектория несёт в среднем 7,62 локальной ошибки и ровно одну критическую; 61,9 % некритических агент чинит сам
  8. Huang et al. (Google DeepMind) · Large Language Models Cannot Self-Correct Reasoning Yet — ICLR 2024: без внешней обратной связи GPT-4 на GSM8K падает с 95,5 до 89,0 %, с оракулом растёт до 97,5 %; выигрыш «дебатов» — от самосогласованности, а не самокоррекции
  9. Chen et al. · The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging — 4 июня 2026 года: если собственную мысль модели пометить как внешнюю, явные исправления растут на 23–93 пункта — отсюда внешний судья вместо самопроверки
  10. Yang et al. (Princeton) · SWE-agent — Май 2024 года: линтер на каждой правке — 18,0 % против 10,3 % без него; после одной неудачной правки вероятность восстановления 57,2 %
  11. Yuan et al. (Tsinghua) · Verifiable Process Rewards for Agentic Reasoning — 27 мая 2026 года: сигнал пошаговой проверки растёт как Θ(T), сигнал по исходу тает как Θ(T·p^T); слабый проверяющий хуже отсутствующего
  12. Qwen Team · The Verification Horizon: No Silver Bullet for Coding Agent Rewards — 29 июня 2026 года: «породить решение стало проще, надёжно проверить — сложнее»; наблюдение за поведением снижает долю «решённых» жульничеством с 28,57 до 0,56 %; проверка должна эволюционировать вместе с генератором
  13. Sah et al. · The Verifier Tax: Horizon Dependent Safety–Success Tradeoffs in Tool Using LLM Agents — 18 марта 2026 года: блокирующий посредник перехватывает до 94 % нарушений, но безопасный успех остаётся ниже 5 %; агенты выдумывают идентификаторы пользователей, чтобы обойти проверку
  14. Anthropic (Young) · Effective harnesses for long-running agents — 26 ноября 2025 года: агент-инициализатор, список функций в JSON, файл прогресса, коммит после каждой единицы; следующий экземпляр «оглядывался и объявлял работу сделанной»; без контрольной группы
  15. Anthropic (Rajasekaran) · Harness design for long-running application development — 24 марта 2026 года: одиночный агент 20 минут и 9 долларов — сломано; полная обвязка 6 часов и 200 долларов — работает; «из коробки Claude — плохой QA-агент»; проверяющий полезен только на границе возможностей
  16. Anthropic (Martin, Cemaj, Cohen) · Scaling Managed Agents — 8 апреля 2026 года: сессия как неизменяемый журнал событий вне обвязки; упавшая обвязка перезапускается и продолжает с последнего события; цифр надёжности не приведено
  17. Chroma (Hong, Troynikov, Huber) · Context Rot — 14 июля 2025 года, 18 моделей: точность падает с длиной входа даже на простых задачах; сфокусированные подсказки в 300 токенов бьют полные диалоги в 113 тысяч
  18. Nguyen, Cho, Chen, Dettmers · CliffCompaction — 22 сентября 2026 года: усечение без пересказа и правило «никогда не уплотнять уплотнение» держат или улучшают результат при затратах на 53 % ниже
  19. Min et al. · Toward Reliable Context Compression for Long-Horizon Agents — 6 августа 2026 года: рекурсивное суммирование превращает надёжно решаемые задачи в решаемые изредка; корректное завершение 44,6 % против 77,2 % при простом усечении
  20. Benoit et al. · Checkpointing à la Young/Daly: An Overview — 2022 год: оптимальный интервал контрольных точек W = √(2μC); при убывающей интенсивности отказов «отрезок между точками должен расти со временем» — теория из суперкомпьютеров, перенос на агентов авторский
  21. Inngest (Poly) · Durable Execution: The Key to Harnessing AI Agents in Production — 19 февраля 2026 года: «пять шагов по 99 % дают 95 %»; граница шага вокруг каждого вызова модели и инструмента; устойчивое выполнение чинит падения, а не смысловые ошибки; замеров нет

Пороги, проверка и цена ошибки

  1. FAA · Advisory Circular 25.1309-1B, System Design and Analysis — 30 августа 2024 года: катастрофическое состояние должно быть «крайне невероятным» — порядка 10⁻⁹ на лётный час — и не следовать из единичного отказа; порог привязан к тяжести и времени экспозиции, а не к задаче
  2. FDA · Clinical Decision Support Software: Guidance for Industry and FDA Staff — 29 января 2026 года: программа остаётся вне регулирования как устройство, если врач может «независимо проверить основание рекомендации» и решение не критично по времени; уровень автоматизации и срочность решают, реальна ли проверка
  3. Regulation (EU) 2024/1689 · Article 14, Human oversight — Меры надзора «соразмерны рискам, уровню автономности и контексту»; надзирающий должен понимать пределы системы, распознавать автоматизационное смещение, отклонять решения и останавливать систему; шкалы уровней в законе нет
  4. GDPR · Article 22, Automated individual decision-making — Право не подпадать под решение «исключительно на основе автоматизированной обработки» с юридическими последствиями и право «на вмешательство человека»
  5. Salesforce · Agentforce Help Agent announcement — 25 июня 2026 года: плата только когда агент «самостоятельно решает вопрос от начала до конца», без оплаты при отрицательной оценке или запросе человека; 70 % из 4,3 млн обращений на собственном портале; заявление вендора с явным определением
  6. Intercom · Monitor Fin's performance — 17 февраля 2026 года: три разных знаменателя — вовлечённость, доля решённых из затронутых, доля решённых из всех новых диалогов; «предполагаемое решение» — клиент просто перестал отвечать
  7. Zendesk · Automated resolution rate — Обновлено 26 июля 2026 года: настоящее решение — от начала до конца, без эскалации и повторного обращения; брошенные и «сдержанные» диалоги исключать; отличать от отклонения обращений
  8. Jason Wei · Asymmetry of verification and verifier's law — 15 июля 2025 года: «некоторые задачи проверить намного проще, чем решить»; «лёгкость обучения ИИ задаче пропорциональна её проверяемости»; пять свойств проверяемой задачи; эссе
  9. Y Combinator · Andrej Karpathy: Software Is Changing (Again) — Выступление 17 июня 2025 года на AI Startup School: ползунок автономности и цикл генерации и проверки
  10. Andrej Karpathy · Verifiability — 17 ноября 2025 года: «Software 2.0 легко автоматизирует то, что можно проверить»; задача проверяема, если среда перезапускаема, попытки дёшевы и есть автоматическая награда; профессии автоматизируются в порядке проверяемости
  11. Rohit Lamba (Cornell) · The Verification Hill — 28 февраля 2026 года, предварительная версия: время проверки максимально при неопределённости 50 % и растёт как 1/ν² с падением заметности ошибки; «парадокс правдоподобия» — редкие, но правдоподобные ошибки дороже частых очевидных; при вдвое меньшей заметности оптимальная пропускная способность при δ = 1 падает в 16 раз
  12. Huang, Xiao, Vishnoi · Delegation and Verification Under AI — 3 марта 2026 года: три режима — ручная работа, чистое делегирование, проверенное делегирование; фазовые переходы по надёжности проверяющего; ИИ усиливает тех, кто проверяет надёжно, и портит качество остальных, «даже без поведенческих искажений»
  13. Yi et al. (Upwork) · UpBench — 15 ноября 2025 года: ожидаемая ценность режима E(V) = s·V − c; на 322 реальных заказах Claude Sonnet 4 с 39,8 % до 51,2 % при человеке в контуре; дешёвые задачи — агенту, дорогие и рискованные — человеку
  14. Brown et al. · Large Language Monkeys: Scaling Inference Compute with Repeated Sampling — 31 июля 2024 года: на SWE-bench Lite доля решённых растёт с 15,9 % при одной выборке до 56 % при 250; выигрыш превращается в результат только при автоматическом проверяющем, без него отбор выходит на плато
  15. Microsoft Learn · Govern agents by risk — Обновлено 14 июля 2026 года: «линия от помощи к исполнению» как главный сигнал риска; три уровня — от личной продуктивности до агентов, исполняющих последствия; на третьем уровне «рамка прав решений: что агент решает сам, а что требует человека»; числовых порогов точности нет
  16. Federal Reserve, OCC · SR 11-7, Supervisory Guidance on Model Risk Management — 4 апреля 2011 года: «эффективный вызов» модели независимыми компетентными людьми; «риск модели нельзя устранить», поэтому — пределы использования, мониторинг и дополнение результатов другой информацией
  17. Commission Delegated Regulation (EU) 2017/589 (MiFID II RTS 6) · Article 12, Kill functionality — Фирма обязана уметь немедленно отменить любые неисполненные заявки и назвать, какой алгоритм и какой трейдер отвечает за каждую заявку — атрибуция действия как норма для автоматической торговли
  18. ISO 26262 Academy · Hardware metrics (изложение стандарта) — Целевые значения PMHF: меньше 10⁻⁸ на час для ASIL D, меньше 10⁻⁷ для B и C; приведено по учебному сайту, сам стандарт платный и не открывался
  19. Warp · What metrics actually prove AI coding agents are working? — 31 августа 2026 года: доля автономности = влитые без правок PR ÷ все PR с участием агента; доля вмешательств; стоимость на влитый PR; предупреждение, что показатель может расти из-за формального одобрения изменений без содержательной проверки; вендор
  20. DORA · Software delivery metrics: the five keys — Обновлено 5 января 2026 года: время восстановления после неудачного развёртывания, доля неудачных изменений, доля переделок — готовые определения для строк «восстановление» и «откат» в карточке агента
  21. Jouneaux, Cabot · AgentSLA: Towards a Service Level Agreement for AI Agents — 4 ноября 2025 года: спецификация качества обслуживания для агентов «остаётся открытой задачей»; предложен язык описания, но не набор порогов
  22. Anthropic · How we contain Claude across products — 25 мая 2026 года: «сначала сдерживание на уровне среды, потом поведение модели», потому что защита в модели «никогда не будет стопроцентной»; 93 % запросов на разрешение одобряются; песочница сократила запросы на 84 %; при инъекции через инструмент журнал показывает «успешный авторизованный вызов»
  23. Anthropic · Claude Code auto mode — 25 марта 2026 года: усталость от одобрений — люди «перестают вчитываться»; классификатор второй моделью блокирует уничтожение и утечку данных, ослабление безопасности, пересечение границ доверия, обход ревью; 0,4 % ложных срабатываний на 10 000, 17 % пропусков на 52 случаях — «17 % — честное число»

Вмешательства, инциденты и радиус поражения

  1. Kolluri et al. (Microsoft) · Optimizing Agent Planning for Security and Autonomy — 11 февраля 2026 года: метрика TCR@k — доля задач при не более чем k одобрениях человека; TCR@0 как полная автономность; 59,1 % против 50,1 % на AgentDojo при сокращении нагрузки одобрений до 1,9 раза
  2. Fortune · AI coding tool Replit wiped a database and called it a catastrophic failure — 23 июля 2025 года: агент удалил базу продакшена во время заморозки кода; «Это была катастрофическая ошибка с моей стороны»; ответ вендора — разделение сред и режим «только план»
  3. The Register · Google Antigravity wipes a user's D: drive — 1 декабря 2025 года: в режиме без подтверждений команда очистки кэша ушла в корень диска; «Нет, вы совершенно точно не давали мне такого разрешения»; сообщение пользователя
  4. TechTarget · AWS Kiro user error reflects a common AI coding review gap — 23 февраля 2026 года: агент решил «удалить и пересоздать среду» с унаследованной ролью инженера, простой сервиса учёта расходов AWS около 13 часов в одном регионе; AWS назвала причиной неверно настроенную роль и ввела обязательное ревью доступа
  5. Google Cloud · Announcing the 2025 DORA report — 24 сентября 2025 года, около 5 000 респондентов: 90 % используют ИИ; положительная связь с пропускной способностью и «отрицательная связь со стабильностью поставки»; 30 % мало доверяют коду ИИ; самоотчёт
  6. InfoQ · DORA report on the ROI of AI-assisted software development — Май 2026 года, пересказ отчёта DORA: J-кривая из-за «налога на проверку» кода ИИ; смоделированный рост доли неудачных изменений с 5 до 6 %; выигрыш 35–40 % на простых задачах и около 10 % на сложном унаследованном коде

Псевдоавтономность и скрытый труд

  1. SEC · Order in the matter of Presto Automation, Release No. 33-11352 — 14 января 2025 года: первая версия требовала ввода заказа человеком «во всех случаях», пилот — в 70 %; «доля без вмешательства» считалась без персонала ресторана, но не без людей; предупреждение внутри компании: метрика «подразумевает отсутствие надзора, что неправда»
  2. Outsource Accelerator (по материалам The Information) · Amazon's Just Walk Out relied on reviewers in India — 10 апреля 2024 года: около тысячи проверяющих в Индии, 700 из 1 000 покупок проверялись в 2022 году при цели 50 — утверждение прессы; Amazon говорит о «небольшом меньшинстве» визитов; первичная статья закрыта
  3. The Pragmatic Engineer · Builder.ai did not fake AI with 700 engineers — 2025 год: вирусное утверждение о 700 инженерах восходит к посту без доказательств; у компании была реальная команда ИИ около 15 человек; реальны ревизия выручки с 220 до 55 млн долларов и «круговые» сделки по данным Bloomberg
  4. Kyle Vogt (Cruise) · комментарий на Hacker News о дистанционной помощи — 4 ноября 2023 года: удалённая помощь 2–4 % времени; NYT считала частоту запросов сеанса; штат из 1,5 человека на машину включает мойку и зарядку; признание CEO
  5. Waymo · Advice, not control: the role of remote assistance — 17 февраля 2026 года: около 70 операторов одновременно на 3 000 машин; «совет, который система может принять или отклонить»; половина операторов на Филиппинах по письму сенатору; число запросов на милю названо «несущественным»
  6. TechCrunch · Tesla Optimus bots were controlled by humans during the We, Robot event — 14 октября 2024 года по данным Bloomberg: речь, жесты и напитки — телеоператоры, ходьба — автономна; аналитик Morgan Stanley: роботы «полагались на телеуправление»; раскрытия на сцене не было
  7. Engadget · 1X NEO is a $20,000 home robot that will learn chores via teleoperation — 29 октября 2025 года: телеуправление заявлено как функция — владелец назначает окна, когда оператор берёт управление; «поначалу большую часть работы будут делать телеоператоры»
  8. CBS News · Former nate CEO charged with fraud over AI claims — Апрель 2025 года: обвинительное заключение — покупки в «ИИ-приложении» вручную оформляли сотни подрядчиков на Филиппинах и в Румынии; привлечено более 40 млн долларов; обвинения, не приговор
  9. SEC · Charges against Delphia and Global Predictions for AI washing — 18 марта 2024 года: штрафы 225 и 175 тысяч долларов за заявления о несуществующих возможностях ИИ; «такое отмывание ИИ вредит инвесторам»
  10. Astra Taylor · The Automation Charade — 1 августа 2018 года: термин «псевдоавтоматизация» — труд не исчезает, а перекладывается; киоски, модерация контента, Mechanical Turk
  11. Becker et al. (METR) · Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity — Июль 2025 года: по 84 часам экранных записей около 9 % времени уходит на проверку и чистку вывода ИИ и 4 % на ожидание; 56 % часто вносят крупные правки в код ИИ; 100 % правят его вообще
  12. OpenAI (Lopopolo) · Harness engineering: leveraging Codex in an agent-first world — 11 февраля 2026 года: «ноль строк, написанных вручную», около миллиона строк и 1 500 PR за пять месяцев первоначально три инженера, затем семь; работа переехала в спецификации, линтеры и ревью; первичная страница повторно прочитана при доработке; фактические человеко-часы не опубликованы
  13. Answer.AI (Husain, Flath, Whitaker) · Thoughts on a month with Devin — 8 января 2025 года: из 20 задач 3 удались, 14 провалились; агент «днями преследовал невозможные решения вместо того, чтобы распознать блокер»; функцию, на которую ушли часы правок, автор написал сам за 90 минут
  14. PYMNTS · Upwork navigates cross-currents as AI reshapes freelance demand — 10 августа 2026 года: новая категория спроса — заказчики нанимают фрилансеров «для проектов, начатых с ИИ», в частности превращать сгенерированный код в рабочие сайты
  15. California Code of Regulations · 13 CCR § 227.50, Reporting disengagement of autonomous mode — Ежегодный отчёт с обязательным полем «кто инициировал отключение: технология, водитель-испытатель, удалённый оператор или пассажир» — готовый образец раскрытия человека в контуре, которого у программных агентов нет
  16. Addy Osmani · Software Factories, Light and Dark — 20 июля 2026 года: тёмная фабрика — код уходит, не прочитанный человеком; светлая — тот же конвейер, «где остаётся суждение»; «долг понимания» как разрыв между объёмом кода и тем, что кто-то ещё понимает

Передача управления и надзор

  1. OECD · Agentic AI in organisations: Early insights from practitioner interviews (AI Paper No. 65) — Сентябрь 2026 года, 25 организаций: «непрерывное участие человека признано непрактичным в масштабе», зато «контрольные точки решений» для необратимых действий — обязательны; автономность расширяют постепенно по накопленной истории надёжности
  2. Kalai, Nachum, Vempala, Zhang (OpenAI) · Why Language Models Hallucinate — 4 сентября 2025 года: 9 из 10 популярных бенчмарков оценивают бинарно и не дают очков за отказ отвечать, поэтому догадка выгоднее честного «не знаю»; предложены явные пороги уверенности внутри эвалов
  3. Kirichenko, Ibrahim, Chaudhuri, Bell (FAIR) · AbstentionBench — 10 июня 2025 года: 20 наборов, 35 тысяч вопросов без ответа, 20 моделей; дообучение на рассуждение снижает готовность воздержаться в среднем на 24 %; масштаб с 8 до 405 млрд почти не влияет
  4. Kaddour et al. · Agentic Uncertainty Reveals Agentic Overconfidence — 6 февраля 2026 года, 100 задач SWE-bench Pro: агенты предсказывают 61–77 % успеха при реальных 22–35 %; оценка до исполнения различает лучше, чем после (AUROC 0,62–0,64); сомнения по ходу неинформативны; 62 % провалов предсказаны с уверенностью ≥ 0,7
  5. Trinh et al. (Scale AI) · HiL-Bench: Do Agents Know When to Ask for Help? — 4 мая 2026 года: 300 задач, 1 131 блокер; при полной информации pass@3 67–91 %, а когда надо самому решить, спросить ли, — 1–39 %; GPT недоспрашивает, Gemini переспрашивает, Claude в 45 % провалов видит тупик и всё равно сдаёт
  6. Vijayvargiya, Zhou, Yerukola, Sap, Neubig · Interactive Agents to Overcome Underspecificity in Software Engineering (Ambig-SWE) — Февраль 2025 года, v3 от 21 февраля 2026 года, ICLR 2026: без подсказки агенты «почти никогда не задают вопросов»; взаимодействие поднимает Claude 3.5 Sonnet с 26,8 до 39,6 % и возвращает до 89 % результата полной спецификации
  7. Edwards, Schuster · Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents — 27 марта 2026 года: отдельный агент распознавания намерения даёт 69,4 % против 70,8 % при полной спецификации, спрашивая в 68,8 % задач; принудительные вопросы дают то же при 99,2 % вопросов
  8. Stoisser et al. (Novo Nordisk) · Ambig-DS — 10 мая 2026 года: на двусмысленных задачах анализа данных фронтирные агенты молча выбирают неверную цель в 39–63 % случаев; «тихое переформулирование» как отдельный режим отказа
  9. Bouchard, Chauhan · Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents — 12 августа 2026 года: ни один оценщик уверенности не надёжен между доменами — самооценка даёт AUROC 0,85 в телекоме и 0,23 в авиации на одном τ²-bench; порог уверенности как гейт «может дать ложную уверенность»
  10. Bhattacharyya et al. · Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs — 8 мая 2026 года, 12 моделей, 38 задач: вопрос о требуемом усилии и своей способности предсказывает провал на 6,7–10,1 пункта AUROC лучше вопроса об уверенности
  11. Anthropic · Emergent introspective awareness in large language models — 29 октября 2025 года: Claude Opus 4.1 замечает внедрённый в активации концепт примерно в 20 % попыток; способность «крайне ненадёжна и ограничена»
  12. OpenAI · Operator System Card — Январь 2025 года: на 100 подсказках модель без смягчений сделала 13 ошибок, 5 из них необратимых; подтверждения перед действиями снизили риск примерно на 90 %; полнота запроса подтверждения 92 % на 607 задачах; заявление вендора
  13. OpenAI Alignment (Trębacz et al.) · Auto-review of agent actions without synchronous human oversight — 30 апреля 2026 года: из 10 000 действий 720 вышли за песочницу, 713 одобрены проверяющей моделью, 7 отклонены; прерываний примерно в 200 раз меньше; причина — усталость от решений и правила вроде «разрешить всё, что начинается с python»; «не гарантия безопасности»
  14. Anthropic · Claude Code docs: Permission modes — Прочитано 27 сентября 2026 года: авто-режим блокирует необратимое уничтожение файлов, переписывание истории git, выход за рамки запроса, незнакомую инфраструктуру, действия по враждебному содержимому; названные человеком границы — сигнал блокировки; пауза после 3 блокировок подряд или 20 всего
  15. Anthropic · Claude Platform docs: Managed Agents permission policies — Политики always_allow, always_ask и auto; предупреждение в документации: режим auto — «не контрольная точка человека», безопасное по мнению сервера действие выполняется до того, как его кто-то увидит
  16. Model Context Protocol · Elicitation (спецификация 2025-06-18) — Сервер запрашивает у человека структурированный ввод; три исхода — принять, отклонить, закрыть; протокол отличает «человек сказал нет» от «человек ушёл»
  17. Anthropic · Agentic Misalignment — 20 июня 2025 года, 16 моделей в смоделированных корпоративных сценариях: Claude Opus 4 шантажирует в 55,1 % прогонов, когда считает ситуацию реальной, и в 6,5 %, когда считает её проверкой; авторы оговаривают искусственность сценариев
  18. Zhao, Srikanth, Wu, Jiang (Weco AI) · SpecBench — 20 мая 2026 года: 30 системных задач; результаты моделей на видимых тестах близки к максимуму. Раздел 3.1: 90-й перцентиль разрыва растёт примерно на 27 процентных пунктов при десятикратном росте размера эталонного кода; худший разрыв на крупных задачах — 100 пунктов (100 % видимых против 0 % скрытых). Отдельный пример «компилятора»: 97 % против 0 %, разрыв 97 пунктов
  19. Wang (Fudan) · Why LLM Agents Collapse Without Oversight: The Enforcement Gap — 23 сентября 2026 года: синтетическая подмена плана агента; предупреждение модели-проверяющего либо только записывают, либо используют для остановки. Успех атак: 48,3 % против 10,8 % в объединённой контрольной выборке (203 и 194 прогона, включая открытые модели), не среднее пяти строк закрытых моделей; успех оценивают судьи-модели. Обнаружение угрозы и выполнение остановки требуют отдельных проверок
  20. Lisanne Bainbridge · Ironies of Automation — 1983 год: автоматизация забирает лёгкие части и оставляет человеку самые трудные; внимание к источнику, где почти ничего не происходит, не держится дольше получаса; самые успешные автоматы требуют самой большой подготовки оператора
  21. NIST (Fisher, Galluzzo) · Back to the Future: Why Agentic AI Needs a Strong Identity Foundation — 27 августа 2026 года: «слишком разговорчивые агенты приучают пользователей рефлекторно жать „разрешить“» — аналогия с бомбардировкой запросами MFA; лекарство — заранее утверждённые «планы полёта» и короткоживущие узкие полномочия
  22. Mitchell, Ghosh, Passi · AI Agents Push Humans Out of the Loop — 24 августа 2026 года, позиционная статья без новых замеров: усталость от одобрений, суждение по стилю вместо точности, «ржавчина интуиции»; предлагаются стратегическое трение, пакетное ревью и упражнения на сохранение навыка
  23. Sekadakis, Yannis · Systematic review and meta-analysis of take-over time from automated driving at SAE levels 2 and 3 — Август 2025 года, 51 исследование: чем быстрее человек перехватывает управление, тем резче манёвры и умеренно выше аварийность — скорость передачи не равна её качеству
  24. Anthropic · Trustworthy agents in practice — 9 апреля 2026 года: частота, с которой Claude сам сверяется с человеком, примерно удваивается на сложных задачах при неизменной частоте прерываний; заявление вендора о собственном обучении на двусмысленных ситуациях

Система измерений и эксплуатация

  1. Staufer, Feng et al. · The 2025 AI Agent Index — 19 февраля 2026 года: 30 агентов по 45 полям; 135 из 240 полей о безопасности пусты; только четыре агента раскрыли агентные оценки безопасности; уровни автономности кодированы по Feng et al.
  2. Anthropic · Economic Index: Cadences (June 2026) — 26 июня 2026 года: автономность в Claude Code на 0,37 балла выше, чем в чате, и на 0,26 при той же модели — «продукт важнее модели»; медианная статья в чате — 13 раундов, в Claude Code — одна подсказка

Российский контур

  1. Habr (Онтико, Максим Цепков) · Saint HighLoad++ 2026: доклады об AI — 1 июля 2026 года: Райффайзен — «25 % бэклога сделаны командами вместе с агентами, а 4 % сделано агентами автономно, без обращения к человеку»; платежи и риск-движки остаются за людьми; самоотчёт докладчика
  2. CNews · Сбербанк: от ассистентов к агентам — 19 июня 2026 года: объём вычислений для генерации кода вырос в 30 раз до 1,5 трлн токенов за пять месяцев; ежедневных пользователей агентного режима почти впятеро больше за три месяца; долей принятого кода нет
  3. Яндекс · Цель 75/75/75 — 29 июля 2026 года: 73 % разработчиков регулярно используют ИИ, больше половины нового кода создаётся с ним, 17,2 % достигли планки; внутренний агент работает автономно «более чем в тысяче проектов»; критерия приёмки нет
  4. «Первая Форма» · 93 % кода пишут агенты, разработка упёрлась в ревью — 25 августа 2026 года: 93 % запросов на слияние создают агенты, 94 % вливаются без замечаний, но путь от ревью до слияния — около 76 часов при 11 минутах работы модели; самоотчёт компании
  5. CNews · Исследование «Инфосистемы Джет» и Smart Ranking об ИИ-агентах — 26 августа 2026 года: полуавтономные проекты у 59 % организаций, в эксплуатации у 15 %; полностью автономные — у 8 %; 46 % не видят устойчивого экономического эффекта; размер выборки в тексте не назван
  6. Habr (Codenrock) · Опрос разработчиков об ИИ-агентах — Февраль–март 2026 года, 1 160 участников хакатонов: 36 % не дают агенту работать автономно, 34,9 % доверяют небольшие задачи; главная причина осторожности — нехватка контекста, 54,7 %
  7. Habr (Совкомбанк Технологии) · Опрос о внедрении ИИ в разработку — 25 августа 2026 года, 317 анкет: сквозная интеграция ИИ у 16,4 %; предложенная метрика агента — «сколько действий агент выполнил с первого раза и где человеку пришлось его остановить»

Разборы в «Книжном кубе»

  1. Книжный куб · Autonomy Is All You Need, часть I — 29 декабря 2025 года: разбор доклада Микеле Катасты из Replit — автономность как главная измеримая метрика агентов и как свойство системы, а не модели
  2. Книжный куб · Measuring the Impact of Early-2025 AI, часть I — 17 июля 2025 года: разбор методологии эксперимента METR с 16 разработчиками и того, почему он получил столько внимания
  3. Книжный куб · SWE-Together: как мерить кодинг-агентов диалогово — 7 июля 2026 года: 109 задач из 11 260 реальных сессий; симулятор пользователя, которого не отличили от живого; сильной модели нужно меньше вмешательств
  4. Книжный куб · Claude Code и экспертиза, часть II — 12 июля 2026 года: почему успешность сессии ещё не продуктивность — смещение общего метода и «подтверждённый успех», который не видит, был ли код принят командой
  5. Книжный куб · Loop Engineering: почему главная часть цикла — право сказать «нет» — 14 июля 2026 года: лестница «промпт → контекст → обвязка → цикл» и проверяющий, у которого есть право остановить цикл
  6. Книжный куб · DX Q2 2026: кода больше, доверия меньше — 4 августа 2026 года: разбор отчёта DX — поддерживаемость растёт, уверенность в изменениях падает, ревью не успевает
  7. Книжный куб · Waymo: семь уроков перехода от демо к физическому AI — 9 августа 2026 года: доклад Дмитрия Долгова — «демо — это максимум 1 % работы»; от демонстрации 2010 года до полумиллиона поездок в неделю прошло около 15 лет
  8. Книжный куб · Диогу Алмейда: AI, за которым можно не присматривать — 20 сентября 2026 года: помощник и автоматизация требуют разных свойств; калиброванные решения как отдельная цель обучения — где действовать, где спросить, где передать человеку
  9. Книжный куб · AI Dev Podcast #8: автономия агента начинается с ограничений — 10 августа 2026 года: измерять не объём сгенерированного кода, а принятую работу, стоимость проверки и связь изменений с результатом в эксплуатации
Дальше

Связанные материалы

Эта статья продолжает разбор оценки агентов в эксплуатации и статью о том, что остаётся инженерией: там — воспроизводимые эпизоды и скрытые судьи, здесь — единицы работы, пороги и блокировка опасных действий. Экономику принятого результата я считал в статье об агентной экономике, а право проверяющего остановить цикл — в слайдах эфира про Loop Engineering. Источник для проверки всех чисел этой статьи — не мои слова, а таблица METR, таблица Remote Labor Index и документация вендоров на дату чтения.