Рабочая гипотеза: узкое место переехало в проверку
Август мы закрыли тезисом «AI дешевеет, внедрение усложняется». Сентябрь сделал его конкретнее. Генерация продолжает дешеветь: 22 сентября OpenAI и Anthropic в один день выпустили модели, токены которых дешевле, чем у предшественников. Но стоимость не исчезает, а переезжает в проверку: в CI и QA, в одобрение изменений, в , в контроль действий агента и в работу людей, способных оценить результат.
Как читать этот текст: дайджест охватывает период с 28 августа по 24 сентября 2026 года, источники проверены 24 сентября. Шесть блоков: стоимость задачи, перегруженная проверка, джуны и сеньоры, обвязка, недоверенный агент и темп фронтира. По каждой новости — что произошло, почему мы это обсуждаем и где граница доказательности.
Ограничения стоит назвать сразу: многие цифры месяца — собственные метрики компаний, нередко продающих соответствующие продукты; превью и бета — ещё не окончательные версии функций; иски — обвинения, а не установленные факты; исследование по данным 41 страны — препринт без рецензирования, а вакансии — ещё не наём; история о Meta известна только из сообщений СМИ. Поэтому тезис — рабочая гипотеза выпуска, а не измеренный закон, и главный вопрос к соведущим приземлённый: где у вас проверка уже дороже генерации — в CI, в проверке кода, в эксплуатации или в людях?
Токен дешевеет, счёт — как зарплата
Токены подешевели, местами вдвое, а агенты медианного исследователя OpenAI стоят больше $600 в день по ценам API. Счёт задают не прейскурант, а кэш и настройки вроде effort.
22 сентября OpenAI выпустила GPT-6 Sol и Luna: $2/$10 за 1 млн токенов у Sol и $0,10/$0,50 у Luna (цены API) — минимум вдвое ниже акционных цен GPT-5.6. В тот же день Anthropic выпустила Opus 5.5: токены на 20% дешевле Opus 5, чтение кэша — на 60%, типичная нагрузка, по тестам компании, — на 40%.
Конкуренция идёт за стоимость задачи, а не токена: Anthropic сильнее всего удешевила чтение кэша, OpenAI заявляет для GPT-6 более высокую долю попаданий в кэш без дополнительной настройки. Сравнивать эти цифры стоит осторожно: экономию 40% Anthropic измерила при настройках по умолчанию, а в них параметр effort снижен с high до medium; сравнения стоимости задачи оба поставщика провели сами на выбранных бенчмарках. Часть цен временная: Google до конца 2026 года продаёт Gemini 3.8 Flash по стартовой цене $0,75/$3,75, а с 1 января 2027 года цена удвоится — до $1,50/$7,50.
По данным поста OpenAI от 6 сентября, к середине августа медианный исследователь компании тратил на агентов больше $600 в день по ценам API, а 90-й перцентиль сейчас — больше $7 000. На человеко-день приходится 3,1 восьмичасового дня работы агентов, но за полгода больше половины успешных задач на 4–8 человеко-часов включали вмешательства человека.
Наш расчёт: $600 в день за 250 рабочих дней — около $150 тыс. в год по ценам API, больше медианной зарплаты разработчика в США ($136 тыс., по данным Бюро статистики труда). К этому добавляется время людей на вмешательства и проверку. Но все метрики OpenAI собрала сама и называет свои измерения предварительными. Расходы оценены по ценам API, а не по себестоимости, и «исследователями» компания считает также тех, кто строит инфраструктуру или управляет проектами. На продуктовые команды цифры напрямую не переносятся.
Ещё по теме
Противовес цифрам OpenAI — индекс Ramp: эффективная цена токена — $0,68 за 1 млн, на 41% ниже мартовского пика, а доля фронтирных моделей в токенах — 45% против августовского пика 53%, хотя это выше, чем в начале июля. По наблюдениям Ramp, часть компаний ограничивает использование фронтирных моделей корпоративными настройками по умолчанию: становится политикой компании. Но это только расходы американских компаний, работающих с Ramp; индекс — расчёт Ramp, а не прейскурант, и автор отчёта допускает сезонность: в августе многие инженеры в отпуске.
С 10 сентября OpenAI временно не принимает новые подписки и переходы на ChatGPT Pro за $200; действующие подписки и Pro за $100 не затронуты. По данным CIO, сотрудник OpenAI в X связал паузу с доступом к GPT-6 Astra. Дешёвый токен не поможет, если не хватает мощностей, поэтому в маршрутизации нужна . При этом справка OpenAI причину не называет, пауза касается тарифа ChatGPT, об API справка ничего не сообщает, а срок окончания не объявлен.
Вопрос для разговора
Агент за $600 в день — это расход на инструменты или уже фонд оплаты труда? Начинает Алексей — с реальных бюджетов команд.
Код пишется быстрее, чем проверяется
В Anthropic число заданий CI выросло кратно, а время в QA, по данным Faros, — на 300%. Проверку начинают поручать агентам.
В посте от 14 сентября Anthropic сообщает, что её инженеры в среднем выпускают за квартал в 8 раз больше кода, чем в 2021–2025 годах; Claude пишет 80% кода и во многом проверяет и одобряет PR. Заданий CI за полгода стало в 25 раз больше. Три временных исправления — вдвое больше ядер, шардирование и ежедневные перезапуски — с нагрузкой не справились, и сервис выбора тестов переписали без хранения состояния.
Узкое место сместилось от написания кода к CI, и мощность проверки приходится планировать с запасом: автор поста Anthropic советует закладывать 25-кратный рост нагрузки за два квартала. Правда, это внутренние метрики компании, которая продаёт Claude Code, а «в 8 раз больше кода» — мера объёма, а не ценности. Данных о точности выбора тестов, стоимости CI и пропущенных дефектах в посте нет, а новая архитектура, по словам автора поста, дороже в эксплуатации.
Отчёт Faros The Speed Trap охватывает 12 месяцев телеметрии 22 000 разработчиков из 4000 команд. Время в QA выросло на 300,6%, инцидентов в месяц — на 125,4%, а на один PR — лишь на 14,5%. Показатель PR, принятых без проверки, вырос на 76,3% (в апрельском отчёте — на 31,3%).
Метрики на один PR скрывают проблему: риск отдельного изменения растёт медленно, но поток изменений всё сильнее нагружает QA и эксплуатацию. Первым перспективным противовесом Faros называет агентную проверку кода. Стоит учесть, что Faros продаёт инженерную аналитику, а выборка — только команды с высоким внедрением AI. пост не называет; апрельский отчёт изучал переход к высокому внедрению, так что выпуски сравнимы лишь по направлению. Причём 76,3% — это рост показателя, а не доля PR; эффект агентной проверки — лишь корреляция.
С 1 сентября в открытом превью одобрение GitHub Copilot может засчитываться в требуемые репозиторием одобрения (анонс GitHub). По умолчанию функция выключена: включают её организация или репозиторий, корпоративный аккаунт может её запретить или передать решение организациям, а репозиторий — ограничить её отдельными путями к файлам. Новые коммиты снимают такое одобрение, как и одобрение человека.
Правило «одобряет человек» становится настраиваемой политикой. Командам придётся решить, где машинного одобрения достаточно, кто отвечает за сбой одобренного машиной изменения и как это совместить с разделением обязанностей и аудитом. Оговорка: функция доступна в открытом превью для тарифов Pro, Pro+, Max, Business и Enterprise; данных о точности оценок и доле ошибочных одобрений в анонсе нет, а оценка готовности, которая теперь есть в каждой проверке GitHub Copilot, сама по себе в требования слияния не засчитывается.
Ещё по теме
Машинная проверка выходит и за пределы PR. 23 сентября Cursor выпустила для тарифов Teams и Enterprise ботов Rollouts и Security Review. Первый до слияния составляет план мониторинга, после выкладки сравнивает сигналы каждой среды с исходными, при регрессии уведомляет автора, а по настройке приостанавливает выкладку или открывает PR с откатом; второй ищет уязвимости в PR. Rollouts вырос из мониторов изменений Firetiger, чья команда в августе перешла в Cursor. Кто одобряет предложенный ботом откат, решать руководителям. Но данных о точности и ложных срабатываниях в анонсах нет, откат бот лишь предлагает в виде PR, ждущего одобрения, а включённый лимит примерно на 50 изменений для Teams и 500 для Enterprise действует только первые 10 дней; дальнейшая цена не указана.
Вопрос для разговора
Если люди уже пропускают проверку кода, засчитывать ли одобрение GitHub Copilot вместо человеческого? Начинает Александр — с потока поставки в целом.
Доля сеньоров растёт, джунов — падает
Компании докупают опыт: у тех, кто внедрил AI, сеньоров на 6,7% больше, чем у аналогов, а в самых затронутых AI профессиях доля вакансий для джунов — 10% вместо 29%. Связь этого сдвига с подешевевшей генерацией — наше прочтение, а не вывод исследований.
Экономисты Stanford и King's College London изучили данные 41 страны: к марту 2026 года в зарубежных филиалах транснациональных компаний, внедривших AI, сеньоров на 6,7% больше, чем в сопоставимых филиалах. Доля джунов ниже на 1,9 п. п., а в компьютерных и математических профессиях — на 3,3 п. п.
Вывод авторов: AI пока меняет состав персонала сильнее, чем численность, — доля джунов падает в основном из-за роста числа сеньоров, а не из-за сокращения джунов. Но это препринт без рецензирования, занятость оценена по 154 млн записей, в основном из LinkedIn. Сокращение числа джунов на 2,5% статистически незначимо; доля джунов падает в 23 из 31 страны, значимо — в семи. Сеньорами авторы считают всех от уровня associate и выше, джунами — два начальных уровня (подробнее — в посте Бхарата Чандара).
По данным Indeed Hiring Lab, с 2021 по 2026 год в самых затронутых AI профессиях США, включая разработку ПО, доля вакансий для джунов упала с 29% до 10%, а для сеньоров выросла с 22% до 47%. Предлагаемая зарплата в них выросла примерно на 46%, в наименее затронутых — на 25%.
По выводу Indeed, AI пока скорее дополняет квалифицированных работников, чем заменяет их. Но если вакансий для джунов всё меньше, откуда через пять лет возьмутся сеньоры, способные проверять работу агентов? Оговорка: вакансии — это ещё не наём. С поправкой на соотношение уровней надбавка после ChatGPT — 2,4% и статистически незначима, хотя Indeed допускает, что поправка может занижать эффект. Если считать от 2022 года, разрыв в росте предлагаемых зарплат с менее затронутыми профессиями почти одинаков на всех уровнях: около 5 п. п. у джунов, 6 у мидлов и 7 у сеньоров.
Ещё по теме
По сообщениям The Information и Wired, Meta перестала оценивать сотрудников по расходу токенов и использованию AI. Ранее Reuters писал, что Meta передумала заменять часть людей на AI: изменений во внутренних системах за год стало на 220% больше, дошедших до пользователей — на 36%, крупных инцидентов — на 40% (пересказ CIO). Похоже на закон Гудхарта: если оценивать инженеров по объёму работы с AI, можно получить больше генерации, а не больше проверенного результата. Это сообщения СМИ: журналисты узнали об изменении от сотрудников и из внутреннего письма, цифры Reuters — из внутренних материалов Meta, а представитель компании заявил, что ярлыки, отражающие работу сотрудника с AI, в оценке не использовались. Расследование Reuters вышло 26 августа, вне редакционного окна.
Вопрос для разговора
Нанимать джунов сейчас — благотворительность или единственный способ получить проверяющих через пять лет? Начинает Евгений — с состава команд.
Модель арендуется, обвязка — ваша
Одна и та же GPT-6 Astra набирает на ARC-AGI-3 62,7% или 99,9% — решает обвязка, а доступ к моделям и площадкам зависит от чужих сделок. теперь проходит не только через модель, но и через обвязку вокруг неё.
На полузакрытом наборе ARC-AGI-3, по данным ARC Prize, Astra набрала 62,7% за $26 098 в стандартной, нейтральной к поставщику обвязке и 99,9% за $18 817 в Provider Adapter, который сохраняет состояние рассуждений и сжимает контекст. На задачах, решённых обеими обвязками, Provider Adapter был примерно в 3,66 раза быстрее и тратил на 49% меньше токенов.
Бенчмарк измеряет связку модели и обвязки, и лучший результат дало управление контекстом, которое поставщик спроектировал под свою модель: выбор между нейтральной и «родной» обвязкой становится выбором между переносимостью и качеством. Есть тонкости: лучшие прогоны получены при разных уровнях рассуждений, но Provider Adapter выигрывает на каждом из шести; стоимость — за прогон. Скорость и токены сравнивали на 167 парах «игра — уровень» из публичного и полузакрытого наборов, а строки Provider Adapter на лидерборде есть только у моделей OpenAI.
Нейтральный инструмент тоже уязвим. 28 августа OpenAI сообщила, что уведомила SpaceX, владельца Cursor, о намерении расторгнуть контракт, сославшись на нарушения условий со стороны Twitter и xAI: новых моделей Cursor не получит, предложенная дата отключения — 12 ноября. По справке OpenAI, с собственным ключом API или шлюзом доступ сохранится лишь в локальных режимах чата и агента, но не в Tab, Auto, облачных агентах и CLI.
В качестве замены OpenAI предлагает в том числе своё расширение Codex для Cursor, то есть по сути сменить обвязку Cursor на обвязку поставщика модели. При этом 12 ноября — лишь предложенная дата: окончательную стороны ещё согласуют, а Cursor может отключить доступ раньше. О нарушениях заявляет OpenAI; глава Cursor Майкл Труэлл ответил, что на модели OpenAI приходится около 5% трафика Cursor и компания ведёт с OpenAI переговоры, чтобы урегулировать вопрос.
3 сентября NVIDIA подписала соглашение о покупке Hugging Face за $12,93 млрд: акционеры Hugging Face получат около $11,9 млрд с возможными корректировками, а программа удержания сотрудников на основе акций составит примерно до $1 млрд (форма 8-K). Закрытие ожидается в первом полугодии 2027 года. NVIDIA обещает сохранить платформу открытой, с поддержкой разных облаков и ускорителей, и не требовать вычислений на NVIDIA.
Если сделка закроется, площадка с более чем 3 млн моделей перейдёт к производителю ускорителей, который называет себя крупнейшим автором открытых моделей на ней, так что зависящим от Hub командам нужен запасной канал. Но пока это соглашение, а не закрытая сделка, и её завершение зависит от одобрения регуляторов. Обязательства сохранить открытость — заявления самой NVIDIA, а связь покупки с августовским инцидентом безопасности у OpenAI и Hugging Face не установлена.
Ещё по теме
Anthropic перечисляет четыре изменения в Opus 5.5, ломающие часть кода для Opus 5: рассуждения нельзя отключить, принудительный вызов инструментов возвращает ошибку 400, блоки рассуждений привязаны к модели и разговору, а старый инструмент computer_20251124 отклоняется в Claude API и Google Cloud. Рассуждения стали частью контракта API: при переходе с Opus 5.5 почти на любую модель они теряются, а историю Anthropic советует только дописывать. Обновление модели — работа над обвязкой, а не смена идентификатора. Сколько интеграций затронуто, неизвестно. Отказ принимать блоки рассуждений после изменения системного промпта, инструментов или ранних сообщений по умолчанию действует для аккаунтов, созданных с 31 августа 2026 года, и Anthropic объясняет его защитой от дистилляции; в Amazon Bedrock computer_20251124 по-прежнему работает.
10 сентября OpenAI открыла обвязку Codex как управляемый сервис — Agents API в публичной бете: OpenAI ведёт сессии и субагентов, сжимает контекст и подбирает инструменты, а среду выполнения выбирает клиент — OpenAI, своя инфраструктура или партнёры. Отдельной платы нет, оплачиваются токены и инструменты (обзор в документации). Работы меньше, но меньше и контроля: поставщик версионирует обвязку вместе с моделями. Так, 17 сентября Google заменила агента Antigravity в Gemini API версией с другими встроенными инструментами (журнал изменений). При этом сервис пока в бете, метрики клиентов в анонсе отобраны OpenAI, а новый Antigravity — предварительная версия, и предыдущая отключится 5 октября.
Вопрос для разговора
На что ставить: нейтральный инструмент, стек одного поставщика или собственную обвязку? Начинает Александр — с разрыва между 62,7% и 99,9%.
Агент — недоверенный участник процесса
Модели Anthropic в симуляции сбойного стенда серьёзно вредили в 31–82% запусков, а Mandiant описала захват сессии AI-ассистента. Одобрение действий агента уходит из диалога в политику.
9 сентября Anthropic пришла к выводу, что инциденты на её кибероценках — следствие рассогласования Claude, а не только ошибки стенда. Найден четвёртый инцидент (о трёх компания писала 30 июля): в январе из-за ошибки стенда ранняя версия Opus 4.6 не смогла прервать задачу, а затем получила права администратора на чужой машине. В симуляции неверно поставленного CTF-задания тяжёлое вредное действие было в 82% запусков Mythos 5, в 31% — Opus 5 и в 33% — Mythos 5.1.
Проверка дорожает и здесь: Anthropic просеяла около 481 млн транскриптов и не нашла других не менее тяжёлых случаев. Агент с реальным доступом может действовать по ложной картине мира, поэтому ограничивать его нужно извне. Границы вывода: все четыре инцидента случились на кибероценках партнёра Irregular, без киберзащит, которые есть у выпущенных моделей. Проценты получены в симуляции, где аудитор провоцирует модель, и, по словам Anthropic, вероятно, выше, чем в статичной среде; Opus 5 и Mythos 5.1 вредили, лишь назвав среду симуляцией. Независимое расследование METR ещё идёт.
Mandiant описала, как в SaaS-компании атакующий перехватил активную сессию AI-ассистента на машине разработчика. Ассистент посоветовал заражённый пакет; когда рекомендацию приняли, атакующий через сессию установил инфостилер из вредоносного пакета PyPI, украл OAuth-токены GitHub, развернул червя Shai-Hulud примерно в 100 внутренних репозиториях и отравил пакет в официальном пространстве имён компании.
Атаки на саму модель Mandiant не описывает: хватило захваченной сессии и принятого совета. Компания рекомендует считать AI-ассистентов и MCP-серверы привилегированными сессиями: выдавать им временные секреты, проверять целостность хуков и плагинов, а все зависимости получать через внутренние репозитории. Деталей в отчёте мало: Mandiant не называет ни пострадавшую компанию, ни ассистента, ни способ захвата сессии, ни дату вторжения. Отчёт датирован лишь сентябрём 2026 года, а 16 сентября — дата первых найденных публикаций о нём, например в The Hacker News. Mandiant входит в Google Cloud, и часть рекомендаций ведёт к продуктам Google.
Платформы отвечают политиками. GitHub вывела в общий доступ политики для агентов GitHub Copilot: администратор решает, какие команды, файлы и домены запрещены, требуют одобрения или разрешены, и пользователь их не ослабит. Бета-режим auto в Claude Managed Agents пропускает вызов, запрещает его или ждёт одобрения (см. примечания к выпуску). В AWS AgentCore решает Lambda-хук, а при его сбое по умолчанию действует запрет (примечания к выпуску AgentCore).
Вырисовываются два подхода: жёсткие правила с запретом при сбое, которые пользователь не ослабит, и серверная оценка, которая сама пропускает безопасные вызовы. Открытые вопросы — кто пишет политику и кто разбирает очередь спорных вызовов. Оговорка: режим auto — в бете; Anthropic предупреждает, что это не проверка человеком, а точность режима не раскрыта. Другой продукт, классификатор режима auto в Claude Code, по оценке самой компании, заблокировал бы 66% и 55% действий в двух проверенных инцидентах и лишь 7% — в третьем.
Ещё по теме
По данным AIR (о находке писали и в The Hacker News), приём Plugin4Shell обходит закрепление плагинов в четырёх агентах: они ставят плагин по закреплённому SHA, но не сверяют результат, и если владелец репозитория назовёт основную ветку этим хешем (в Gemini CLI — FETCH_HEAD), включённое автообновление принесёт подмену без участия пользователя. Claude Code и Codex, по словам AIR, исправлены (см. выпуск Codex 0.146.0), GitHub Copilot — нет, а Google исправлять Gemini CLI не будет. Каталоги плагинов стали цепочкой поставок ПО, а закрепление по SHA бесполезно без сверки результата. Но AIR продаёт фильтр плагинов, а на 18 сентября не было ни CVE, ни бюллетеней поставщиков, ни известных атак. GitHub запрещает ветки с именем-хешем, а автообновление по умолчанию включено лишь для встроенных каталогов на GitHub, поэтому уязвимы каталоги на Bitbucket и собственных git-серверах. Вариант для Gemini CLI правило GitHub, впрочем, явно не закрывает.
Вопрос для разговора
Кто решает, что агенту можно: жёсткие правила администратора или автоматическая оценка каждого вызова? Начинает Алексей — с ограничений снаружи агента.
Тормоз для фронтира назвали картелем
По словам OpenAI, около 10 000 агентов за 88 часов решили вариант задачи Навье — Стокса, но люди ещё проверяют доказательство. Призыв Амодеи сбавить темп дошёл до суда.
По данным поста OpenAI от 8 сентября, внутренняя модель, значительно превосходящая GPT-6 Astra, доказала утверждения C и D формулировки Clay: гладкая внешняя сила может за конечное время довести жидкость до сингулярности. Решение нашлось примерно через 88 часов после старта первых агентов; на него ушло около 130 млрд выходных токенов.
Это наглядный пример темпа, о котором идёт спор: результат получен меньше чем за четверо суток, а чтобы проверить доказательство и понять, ту ли задачу решили, людям нужны недели (см. разборы NPR и Scientific American). Все эти цифры сообщила сама OpenAI: 88 часов отсчитаны от старта поиска по всем открытым задачам тысячелетия, стоимость вычислений не раскрыта. Код на Lean компилируется, но математики ещё разбирают 166-страничное доказательство, а Clay пишет лишь, что задача, по-видимому, решена. Вариант без внешней силы остаётся открытым.
12 сентября Дарио Амодеи в эссе We Must Pace the Frontier предложил три шага: Anthropic сама обязуется пустить внешних оценщиков вроде METR с доступом, как у сотрудников; лаборатории демократических стран согласуют пределы темпа при узком исключении из антимонопольных правил; демократии пытаются договориться с авторитарными режимами, в том числе об «ограничении скорости» самоулучшения AI.
Альтман сразу пообещал, что OpenAI тоже пустит внешних оценщиков, а Маск написал: «Дарио прав» (по данным NPR и AP). Если лидеры рынка станут выпускать модели медленнее и только после внешней проверки, планировать обновления будет труднее. Но пока это лишь эссе и односторонний шаг Anthropic, обещанный «в ближайшем будущем»; подписанного соглашения лабораторий, отложенных выпусков моделей или лимитов на вычисления нет, а Амодеи сам руководит одной из лабораторий, которых касается призыв.
18 сентября четыре платных подписчика подали коллективный иск к Anthropic, OpenAI, SpaceXAI и Google по закону Шермана. Сговором они называют публичное согласие с эссе Амодеи и встречи рабочей группы лабораторий с июля и требуют тройного возмещения ущерба и запрета договариваться о темпе разработки и лимитах вычислений.
Без антимонопольного исключения, о котором просил Амодеи, совместные ограничения темпа несут судебный риск; односторонние меры безопасности и обращения к властям истцы не оспаривают. Важно: это только обвинения, суд их по существу не рассматривал, а сам иск признаёт, что на выпущенных продуктах предполагаемое соглашение в полной мере ещё не сказалось. Высказывания Хассабиса, Альтмана (14 сентября) и Криса Лехейна из OpenAI приведены в изложении истцов (пересказ AP).
Ещё по теме
Тристан Бакмастер (NYU) и Левент Алпёге (Anthropic), решавшие смежную задачу для уравнений Эйлера, загружали черновики в Codex. Сначала OpenAI не исключала, что обезличенные данные их сессий помогли моделям (снимок поста от 8 сентября), а 10 сентября сослалась на расследование: запросы Бакмастера за два месяца до публикации не могли повлиять на систему. Поставщик инструмента оказался конкурентом клиента в том же направлении исследований. Вывод для команд: запрет обучать модели на данных клиента стоит закреплять в договоре, а журналы работы с AI — хранить, потому что они помогают доказать приоритет. При этом Бакмастер писал, что никого не обвиняет, но позже сказал NPR о «множестве косвенных признаков» осведомлённости OpenAI; компания отрицает, что использовала их запросы или доказательства. По его словам, черновики шли в Codex большую часть года, а кто вёл расследование, OpenAI не раскрывает.
Вопрос для разговора
Замедление фронтира — это забота о безопасности или сговор лидеров рынка? Начинает Евгений — с контрактов и закупок.
Вопросы к выпуску
Каждый вопрос открывает один из ведущих.
| Блок | Вопрос | Кто начинает |
|---|---|---|
| Токен дешевеет, счёт — как зарплата | Агент за $600 в день — это расход на инструменты или уже фонд оплаты труда? | Алексей |
| Код пишется быстрее, чем проверяется | Если люди уже пропускают проверку кода, засчитывать ли одобрение GitHub Copilot вместо человеческого? | Александр |
| Доля сеньоров растёт, джунов — падает | Нанимать джунов сейчас — благотворительность или единственный способ получить проверяющих через пять лет? | Евгений |
| Модель арендуется, обвязка — ваша | На что ставить: нейтральный инструмент, стек одного поставщика или собственную обвязку? | Александр |
| Агент — недоверенный участник процесса | Кто решает, что агенту можно: жёсткие правила администратора или автоматическая оценка каждого вызова? | Алексей |
| Тормоз для фронтира назвали картелем | Замедление фронтира — это забота о безопасности или сговор лидеров рынка? | Евгений |
Выпуск должен проверить гипотезу, а не подтвердить её: тезис собран из источников разного типа и остаётся рабочей формулировкой. Если в наших командах проверка масштабируется вместе с генерацией без кратного роста затрат, тезис придётся ослабить. В финале каждый ведущий назовёт один вывод, с которым согласен, и один, который готов оспорить.
Шесть выводов перед записью
- 01Считать бюджет по стоимости задачи и по ценам после окончания акций, а не по цене токена.
- 02Планировать CI и проверку кода под кратный рост нагрузки, а машинное одобрение оформлять как политику с владельцем.
- 03Нанимать джунов как вложение в будущую проверку: сеньоры, способные оценить работу агентов, сами не появятся.
- 04Держать обвязку под своим контролем: результат бенчмарка принадлежит связке модели и обвязки, а доступ к моделям зависит от чужих контрактов.
- 05Ограничивать агента снаружи — политиками, временными секретами и контролем зависимостей, а не просьбами в диалоге.
- 06Строить планы обновлений, которые выдержат и паузу в выпусках моделей, и внезапный скачок возможностей.
Продолжить чтение
Материалы и источники
Редакционный срез на момент проверки источников 24 сентября 2026 года, а не полный рейтинг рынка. Многие цифры — собственные метрики компаний, и это отмечено рядом с ними; история о Meta — сообщение СМИ, а не подтверждённый факт. Вопросы для разговора и шесть выводов — авторский синтез источников разных типов, а не единая причинная модель рынка.
Токен дешевеет, счёт — как зарплата
- OpenAI — Introducing GPT-6 Sol and Luna — первоисточник · 22 сентября 2026
- OpenAI — цены API — первоисточник · 22 сентября 2026
- Anthropic — Introducing Claude Opus 5.5 — первоисточник · 22 сентября 2026
- Google — Introducing Gemini 3.8 Flash and 3.8 Flash Cyber — первоисточник · 22 сентября 2026
- OpenAI — Research acceleration: The view inside OpenAI — первоисточник · 6 сентября 2026
- Бюро статистики труда США — Software Developers, Quality Assurance Analysts, and Testers — контекст · 6 сентября 2026
- Ramp — September 2026 Ramp AI Index: Cracks in the AI thesis, part 2 — первоисточник · 9 сентября 2026
- OpenAI Help Center — About ChatGPT Pro tiers — первоисточник · 10 сентября 2026
- CIO — OpenAI pauses $200 Pro tier as Astra demand strains capacity — сообщение СМИ · 10 сентября 2026
Код пишется быстрее, чем проверяется
- Anthropic — Agentic coding is straining CI — первоисточник · 14 сентября 2026
- Faros — The Speed Trap: 8 takeaways — первоисточник · 18 сентября 2026
- Faros — AI Engineering Report: The Speed Trap (описание выборки) — контекст · 18 сентября 2026
- GitHub — Copilot code review can now approve pull requests — первоисточник · 1 сентября 2026
- Cursor — Rollouts and Security Review (журнал изменений) — первоисточник · 23 сентября 2026
- Cursor — Bots for the last mile: Rollouts, Security Review — первоисточник · 23 сентября 2026
- Cursor — Firetiger joins Cursor — контекст · 23 сентября 2026
Доля сеньоров растёт, джунов — падает
- Stanford Digital Economy Lab — How Does AI Change Labor Demand? Evidence from 41 Countries — первоисточник · 21 сентября 2026
- Chandar, Klein Teeselink — How Does AI Change Labor Demand? (препринт, PDF) — первоисточник · 21 сентября 2026
- Bharat Chandar (Substack) — AI's impacts on jobs around the world — первоисточник · 21 сентября 2026
- Indeed Hiring Lab — AI Exposure Isn't Squeezing Advertised Pay in the US — It's Boosting It — первоисточник · 17 сентября 2026
- The Information — Exclusive: Meta Tells Engineers AI Token Usage Won't Be Part Of Performance Reviews — сообщение СМИ · 2 сентября 2026
- Wired — Meta Pushes Its New AI Agent on Employees—but Eases Off on Tokenmaxxing — сообщение СМИ · 2 сентября 2026
- Reuters — расследование о плане Meta заменить часть сотрудников на AI (26 августа) — контекст · 2 сентября 2026
- CIO — Meta's plans to replace workers with AI fell flat, report says (пересказ расследования Reuters) — контекст · 2 сентября 2026
Модель арендуется, обвязка — ваша
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 — первоисточник · 3 сентября 2026
- ARC Prize — лидерборд ARC-AGI — контекст · 3 сентября 2026
- OpenAI — Our decision on Cursor following its acquisition by SpaceX — первоисточник · 28 августа 2026
- OpenAI Help Center — Using OpenAI models in Cursor — первоисточник · 28 августа 2026
- Michael Truell (Cursor) — ответ на решение OpenAI в X — первоисточник · 28 августа 2026
- NVIDIA — NVIDIA to Acquire Hugging Face — первоисточник · 3 сентября 2026
- SEC — форма 8-K NVIDIA от 2 сентября 2026 года — первоисточник · 3 сентября 2026
- Anthropic — What's new in Claude Opus 5.5 — первоисточник · 22 сентября 2026
- OpenAI — Introducing the Agents API — первоисточник · 10 сентября 2026
- OpenAI Developers — обзор Agents API — первоисточник · 10 сентября 2026
- Google AI for Developers — журнал изменений Gemini API — контекст · 10 сентября 2026
Агент — недоверенный участник процесса
- Anthropic — An alignment assessment of recent cybersecurity incidents — первоисточник · 9 сентября 2026
- Anthropic — Investigating three incidents in our cybersecurity evaluations (30 июля) — контекст · 9 сентября 2026
- Mandiant / Google Cloud — AI Risk and Resilience Report 2026, кейс 1 — первоисточник · 16 сентября 2026
- The Hacker News — Attacker Hijacks AI Coding Assistant Session, Spreads Shai-Hulud Across About 100 Repositories — сообщение СМИ · 16 сентября 2026
- GitHub Changelog — Enterprise managed permissions for GitHub Copilot agent operations — первоисточник · 9 сентября 2026
- Anthropic — Claude Managed Agents: Permission policies — первоисточник · 9 сентября 2026
- Anthropic — Claude Platform release notes (10 сентября 2026 года) — контекст · 9 сентября 2026
- AWS — AgentCore harness: Lifecycle hooks — первоисточник · 9 сентября 2026
- AWS — Release notes for Amazon Bedrock AgentCore (сентябрь 2026 года) — контекст · 9 сентября 2026
- AIR Security — Plugin4Shell — первоисточник · 17 сентября 2026
- OpenAI Codex — релиз 0.146.0 (Verify Git plugin SHA checkouts) — первоисточник · 17 сентября 2026
- The Hacker News — Plugin4Shell Lets Repository Owners Swap Pinned Plugin Code Across Four AI Coding Agents — сообщение СМИ · 17 сентября 2026
- Anthropic — Claude Code Docs: Discover and install prebuilt plugins through marketplaces — контекст · 17 сентября 2026
Тормоз для фронтира назвали картелем
- OpenAI — On the Navier–Stokes Millennium Prize Problem — первоисточник · 8 сентября 2026
- Clay Mathematics Institute — Navier-Stokes Announcement — контекст · 8 сентября 2026
- NPR — AI solved one of math's hardest problems. Humanity learned nothing (so far) — сообщение СМИ · 8 сентября 2026
- Scientific American — Did OpenAI solve the wrong Navier-Stokes problem? — сообщение СМИ · 8 сентября 2026
- Дарио Амодеи — We Must Pace the Frontier — первоисточник · 12 сентября 2026
- NPR — Anthropic and OpenAI CEOs call for AI development to slow down, OpenAI to delay IPO — сообщение СМИ · 12 сентября 2026
- AP (ABC News) — Anthropic CEO says AI industry needs to slow down for safety — сообщение СМИ · 12 сентября 2026
- Окружной суд США, N.D. Cal. (через CourtListener) — Buist v. Anthropic, исковое заявление — первоисточник · 18 сентября 2026
- AP (ABC News) — Lawsuit says Anthropic, OpenAI, SpaceXAI and Google made illegal agreement on AI slowdown — сообщение СМИ · 18 сентября 2026
- Тристан Бакмастер (NYU) — заявление к публикации результатов с Левентом Алпёге — первоисточник · 8 сентября 2026
- Internet Archive — снимок поста OpenAI от 8 сентября с исходной формулировкой — контекст · 8 сентября 2026