«Сквозной» — это не про предобучение, а про то, какой контур действительно замыкается
Начать стоит с вычёркивания. Слово «сквозной» обычно тянет за собой картинку полной вертикали от кремния до продукта, и именно эта картинка делает разговор бессмысленным. Публичная запись довольно скупа: в списке TOP500 за июнь 2026 года у России пять систем совокупно примерно на 69 PFlop/s — это машины поколений V100 и A100. Важно правильно прочитать это молчание: оно означает отсутствие публично измеренного кластера национального масштаба на более новых ускорителях, а не отсутствие таких ускорителей в стране.
Ещё скупее запись о том, на чём в России реально обучают. Единственные подробные раскрытия оборудования — это 96 ускорителей A100 для модели на 8 млрд параметров в 2024 году и четыре узла по восемь H100 на этапы SFT и DPO в рецепте T-pro 2.0. Оба числа описывают дообучение, а не предобучение. Семейство GigaChat обучено с нуля, но вычисления обучения не раскрыты ни для одной версии, поэтому соотношение «вычисления к качеству» посчитать невозможно.
Если убрать предобучение, остаётся вполне рабочий контур: открытая база → пост-тренинг → обвязка и инструменты → оценки и среды → трейсы → и снова пост-тренинг. Пять его звеньев локальны. Шестое — чужой релиз открытых весов, и это зависимость, о которой ниже будет отдельный разговор. Ограничение по железу при этом бьёт не по достижимому качеству, а по числу проходов: единственный проверенный опубликованный российский прайс-лист даёт цену примерно втрое выше медианы нишевых зарубежных провайдеров и примерно в полтора раза выше прайс-листа крупного гиперскейлера. Втрое дороже эксперимент — это налог на количество итераций.
Класс доказательства для каждого числа
В этой теме половина публичных чисел — маркетинг, поэтому дальше каждое число стоит мысленно относить к одной из трёх колонок.
| Класс | Что сюда попадает | Что с этим делать |
|---|---|---|
| Первичный источник | Рецензированные работы, отчёты с раскрытыми числами, тексты лицензий, официальные тарифы и списки TOP500 | Можно строить вывод |
| Заявление поставщика | Показатели из собственных блогов и карточек моделей: ускорения, MFU, доли принятого кода, прирост производительности | Годится как направление, не как измерение |
| Сообщение по источникам | Публикации агентств и отраслевой прессы со ссылкой на неназванные источники: закупки, сроки, планы | Только как снимок рынка |
Доктрина расходования вычислений важнее их количества
Самое полезное число во всей теме компания DeepSeek опубликовала о себе сама. В отчёте по V3 таблица затрат выглядит так: предобучение — 2 664 тыс. GPU-часов, расширение контекста — 119 тыс., пост-тренинг — 5 тыс. Внутри одной модели соотношение примерно 500 к 1. Это самоотчёт, он описывает только финальный прогон и не включает предшествующие исследования и неудачные запуски. Но планировать надо именно по соотношению, а не по сумме: если вы не можете оплатить первую колонку, вся поверхность вашего продукта решается в третьей.
Дальше это подтверждается с двух сторон. В рецензированной работе о DeepSeek-R1 обучение с подкреплением поднимает результат на AIME 2024 с 15,6% до 77,9% — поверх уже существующей базовой модели и за долю её стоимости (сама база в эту стоимость не входит, и это надо произносить вслух). А в феврале 2026 года Cursor сообщил, что вычисления пост-тренинга Composer 1.5 превысили вычисления предобучения базовой модели. Инверсия стала явной.
Одновременно вход в предобучение дорожает: по оценке Epoch AI стоимость финального прогона растёт примерно в 2,4 раза в год. Это кривая, которая структурно исключает игрока без капитала уровня гиперскейлера — не потому, что он хуже, а потому, что билет дорожает быстрее любого правдоподобного роста закупок. Зато обучение с подкреплением перестало быть ремеслом: работа о масштабировании вычислений RL строит сигмоидные кривые и предсказывает результат прогона на 100 тыс. GPU-часов. Это превращает RL в планируемую статью бюджета.
Самая дешёвая победа при этом лежит не в обучении, а в токенизаторе. В рецепте T-pro 2.0 замена 34 тыс. низкочастотных нецирилличных токенов на кириллические при неизменном размере словаря снижает число токенов на слово с 3,12 до 2,38, а доля русских слов, укладывающихся в два токена, растёт с 38,2% до 60,1%. Это примерно четверть вычислений на одном и том же русском тексте — и на обучении, и на . Скидка выдаётся ровно в той валюте, которой не хватает.
приоритет 1 — обслуживание · приоритет 2 — пост-тренинг и среды · приоритет 3 — токенизатор и данные · предобучение с нуля — только для того, кто уже показал прогон на десятках триллионов токенов
Архитектуру обучения выбирают по объёму обмена, а не только по качеству
Канонический пример того, как дефицит сети переезжает в архитектуру модели, снова даёт DeepSeek. В отдельной работе они описывают, что урезанная вдвое пропускная способность межускорительной шины была скомпенсирована не только сетью: появились латентное внимание, сокращающее кеш ключей и значений в несколько раз, ограничение маршрутизации эксперта не более чем четырьмя узлами, обучение в FP8 и коммуникационные ядра, написанные вручную и занимающие лишь 20 потоковых мультипроцессоров. Дефицит сети был отвечен в модели, а не только в фабрике.
Похожая история у Huawei. В Pangu Ultra плотная модель на 135 млрд параметров обучена на 8192 ускорителях Ascend при межузловой сети всего 200 Гбит/с, и заявленная утилизация превысила 52%. Но честный контрапункт публикует сама же компания: Pangu Ultra MoE на 718 млрд параметров и 6000 ускорителях даёт лишь 30%. Разреженность окупается не всегда, а показатели здесь — заявления вендора.
Отдельная и наиболее применимая линия — обучение с редкой синхронизацией. DiLoCo демонстрирует примерно в 500 раз меньше обмена при сопоставимом качестве, Streaming DiLoCo сокращает объём переданных бит в 400 раз, а пиковую полосу — в восемь. Соблазн объявить это решением проблемы велик, поэтому сразу противовес: по разбору Epoch AI распределённые прогоны находятся примерно в 300 раз ниже фронтира, а сами методы сокращения обмена стоят качества. Вывод узкий и потому полезный: редкая синхронизация — это способ занять фрагментированный парк пост-тренингом и работой среднего масштаба, а не способ дойти до фронтира предобучения.
Практическую сторону задаёт ещё одно жёсткое ограничение: формат квантования выбирает не вкус инженера, а поколение ускорителя. На Ampere формат FP8 остаётся приёмом экономии памяти и не даёт арифметического ускорения, поэтому рабочий выбор там — INT8 и четырёхбитные веса. Смешанный парк означает, что для разных поколений придётся собирать разные артефакты одной и той же модели.
На нерасширяемом парке эффективность обслуживания — продуктовое решение
Когда парк нельзя увеличить, каждый множитель эквивалентен закупке, которой не будет. Порядок величин задан двумя опубликованными результатами: страничное внимание даёт двух-четырёхкратный рост при той же задержке, а разбиение стадии предзаполнения на порции — от 2,6 до 5,6 раза больше обслуживаемой нагрузки под ограничением хвостовой задержки. Это пол, а не потолок: стек со статическим группированием запросов теряет кратности, а не проценты.
Следующий по величине рычаг — маршрутизация с учётом кеша. В замерах одного из открытых маршрутизаторов точный учёт префикса менял задержку первого токена на порядки просто потому, что один и тот же префикс переставал дублироваться по репликам. Дальше идёт вынос кеша ключей и значений из быстрой памяти в оперативную и на диск; в собственной публикации DeepSeek кешированный токен стоит примерно в десять раз дешевле обычного.
Две техники стоит применять осознанно, потому что вокруг них больше всего заблуждений. Спекулятивное декодирование покупает интерактивность, а не ёмкость: выигрыш велик при единичной нагрузке и почти исчезает при высокой параллельности, поэтому правильная позиция — адаптивная глубина. А разнесение стадий предзаполнения и декодирования по разным пулам — это, по признанию самих авторов подхода, техника сотен и тысяч ускорителей; для малого парка разумным умолчанием остаётся совмещённое размещение.
Здесь же лежит стратегическая асимметрия, которую стоит запомнить. Когда Huawei публиковала CloudMatrix384, показатели обслуживания чужой открытой модели на собственном кремнии оказались вполне публикуемыми — при том что обучение на том же кремнии в тот же период давалось заметно хуже. Обслуживание терпит слабую сеть, терпит перезапуски и масштабируется добавлением стоек. Крупное синхронное обучение не терпит ничего из этого. Для страны с ограниченным парком это означает, что первым закрывается именно слой обслуживания.
Обвязка — самый рычажный слой: она стоит вкуса, а не ускорителей
Есть измерение, которое стоит держать в голове при любом разговоре о локальном стеке. В контролируемой сетке «три обвязки × три модели» дисперсия результата, вносимая , составила 18,48 против 2,37 у модели — отношение 7,8. В отдельном стенде разрыв между лучшей и худшей обвязкой на одних и тех же задачах и одном пуле моделей достигал 23,8 процентного пункта.
Но по-настоящему важна не сама величина, а асимметрия внутри неё: обе работы отмечают, что более сильные модели показывают меньший разброс между обвязками. Иначе говоря, слабая модель чувствительнее к качеству обвязки, а не наоборот. Для игрока, который заведомо работает не на фронтирной модели, это лучшая из возможных новостей: слой, где он может выиграть больше всего, стоит инженерного вкуса и совершенно не стоит вычислений.
Крупнейший российский вендор, к слову, уже проголосовал за этот вывод ногами. Yandex SourceCraft CLI не содержит проприетарной обвязки — в нём работает встроенный OpenCode под лицензией MIT, а инженерия компании ушла в интеграцию с собственными моделями, платформенными инструментами и навыками. Это сильный довод в пользу «адаптировать, а не писать заново» на уровне обвязки.
Что именно в обвязке решает ёмкость, видно из характеризации агентных трейсов: соотношение входа к выходу около 294 к 1, подавляющая часть входных токенов попадает в префиксный кеш, а доля попаданий заметно падает на новом сообщении пользователя по сравнению с продолжением после результата инструмента. Отсюда конкретный список решений, ни одно из которых не требует вычислений: стабильность и порядок префикса, форма и объём результатов инструментов, политика обрезки контекста, горизонт удержания кеша и между моделями разного размера. Наивная обрезка контекста уничтожает актив, на котором держится ёмкость.
Слой, о котором забывают: подложка
Агент, который собирает проект, ставит зависимости и запускает тесты, наследует надёжность git clone и pip install. В 2026 году это перестало быть теоретическим соображением: по данным независимых измерений доля неудачных соединений с крупнейшим хостингом кода из российских сетей выросла с примерно 4% до 16% в мае, а в июне на сутки стал недоступен основной репозиторий пакетов Python. Ответом отрасли стали зеркала пакетных хранилищ внутри страны. Вывод для проектирования простой: прежде чем настраивать качество обвязки, надо добиться, чтобы плоскости зависимостей и контейнеров, в которые бьют вызовы инструментов, разрешались детерминированно.
И сразу поправка к оптимизму: по опросу крупных заказчиков российские инструменты разработки получили среднюю оценку 5,8 из 10, а около 70% продолжают параллельно использовать зарубежные платформы. Корпоративный код не лежит ни чисто локально, ни чисто в отечественном контуре — он расщеплён, и обвязка, спроектированная под одну чистую среду, будет работать хуже заявленного.
Трейсы, оценки и среды — единственный актив, который нельзя арендовать
Веса можно скачать, движок обслуживания взять открытым, обвязку адаптировать. Трейсы собственного продукта, оценки на собственных задачах и среды, воспроизводящие собственную работу, нельзя ни купить, ни арендовать. Это единственный слой, где локальный игрок структурно сильнее любого внешнего поставщика — и именно поэтому его стоит строить первым.
Среда — вещь конкретная: снимок репозитория, формулировка задачи, скрытая до момента оценки проверяющая программа и награда. Публичная ось масштабирования сместилась именно сюда: от 20 тысяч параллельных сред у Qwen до 807 693 сред, автоматически построенных из реальных запросов на слияние. Экономика при этом удобна для игрока с дефицитом железа: по разбору Epoch AI задача стоит от 200 до 2000 долларов и это труд, а не вычисления, тогда как счёт за сам прогон скромен — в открытом эксперименте DeepSWE 64 ускорителя за шесть дней дали 42,2% на SWE-bench Verified. Корпус сред — актив постоянный и трудоёмкий, прогон — расход разовый и планируемый.
Отдельно стоит отметить работу Polar: обучение агента с подкреплением можно вести поверх чужой, немодифицированной обвязки, перехватывая обмен на границе API модели. В опубликованных замерах это подняло один из агентов на SWE-bench Verified с 3,8% до 26,4% без единой правки в коде обвязки. Практический смысл для локального игрока велик: владение обвязкой и владение обучением можно развязать.
Ценность собственных оценок при этом растёт по внешней причине. В феврале 2026 года OpenAI перестала публиковать результаты на SWE-bench Verified: модели воспроизводили эталонную правку по одному идентификатору задачи, а из 138 проверенных сложных задач более 60% оказались нерешаемыми в том виде, в каком сформулированы. Публичный лидерборд перестал быть измерительным прибором — и это ровно тот аргумент, который поднимает цену приватного, свежесобранного набора.
Русскоязычная часть картины подтверждает то же самое с другой стороны. В открытом стенде для 1С задачи компилируются и исполняются на реальной платформе, и лучшие зарубежные модели решают около половины; российских моделей в таблице нет вовсе. Домен, где у локального игрока больше всего данных, — это домен, где любая модель слабее всего. Такое расхождение и есть определение возможности.
Зависимость от открытых весов: назвать, оценить и отрепетировать замену
Тезис, который индустрия проговаривает неохотно, опубликован самими компаниями. В техрепорте Alice AI прямо сказано, что обучение ведётся поверх инициализации весами Qwen3-235B и что этот вариант выбран сознательно вместо обучения с нуля. Т-Технологии никогда этого и не скрывали.
Существеннее самого факта то, что зависимость не одинарная. В опубликованном рецепте T-pro 2.0 чужие открытые веса появляются минимум четырежды: как базовый чекпоинт, как учитель, которым перегенерированы ответы в обучающем наборе, как инициализация модели наград и как черновая модель для спекулятивного декодирования. Прекращение публикации открытых весов сломало бы не одну вещь, а четыре.
Юридический слой при этом создаёт меньше риска, чем принято думать, — и это стоит сказать честно, потому что рынок обычно боится не того. Ведущие открытые семейства распространяются под разрешительными лицензиями без географических ограничений. Зато встречается обратная асимметрия: отдельные российские открытые веса выходят под собственной лицензией, автоматически прекращающейся при превышении порога использования. То есть локальная «открытость» бывает жёстче зарубежной, и читать надо текст, а не ярлык.
Настоящую цену зависимости назначает не лицензия, а регуляторная категория. Формирующаяся рамка различает модель, для которой требуется полная воспроизводимость всего цикла, и модель, в которой допускаются иностранные компоненты под открытыми лицензиями. Ключевые определения — считаются ли веса «компонентом» и признаётся ли конкретная лицензия «открытой» — на момент публикации отнесены к подзаконным актам, которых ещё нет. Практический смысл: старт с чужой базы не дисквалифицирует, но решение по этим определениям способно поменять категорию модели без единого технического изменения. Прецеденты такого рода уже случались: в корейской суверенной программе одну из команд исключили именно из-за использования чужого закрытого компонента внутри своей модели.
Учение по замене базы
Из всего перечисленного следует не риторика, а упражнение. План замены базы, который ни разу не выполняли, — это не план, а надежда.
- рецепт пост-тренинга написан так, что не зависит от конкретного чекпоинта: токенизатор, данные, среды, оценки и стек обслуживания отделены от базы;
- вторая база держится прогретой заранее — не как идея, а как проходящая сборка;
- заложены конкретные GPU-часы и конкретные недели на возврат к паритету;
- паритет измеряется на собственной русскоязычной оценке, а не на публичном лидерборде;
- триггером считается и правовое событие тоже, а не только техническое — решение о статусе лицензии наступает мгновенно и без предупреждения.
Чего не строить: отказы с указанием режима отказа
Отрицательная часть программы важнее положительной, потому что дефицитный ресурс тратится в первую очередь на неудачные ставки.
| Соблазн | Режим отказа | Что делать вместо |
|---|---|---|
| Свой ускоритель | Кремния нет: публично известны техпроцесс 28 нм и рамки энергопотребления, но не показатели производительности | Планировать на существующем парке и на открытых движках обслуживания |
| Предобучение с нуля | Входной билет дорожает быстрее любого правдоподобного роста капитальных затрат | Пост-тренинг поверх открытой базы плюс собственные среды |
| Зарубежная аренда как «своя» ёмкость | Рублёвый прайс-лист не означает размещения внутри страны, а ёмкость вне юрисдикции не может быть якорем контура | Считать локальной только ту ёмкость, которую видно в своей юрисдикции |
| Приёмы гиперскейла на малом парке | Разнесение стадий, самая большая открытая разреженная модель и спекуляция фиксированной глубины на загруженном парке | Совмещённое размещение, chunked prefill и маршрутизация с учётом кеша |
| Зарубежный SaaS для трейсов | Прямое столкновение с требованием к стадии сбора персональных данных | Своё хранилище, деидентификация на входе, короткое окно хранения |
| Гонка за публичным лидербордом | Загрязнение и некорректные задачи: автор набора сам перестал его публиковать | Свежесобранный приватный набор на своих репозиториях и инцидентах |
Отдельно про отечественное железо, потому что вокруг него больше всего ожиданий. Публично известны техпроцесс и рамки энергопотребления анонсированных решений, но не измеренные показатели производительности и не пропускная способность памяти. Этого достаточно, чтобы утверждать, что речь идёт о периферийном инференсе, и недостаточно, чтобы ранжировать их против чего-либо. Ничто в публичной записи не ставит российский кремний в контур обучения в этом десятилетии — и планировать стратегию, опираясь на анонсы, значит подменять кремний дорожной картой.
Организация, программа и вопрос, который не планируют
Разделение ответственности удобнее описывать не логотипами, а решением «своё или арендованное». Своими остаются два слоя: оценки, трейсы и среды — и обвязка вместе с инструментами и . Арендованными остаются базовые веса, предобучение и апстрим движка обслуживания. Это распределение прямо следует из предыдущих разделов: первое нельзя купить, второе бессмысленно воспроизводить.
Ломается это по-разному в зависимости от размера. На полусотне инженеров первым отказывает измерение: все поставляют, никто не меряет, а оценки и инфраструктура трейсов делаются последними. На пяти сотнях отказывает другое — граница прав песочницы, политика квот на ускорители и доля попаданий в префиксный кеш, которая обваливается, как только маршрутизация фрагментируется между командами. Обе поломки организационные, и обе дешевле предупредить, чем чинить.
Минимальная программа на год
- 01Измерить, а не закупать. Инструментировать агентные трейсы с записью внутри страны и деидентификацией на входе, измерить фактическую долю попаданий в префиксный кеш и долю повторного предзаполнения.
- 02Поднять базовый контур обслуживания. Непрерывное группирование запросов, разбиение предзаполнения на порции, маршрутизация с учётом кеша и зафиксированная матрица квантования по поколениям парка.
- 03Собрать свои среды и оценки. 20–50 задач из реальных отказов, проверка через компиляцию и исполнение, скрытый до момента оценки проверяющий код, приватный сплит и постоянно обновляемый конвейер задач.
- 04Взять дешёвые победы в вычислениях. Хирургия токенизатора под свою языковую смесь, маршрутизация и дистиллированная малая модель, уводящая массовый трафик с дорогой.
- 05Провести учение по замене базы. Не после того, как чужой релиз изменится, а по расписанию — с заложенными GPU-часами, неделями и критерием паритета на своей оценке.
- 06Написать план по запасным частям. Считать деградацию парка частью продуктовой стратегии, а не эксплуатационной рутиной.
Управлять этим стоит по короткому набору чисел, и ни одно из них не про качество модели: число экспериментов в неделю, стоимость одной принятой задачи, доля попаданий в префиксный кеш, доля трафика, обслуженного дешёвой моделью, время от появления трейса до появления соответствующей оценки и время замены базового чекпоинта в тестовом контуре.
Вопрос, который не планируют
Есть тема, которой нет ни в одной известной мне публичной стратегии: парк стареет и не заменяется. Ускорители поколения Ampere — это кремний 2020 года, у которого в текущих условиях нет обычного пути гарантийной замены. Значит, запас узлов, план перезапуска с контрольных точек на ненадёжном и невосполнимом оборудовании и допустимая доля выбывших узлов — это решения о будущих способностях компании, а не эксплуатационная рутина. Способности в 2029 году определит план по запасным частям, написанный сейчас.
Сюда же примыкает вопрос безопасности, который в публичной инженерной литературе почти не разобран: агент с доступом к терминалу внутри защищённого периметра. Политика исходящего трафика, обращение с секретами, перечень того, что модель вправе прочитать, и отдельный вопрос — становится ли сам контур обслуживания значимым объектом инфраструктуры. Готового правила здесь нет, и это стоит признавать, а не изображать решённым.
Что стоит унести с собой
- 01«Сквозной» в России означает не предобучение с нуля, а замкнутый контур от трейса до выпуска: пять звеньев из шести локальны, шестое арендовано у чужого релиза открытых весов.
- 02Дефицит ускорителей ограничивает не достижимое качество, а число проходов по контуру; при цене GPU-часа примерно втрое выше зарубежной выигрывает тот, кто замыкает более узкий контур быстрее.
- 03Доктрина расходования вычислений важнее их объёма: сначала обслуживание, затем пост-тренинг и среды, затем токенизатор и данные; предобучение с нуля доказано в стране ровно одним игроком.
- 04Обучение с подкреплением — единственный крупный режим обучения, структурно терпимый к слабой сети, и именно поэтому он подходит фрагментированному парку лучше, чем предобучение.
- 05Обвязка даёт больше разброса результата, чем выбор модели, и слабая модель чувствительнее к её качеству — это слой, который стоит инженерного вкуса, а не ускорителей.
- 06Зависимость от чужих открытых весов четырёхкратная, и она снимается не риторикой о суверенитете, а отделением инвариантов от чекпоинта и регулярно проводимым учением по замене базы.
Первичные материалы, исследования и документация
- 01DeepSeek · DeepSeek-V3 Technical Report — таблица затрат: 2 664 тыс. GPU-часов предобучения против 5 тыс. на пост-тренинг; самоотчёт по финальному прогону.
- 02DeepSeek · Insights into DeepSeek-V3: Scaling Challenges and Hardware Reflections — какие архитектурные решения вынудил урезанный интерконнект: MLA, маршрутизация не более чем на 4 узла, FP8, коммуникационные ядра на PTX.
- 03DeepSeek · DeepSeek-R1 (Nature, 17 сентября 2025) — рецензированная работа: обучение с подкреплением поднимает AIME 2024 с 15,6% до 77,9%; стоимость этапа RL не включает базовую модель.
- 04Cottier et al. (Epoch AI) · The rising costs of training frontier AI models — рост стоимости финального прогона примерно в 2,4 раза в год; оборудование — 47–67% стоимости разработки.
- 05Cursor · Composer 1.5 — заявление компании: вычисления пост-тренинга превысили вычисления предобучения базовой модели.
- 06Khatri et al. · The Art of Scaling Reinforcement Learning Compute for LLMs — сигмоидные кривые масштабирования RL, предсказанные до прогона в 100 тыс. GPU-часов — RL становится планируемой статьёй бюджета.
- 07Gen-T Team (Т-Технологии) · T-pro 2.0 — единственный подробно опубликованный российский рецепт: база Qwen3-32B, хирургия токенизатора, SFT и DPO на 4×8 H100.
- 08Salute Developers · GigaChat family — семейство MoE, обученное с нуля; вычисления обучения ни для одной версии не раскрыты.
- 09Яндекс · Техрепорт Alice AI — прямое утверждение об инициализации весами Qwen3-235B; цифра «4 тыс. GPU» — бенчмарк коммуникационной библиотеки, а не размер обучающего кластера.
- 10Douillard et al. · DiLoCo — обучение с редкой синхронизацией: примерно в 500 раз меньше коммуникации при сопоставимом качестве.
- 11Douillard et al. · Streaming DiLoCo — сокращение объёма обмена в 400 раз и пиковой полосы в 8 раз на масштабе 1 млрд параметров.
- 12Epoch AI · How far can decentralized training over the internet scale? — необходимый противовес: распределённые прогоны примерно в 300 раз ниже фронтира, а методы сокращения обмена стоят качества.
- 13Prime Intellect · INTELLECT-3 — модель на 106 млрд параметров, дообученная поверх открытой базы на 512 H200 за два месяца; заявления компании.
- 14Yin et al. · Pangu Ultra на Ascend NPU — 52% MFU на 8192 NPU при межузловой сети всего 200 Гбит/с; показатели заявлены вендором.
- 15Huawei · Pangu Ultra MoE — честный контрапункт: 718 млрд параметров на 6000 NPU дают лишь 30% MFU.
- 16Huawei · CloudMatrix384 — обслуживание чужих открытых весов на ограниченном кремнии даёт публикуемые показатели там, где обучение не пошло.
- 17Stop Comparing LLM Agents Without Disclosing the Harness — дисперсия от обвязки 18,48 pp² против 2,37 pp² от модели — отношение 7,8; слабая модель чувствительнее к обвязке.
- 18Harness-Bench — разрыв 23,8 процентного пункта между обвязками на одних задачах и одном пуле моделей.
- 19Polar · обучение агентов поверх чужой обвязки — перехват на границе API модели поднимает Codex на SWE-bench Verified с 3,8% до 26,4% без изменения кода обвязки.
- 20Alibaba Qwen · Qwen3-Coder — 20 тысяч параллельных сред как ось масштабирования обучения агента; заявление команды.
- 21Chen et al. · SWE-Universe — 807 693 автоматически построенных проверяемых среды из реальных pull request.
- 22Prime Intellect · Scaling agentic RL — около 365 тыс. задач и 135 тыс. готовых образов; проверочный материал скрыт до момента оценки.
- 23Together AI · DeepSWE — 64 H100 за шесть дней дают 42,2% на SWE-bench Verified — счёт за вычисления скромный и разовый.
- 24Epoch AI · FAQ по средам обучения с подкреплением — цена задачи 200–2000 долларов, реплики продуктов дороже на порядки — среды это труд, а не FLOPs.
- 25OpenAI · Why we no longer evaluate SWE-bench Verified — загрязнение и некорректные задачи: более 60% из 138 проверенных сложных задач нерешаемы как сформулированы.
- 26Anthropic · Demystifying evals for AI agents — начинать с 20–50 задач из реальных отказов, разделять траекторию и результат, калибровать судей по экспертам.
- 27Databricks · coSTAR — два зеркальных контура — судьи калибруются людьми, агент чинится против судей; результаты — самоотчёт.
- 28GitHub · Офлайн-оценка GitHub MCP Server — контур улучшения, работающий на поверхности инструментов и не требующий обучения модели.
- 29Nebius · SWE-rebench — непрерывно обновляемый конвейер задач как ответ на загрязнение публичных наборов.
- 30Сбер · 1C Code Bench — компиляция и исполнение на реальной платформе 1С: у лучших зарубежных моделей около половины верных решений, российских моделей в таблице нет.
- 31Яндекс · SourceCraft Code Assistant — CLI поставляется со встроенным OpenCode под лицензией MIT — крупнейший локальный вендор выбрал адаптацию, а не свою обвязку.
- 32Anomaly · OpenCode — обвязка под MIT, не привязанная к одному поставщику модели.
- 33Разбор доступности GitHub и PyPI из российских сетей — по данным измерений OONI доля неудачных соединений с GitHub выросла с ~4% до 16% в мае 2026 года; агент наследует надёжность git clone и pip install.
- 34ComNews · Оценка российских инструментов разработки — средняя оценка 5,8 из 10 и около 70% респондентов, продолжающих параллельно использовать зарубежные платформы.
- 35Cloud.ru · Тарифы на GPU-ускоренные вычисления — единственный проверенный опубликованный российский прайс-лист; цена за GPU-час выводится из геометрии инстанса, а не указана напрямую.
- 36TOP500 · список за июнь 2026 года — пять российских систем совокупно около 69 PFlop/s — это молчание публичного реестра, а не измеренный потолок страны.
- 37Anthropic · Поддерживаемые страны — перечень стран обслуживания как регуляторный факт, определяющий доступность зарубежных агентных инструментов.
- 38GitHub · Торговые ограничения — условия распространения Copilot и Enterprise Server применительно к ограниченным направлениям.
- 39Yang et al. · SWE-smith — 50 тыс. задач, построенных программной поломкой существующих тестов в 128 репозиториях.
- 40Ai2 · OLMo 3 — раскрытые GPU-часы на кластере не более 1024 H100 и полный «поток модели» как отличающий актив вместо масштаба.
- 41Mistral AI · Анонс Mistral 7B — первая конкурентоспособная модель на полностью арендованных вычислениях; собственные мощности профинансированы лишь три года спустя.
- 42TII · Falcon-H1 — лаборатория с неограниченным доступом к железу выбрала эффективность параметров, а не их количество.
- 43OpenTelemetry · Семантические соглашения GenAI — переносимая схема полей трейсов агента и предупреждения о чувствительных данных.