ко всем лонгридам
Лонгрид#AI4SDLC#PlatformEngineering

Сквозной игрок без своего железа: как строить AI-разработку в России от трейсов и обвязки, а не от предобучения

Продолжение разговора о совместно эволюционирующем стеке. В прошлый раз преимущество давала скорость прохода по контуру «оборудование → модель → обвязка → инструменты → результаты → проверки». Здесь тот же контур рассматривается в ситуации, когда сломано ровно одно звено, зато остальные блоки существуют: люди, умеющие обучать модели, инженерия обвязки и инструментов, собственные мощности обслуживания и доступ к трейсам. Вопрос не «возможно ли», а «как это делать правильно».

26 июля 2026≈ 18 минут

Материал основан на исследовательском досье, собранном 25–26 июля 2026 года. Регуляторные ограничения на оборудование рассматриваются исключительно как граничное условие, внутри которого ведётся инженерная работа; способы их обхода, каналы поставки и посреднические юрисдикции здесь не обсуждаются. Показатели, опубликованные самими компаниями, помечены как заявления поставщиков.

01

«Сквозной» — это не про предобучение, а про то, какой контур действительно замыкается

Начать стоит с вычёркивания. Слово «сквозной» обычно тянет за собой картинку полной вертикали от кремния до продукта, и именно эта картинка делает разговор бессмысленным. Публичная запись довольно скупа: в списке TOP500 за июнь 2026 года у России пять систем совокупно примерно на 69 PFlop/s — это машины поколений V100 и A100. Важно правильно прочитать это молчание: оно означает отсутствие публично измеренного кластера национального масштаба на более новых ускорителях, а не отсутствие таких ускорителей в стране.

Ещё скупее запись о том, на чём в России реально обучают. Единственные подробные раскрытия оборудования — это 96 ускорителей A100 для модели на 8 млрд параметров в 2024 году и четыре узла по восемь H100 на этапы SFT и DPO в рецепте T-pro 2.0. Оба числа описывают дообучение, а не предобучение. Семейство GigaChat обучено с нуля, но вычисления обучения не раскрыты ни для одной версии, поэтому соотношение «вычисления к качеству» посчитать невозможно.

схема 01 · пять звеньев локальны, шестое арендовано
Какая часть контура действительно замыкаетсяПРЕДОБУЧЕНИЕнедостижимоОТКРЫТАЯ БАЗАчужаяПОСТ-ТРЕНИНГвашОБВЯЗКА + ИНСТРУМЕНТЫвашиОЦЕНКИ + СРЕДЫвашиТРЕЙСЫвашиКОНТУР,который замыкаетсяПять звеньев из шести локальны; шестое арендовано у чужого релиза открытых весов

Если убрать предобучение, остаётся вполне рабочий контур: открытая база → пост-тренинг → обвязка и инструменты → оценки и среды → трейсы → и снова пост-тренинг. Пять его звеньев локальны. Шестое — чужой релиз открытых весов, и это зависимость, о которой ниже будет отдельный разговор. Ограничение по железу при этом бьёт не по достижимому качеству, а по числу проходов: единственный проверенный опубликованный российский прайс-лист даёт цену примерно втрое выше медианы нишевых зарубежных провайдеров и примерно в полтора раза выше прайс-листа крупного гиперскейлера. Втрое дороже эксперимент — это налог на количество итераций.

Класс доказательства для каждого числа

В этой теме половина публичных чисел — маркетинг, поэтому дальше каждое число стоит мысленно относить к одной из трёх колонок.

КлассЧто сюда попадаетЧто с этим делать
Первичный источникРецензированные работы, отчёты с раскрытыми числами, тексты лицензий, официальные тарифы и списки TOP500Можно строить вывод
Заявление поставщикаПоказатели из собственных блогов и карточек моделей: ускорения, MFU, доли принятого кода, прирост производительностиГодится как направление, не как измерение
Сообщение по источникамПубликации агентств и отраслевой прессы со ссылкой на неназванные источники: закупки, сроки, планыТолько как снимок рынка
02

Доктрина расходования вычислений важнее их количества

Самое полезное число во всей теме компания DeepSeek опубликовала о себе сама. В отчёте по V3 таблица затрат выглядит так: предобучение — 2 664 тыс. GPU-часов, расширение контекста — 119 тыс., пост-тренинг — 5 тыс. Внутри одной модели соотношение примерно 500 к 1. Это самоотчёт, он описывает только финальный прогон и не включает предшествующие исследования и неудачные запуски. Но планировать надо именно по соотношению, а не по сумме: если вы не можете оплатить первую колонку, вся поверхность вашего продукта решается в третьей.

схема 02 · куда уходят вычисления внутри одной модели
Куда тратить дефицитные вычисленияСОБСТВЕННАЯ ТАБЛИЦА ЗАТРАТ DEEPSEEK-V3 · GPU-ЧАСЫ ОДНОЙ МОДЕЛИПРЕДОБУЧЕНИЕ · 2 664 000 GPU-чрасширение контекста · 119 000 GPU-чПОСТ-ТРЕНИНГ · 5 000 GPU-ч≈ 500 : 11 · ОБСЛУЖИВАНИЕэффективность = ёмкость,которую не купят2 · ПОСТ-ТРЕНИНГRL и средыпланируемая статья3 · ТОКЕНИЗАТОР + ДАННЫЕ38% → 60% словв ≤ 2 токенаПРЕД-ОБУЧ.Самоотчёт и только финальный прогон — но планировать надо по соотношению, а не по сумме

Дальше это подтверждается с двух сторон. В рецензированной работе о DeepSeek-R1 обучение с подкреплением поднимает результат на AIME 2024 с 15,6% до 77,9% — поверх уже существующей базовой модели и за долю её стоимости (сама база в эту стоимость не входит, и это надо произносить вслух). А в феврале 2026 года Cursor сообщил, что вычисления пост-тренинга Composer 1.5 превысили вычисления предобучения базовой модели. Инверсия стала явной.

Одновременно вход в предобучение дорожает: по оценке Epoch AI стоимость финального прогона растёт примерно в 2,4 раза в год. Это кривая, которая структурно исключает игрока без капитала уровня гиперскейлера — не потому, что он хуже, а потому, что билет дорожает быстрее любого правдоподобного роста закупок. Зато обучение с подкреплением перестало быть ремеслом: работа о масштабировании вычислений RL строит сигмоидные кривые и предсказывает результат прогона на 100 тыс. GPU-часов. Это превращает RL в планируемую статью бюджета.

Самая дешёвая победа при этом лежит не в обучении, а в токенизаторе. В рецепте T-pro 2.0 замена 34 тыс. низкочастотных нецирилличных токенов на кириллические при неизменном размере словаря снижает число токенов на слово с 3,12 до 2,38, а доля русских слов, укладывающихся в два токена, растёт с 38,2% до 60,1%. Это примерно четверть вычислений на одном и том же русском тексте — и на обучении, и на . Скидка выдаётся ровно в той валюте, которой не хватает.

приоритет 1 — обслуживание · приоритет 2 — пост-тренинг и среды · приоритет 3 — токенизатор и данные · предобучение с нуля — только для того, кто уже показал прогон на десятках триллионов токенов

03

Архитектуру обучения выбирают по объёму обмена, а не только по качеству

Канонический пример того, как дефицит сети переезжает в архитектуру модели, снова даёт DeepSeek. В отдельной работе они описывают, что урезанная вдвое пропускная способность межускорительной шины была скомпенсирована не только сетью: появились латентное внимание, сокращающее кеш ключей и значений в несколько раз, ограничение маршрутизации эксперта не более чем четырьмя узлами, обучение в FP8 и коммуникационные ядра, написанные вручную и занимающие лишь 20 потоковых мультипроцессоров. Дефицит сети был отвечен в модели, а не только в фабрике.

Похожая история у Huawei. В Pangu Ultra плотная модель на 135 млрд параметров обучена на 8192 ускорителях Ascend при межузловой сети всего 200 Гбит/с, и заявленная утилизация превысила 52%. Но честный контрапункт публикует сама же компания: Pangu Ultra MoE на 718 млрд параметров и 6000 ускорителях даёт лишь 30%. Разреженность окупается не всегда, а показатели здесь — заявления вендора.

Отдельная и наиболее применимая линия — обучение с редкой синхронизацией. DiLoCo демонстрирует примерно в 500 раз меньше обмена при сопоставимом качестве, Streaming DiLoCo сокращает объём переданных бит в 400 раз, а пиковую полосу — в восемь. Соблазн объявить это решением проблемы велик, поэтому сразу противовес: по разбору Epoch AI распределённые прогоны находятся примерно в 300 раз ниже фронтира, а сами методы сокращения обмена стоят качества. Вывод узкий и потому полезный: редкая синхронизация — это способ занять фрагментированный парк пост-тренингом и работой среднего масштаба, а не способ дойти до фронтира предобучения.

Практическую сторону задаёт ещё одно жёсткое ограничение: формат квантования выбирает не вкус инженера, а поколение ускорителя. На Ampere формат FP8 остаётся приёмом экономии памяти и не даёт арифметического ускорения, поэтому рабочий выбор там — INT8 и четырёхбитные веса. Смешанный парк означает, что для разных поколений придётся собирать разные артефакты одной и той же модели.

схема 03 · доступный формат задаётся поколением ускорителя
Формат квантования задаётся поколением GPUСМЕШАННЫЙ ПАРК ТРЕБУЕТ РАЗНЫХ АРТЕФАКТОВ МОДЕЛИFP8 счётFP8 памятьINT8 W8A8W4A16Ampere · A100Ada · L40SHopper · H100BlackwellНа Ampere FP8 экономит память, но не даёт арифметического ускоренияАртефакт сервинга выбирает парк, который у вас есть, а не предпочтительный формат
04

На нерасширяемом парке эффективность обслуживания — продуктовое решение

Когда парк нельзя увеличить, каждый множитель эквивалентен закупке, которой не будет. Порядок величин задан двумя опубликованными результатами: страничное внимание даёт двух-четырёхкратный рост при той же задержке, а разбиение стадии предзаполнения на порции — от 2,6 до 5,6 раза больше обслуживаемой нагрузки под ограничением хвостовой задержки. Это пол, а не потолок: стек со статическим группированием запросов теряет кратности, а не проценты.

Следующий по величине рычаг — маршрутизация с учётом кеша. В замерах одного из открытых маршрутизаторов точный учёт префикса менял задержку первого токена на порядки просто потому, что один и тот же префикс переставал дублироваться по репликам. Дальше идёт вынос кеша ключей и значений из быстрой памяти в оперативную и на диск; в собственной публикации DeepSeek кешированный токен стоит примерно в десять раз дешевле обычного.

схема 04 · кратности ёмкости на одном и том же железе
Кратности ёмкости на фиксированном паркеТО ЖЕ ЖЕЛЕЗО · КАЖДАЯ КРАТНОСТЬ — ЗАКУПКА, КОТОРОЙ НЕ БУДЕТСТАТИЧЕСКИЙ БАТЧИНГбазаPAGED ATTENTION2–4×CHUNKED PREFILL2,6–5,6×МАРШРУТИЗАЦИЯ ПО КЕШУTTFT p90 92,5с → 0,5сТИРИНГ KVкешированный токен ×10 дешевле✕ НЕ ДАЁТ ЁМКОСТИспекулятивное декодирование: 1,55× при нагрузке 1,лишь 1,05–1,25× при 64 — покупает интерактивность✕ НЕ ДЛЯ МАЛОГО ПАРКАразнесение prefill и decode — техникасотен GPU по признанию самих авторовКратности складываются, пока модель укладывается в резидентность парка

Две техники стоит применять осознанно, потому что вокруг них больше всего заблуждений. Спекулятивное декодирование покупает интерактивность, а не ёмкость: выигрыш велик при единичной нагрузке и почти исчезает при высокой параллельности, поэтому правильная позиция — адаптивная глубина. А разнесение стадий предзаполнения и декодирования по разным пулам — это, по признанию самих авторов подхода, техника сотен и тысяч ускорителей; для малого парка разумным умолчанием остаётся совмещённое размещение.

Здесь же лежит стратегическая асимметрия, которую стоит запомнить. Когда Huawei публиковала CloudMatrix384, показатели обслуживания чужой открытой модели на собственном кремнии оказались вполне публикуемыми — при том что обучение на том же кремнии в тот же период давалось заметно хуже. Обслуживание терпит слабую сеть, терпит перезапуски и масштабируется добавлением стоек. Крупное синхронное обучение не терпит ничего из этого. Для страны с ограниченным парком это означает, что первым закрывается именно слой обслуживания.

05

Обвязка — самый рычажный слой: она стоит вкуса, а не ускорителей

Есть измерение, которое стоит держать в голове при любом разговоре о локальном стеке. В контролируемой сетке «три обвязки × три модели» дисперсия результата, вносимая , составила 18,48 против 2,37 у модели — отношение 7,8. В отдельном стенде разрыв между лучшей и худшей обвязкой на одних и тех же задачах и одном пуле моделей достигал 23,8 процентного пункта.

схема 05 · откуда берётся разброс результата
Выбор обвязки двигает результат сильнее выбора моделиКОНТРОЛИРУЕМАЯ СЕТКА 3×3 · ИСТОЧНИК ДИСПЕРСИИОБВЯЗКА18,48 pp²МОДЕЛЬ2,37 pp²в 7,80 раза больше дисперсии от обвязкиОДНА МОДЕЛЬ, РАЗНАЯ ОБВЯЗКА76,2% против 52,4% — разрыв 23,8 ppИ ВАЖНАЯ АСИММЕТРИЯслабая модель ЧУВСТВИТЕЛЬНЕЕ к обвязкеЭто слой, который стоит инженерного вкуса, а не ускорителей

Но по-настоящему важна не сама величина, а асимметрия внутри неё: обе работы отмечают, что более сильные модели показывают меньший разброс между обвязками. Иначе говоря, слабая модель чувствительнее к качеству обвязки, а не наоборот. Для игрока, который заведомо работает не на фронтирной модели, это лучшая из возможных новостей: слой, где он может выиграть больше всего, стоит инженерного вкуса и совершенно не стоит вычислений.

Крупнейший российский вендор, к слову, уже проголосовал за этот вывод ногами. Yandex SourceCraft CLI не содержит проприетарной обвязки — в нём работает встроенный OpenCode под лицензией MIT, а инженерия компании ушла в интеграцию с собственными моделями, платформенными инструментами и навыками. Это сильный довод в пользу «адаптировать, а не писать заново» на уровне обвязки.

схема 06 · агентный трафик — это задача про кеш
Агентный трафик — это задача про кешВХОД : ВЫХОД ≈ 294 : 1 · 95,7% ВХОДНЫХ ТОКЕНОВ ПОПАДАЮТ В КЕШСИСТЕМНЫЙ БЛОК + КОНТРАКТЫ ИНСТРУМЕНТОВне должен меняться между шагамиМЕДЛЕННО МЕНЯЮЩЕЕСЯ СОСТОЯНИЕ ПРОЕКТАперестановка стоит вам кешаРЕЗУЛЬТАТЫ ИНСТРУМЕНТОВ88% раундов — продолжения · попадание 97,5%НОВОЕ СООБЩЕНИЕ ПОЛЬЗОВАТЕЛЯпосле простоя в среднем 46,7 мин · 84,4%52,56 млрд в кеше2,340,19Наивная обрезка контекста уничтожает актив, на котором держится ёмкостьФорма нагрузки переносится с хостируемых замеров, абсолютные значения — нет

Что именно в обвязке решает ёмкость, видно из характеризации агентных трейсов: соотношение входа к выходу около 294 к 1, подавляющая часть входных токенов попадает в префиксный кеш, а доля попаданий заметно падает на новом сообщении пользователя по сравнению с продолжением после результата инструмента. Отсюда конкретный список решений, ни одно из которых не требует вычислений: стабильность и порядок префикса, форма и объём результатов инструментов, политика обрезки контекста, горизонт удержания кеша и между моделями разного размера. Наивная обрезка контекста уничтожает актив, на котором держится ёмкость.

Слой, о котором забывают: подложка

Агент, который собирает проект, ставит зависимости и запускает тесты, наследует надёжность git clone и pip install. В 2026 году это перестало быть теоретическим соображением: по данным независимых измерений доля неудачных соединений с крупнейшим хостингом кода из российских сетей выросла с примерно 4% до 16% в мае, а в июне на сутки стал недоступен основной репозиторий пакетов Python. Ответом отрасли стали зеркала пакетных хранилищ внутри страны. Вывод для проектирования простой: прежде чем настраивать качество обвязки, надо добиться, чтобы плоскости зависимостей и контейнеров, в которые бьют вызовы инструментов, разрешались детерминированно.

И сразу поправка к оптимизму: по опросу крупных заказчиков российские инструменты разработки получили среднюю оценку 5,8 из 10, а около 70% продолжают параллельно использовать зарубежные платформы. Корпоративный код не лежит ни чисто локально, ни чисто в отечественном контуре — он расщеплён, и обвязка, спроектированная под одну чистую среду, будет работать хуже заявленного.

06

Трейсы, оценки и среды — единственный актив, который нельзя арендовать

Веса можно скачать, движок обслуживания взять открытым, обвязку адаптировать. Трейсы собственного продукта, оценки на собственных задачах и среды, воспроизводящие собственную работу, нельзя ни купить, ни арендовать. Это единственный слой, где локальный игрок структурно сильнее любого внешнего поставщика — и именно поэтому его стоит строить первым.

схема 07 · что арендуется и что нет
Что можно арендовать и что нельзяАРЕНДУЕМОЕ · КОММОДИТИНЕАРЕНДУЕМОЕ · ВАШЕоткрытые весадвижки сервингаобвязка (MIT)RL-фреймворкиваши трейсываши средыприватные сплиты оценокдоменные данные · 1С, легасиЛИНИЯ ЮРИСДИКЦИИсырой трейс → деидентификация → короткое хранение → производный датасет → среда → приватный сплитВладение стеком делает вас оператором данных — это и право, и ответственность

Среда — вещь конкретная: снимок репозитория, формулировка задачи, скрытая до момента оценки проверяющая программа и награда. Публичная ось масштабирования сместилась именно сюда: от 20 тысяч параллельных сред у Qwen до 807 693 сред, автоматически построенных из реальных запросов на слияние. Экономика при этом удобна для игрока с дефицитом железа: по разбору Epoch AI задача стоит от 200 до 2000 долларов и это труд, а не вычисления, тогда как счёт за сам прогон скромен — в открытом эксперименте DeepSWE 64 ускорителя за шесть дней дали 42,2% на SWE-bench Verified. Корпус сред — актив постоянный и трудоёмкий, прогон — расход разовый и планируемый.

Отдельно стоит отметить работу Polar: обучение агента с подкреплением можно вести поверх чужой, немодифицированной обвязки, перехватывая обмен на границе API модели. В опубликованных замерах это подняло один из агентов на SWE-bench Verified с 3,8% до 26,4% без единой правки в коде обвязки. Практический смысл для локального игрока велик: владение обвязкой и владение обучением можно развязать.

Ценность собственных оценок при этом растёт по внешней причине. В феврале 2026 года OpenAI перестала публиковать результаты на SWE-bench Verified: модели воспроизводили эталонную правку по одному идентификатору задачи, а из 138 проверенных сложных задач более 60% оказались нерешаемыми в том виде, в каком сформулированы. Публичный лидерборд перестал быть измерительным прибором — и это ровно тот аргумент, который поднимает цену приватного, свежесобранного набора.

Русскоязычная часть картины подтверждает то же самое с другой стороны. В открытом стенде для 1С задачи компилируются и исполняются на реальной платформе, и лучшие зарубежные модели решают около половины; российских моделей в таблице нет вовсе. Домен, где у локального игрока больше всего данных, — это домен, где любая модель слабее всего. Такое расхождение и есть определение возможности.

07

Зависимость от открытых весов: назвать, оценить и отрепетировать замену

Тезис, который индустрия проговаривает неохотно, опубликован самими компаниями. В техрепорте Alice AI прямо сказано, что обучение ведётся поверх инициализации весами Qwen3-235B и что этот вариант выбран сознательно вместо обучения с нуля. Т-Технологии никогда этого и не скрывали.

Существеннее самого факта то, что зависимость не одинарная. В опубликованном рецепте T-pro 2.0 чужие открытые веса появляются минимум четырежды: как базовый чекпоинт, как учитель, которым перегенерированы ответы в обучающем наборе, как инициализация модели наград и как черновая модель для спекулятивного декодирования. Прекращение публикации открытых весов сломало бы не одну вещь, а четыре.

схема 08 · зависимость четырёхкратная, а не одинарная
Зависимость четырёхкратная, а не одинарнаяОДИН ЧУЖОЙ РЕЛИЗБАЗОВЫЙ ЧЕКПОИНТQwen3-32BУЧИТЕЛЬ ДАННЫХQwen3-235B · DeepSeek-V3ИНИЦИАЛИЗАЦИЯ REWARDQwen3-32BЧЕРНОВАЯ МОДЕЛЬспекулятивное декодированиеПЕРЕЖИВЁТ ЗАМЕНУ БАЗЫтокенизатор · данные · средыоценки · рецепт пост-тренингастек сервинга · обвязкаПРИДЁТСЯ ПЕРЕДЕЛАТЬчекпоинт · перегенерированные данныеинициализация reward · черновая модельи все опубликованные цифрыГраницу проводят до того, как чужой релиз изменится, а не после

Юридический слой при этом создаёт меньше риска, чем принято думать, — и это стоит сказать честно, потому что рынок обычно боится не того. Ведущие открытые семейства распространяются под разрешительными лицензиями без географических ограничений. Зато встречается обратная асимметрия: отдельные российские открытые веса выходят под собственной лицензией, автоматически прекращающейся при превышении порога использования. То есть локальная «открытость» бывает жёстче зарубежной, и читать надо текст, а не ярлык.

Настоящую цену зависимости назначает не лицензия, а регуляторная категория. Формирующаяся рамка различает модель, для которой требуется полная воспроизводимость всего цикла, и модель, в которой допускаются иностранные компоненты под открытыми лицензиями. Ключевые определения — считаются ли веса «компонентом» и признаётся ли конкретная лицензия «открытой» — на момент публикации отнесены к подзаконным актам, которых ещё нет. Практический смысл: старт с чужой базы не дисквалифицирует, но решение по этим определениям способно поменять категорию модели без единого технического изменения. Прецеденты такого рода уже случались: в корейской суверенной программе одну из команд исключили именно из-за использования чужого закрытого компонента внутри своей модели.

Учение по замене базы

Из всего перечисленного следует не риторика, а упражнение. План замены базы, который ни разу не выполняли, — это не план, а надежда.

схема 09 · учение проводится по расписанию, а не в день Х
Учение по замене базыПРОВОДИТСЯ ПО РАСПИСАНИЮ · А НЕ ИМПРОВИЗИРУЕТСЯ В ДЕНЬ ХТРИГГЕРправовой ИЛИ техническийВТОРАЯ БАЗАуже прогретаПРОГОН РЕЦЕПТАне зависит от базыВОЗВРАТ ПАРИТЕТАна своей оценкеПРАВОВОЙ ТРИГГЕР, КОТОРЫЙ ЗАБЫВАЮТрешение, что чужая лицензия не «открытая»,меняет категорию без единого технического действияКРИТЕРИИ ПРИЁМКИзаложенные GPU-часы · заложенные неделизамер на своей русскоязычной оценкеЕсли учение ни разу не проводили, это не план, а надеждаУчение превращает названную зависимость в ограниченный и просчитанный риск
  • рецепт пост-тренинга написан так, что не зависит от конкретного чекпоинта: токенизатор, данные, среды, оценки и стек обслуживания отделены от базы;
  • вторая база держится прогретой заранее — не как идея, а как проходящая сборка;
  • заложены конкретные GPU-часы и конкретные недели на возврат к паритету;
  • паритет измеряется на собственной русскоязычной оценке, а не на публичном лидерборде;
  • триггером считается и правовое событие тоже, а не только техническое — решение о статусе лицензии наступает мгновенно и без предупреждения.
08

Чего не строить: отказы с указанием режима отказа

Отрицательная часть программы важнее положительной, потому что дефицитный ресурс тратится в первую очередь на неудачные ставки.

СоблазнРежим отказаЧто делать вместо
Свой ускорительКремния нет: публично известны техпроцесс 28 нм и рамки энергопотребления, но не показатели производительностиПланировать на существующем парке и на открытых движках обслуживания
Предобучение с нуляВходной билет дорожает быстрее любого правдоподобного роста капитальных затратПост-тренинг поверх открытой базы плюс собственные среды
Зарубежная аренда как «своя» ёмкостьРублёвый прайс-лист не означает размещения внутри страны, а ёмкость вне юрисдикции не может быть якорем контураСчитать локальной только ту ёмкость, которую видно в своей юрисдикции
Приёмы гиперскейла на малом паркеРазнесение стадий, самая большая открытая разреженная модель и спекуляция фиксированной глубины на загруженном паркеСовмещённое размещение, chunked prefill и маршрутизация с учётом кеша
Зарубежный SaaS для трейсовПрямое столкновение с требованием к стадии сбора персональных данныхСвоё хранилище, деидентификация на входе, короткое окно хранения
Гонка за публичным лидербордомЗагрязнение и некорректные задачи: автор набора сам перестал его публиковатьСвежесобранный приватный набор на своих репозиториях и инцидентах

Отдельно про отечественное железо, потому что вокруг него больше всего ожиданий. Публично известны техпроцесс и рамки энергопотребления анонсированных решений, но не измеренные показатели производительности и не пропускная способность памяти. Этого достаточно, чтобы утверждать, что речь идёт о периферийном инференсе, и недостаточно, чтобы ранжировать их против чего-либо. Ничто в публичной записи не ставит российский кремний в контур обучения в этом десятилетии — и планировать стратегию, опираясь на анонсы, значит подменять кремний дорожной картой.

09

Организация, программа и вопрос, который не планируют

Разделение ответственности удобнее описывать не логотипами, а решением «своё или арендованное». Своими остаются два слоя: оценки, трейсы и среды — и обвязка вместе с инструментами и . Арендованными остаются базовые веса, предобучение и апстрим движка обслуживания. Это распределение прямо следует из предыдущих разделов: первое нельзя купить, второе бессмысленно воспроизводить.

схема 10 · два слоя своих, три арендованных, и стареющий парк
Два слоя своих, три арендованных, и парк, который стареетЭТИ ДВА — СВОИоценки + трейсы + средыобвязка + инструменты + песочницаЭТИ ТРИ — АРЕНДОВАНЫбазовые весапредобучениеапстрим движка сервингаЧТО ЛОМАЕТСЯ НА 50 ИНЖЕНЕРАХвсе поставляют, никто не измеряет —оценки и трейсы делают последнимиЧТО ЛОМАЕТСЯ НА 500граница прав песочницы, политика квот,обвал попаданий в префиксный кешВОПРОС, КОТОРЫЙ НЕ ПЛАНИРУЮТ: ПАРК СТАРЕЕТ И НЕ ЗАМЕНЯЕТСЯкремний 2020 года · нет пути RMA · ЗИП и перезапуск — решения о способностях, а не рутина эксплуатацииСпособности в 2029 году определяет план по запасным частям, написанный в 2026-м

Ломается это по-разному в зависимости от размера. На полусотне инженеров первым отказывает измерение: все поставляют, никто не меряет, а оценки и инфраструктура трейсов делаются последними. На пяти сотнях отказывает другое — граница прав песочницы, политика квот на ускорители и доля попаданий в префиксный кеш, которая обваливается, как только маршрутизация фрагментируется между командами. Обе поломки организационные, и обе дешевле предупредить, чем чинить.

Минимальная программа на год

  1. 01Измерить, а не закупать. Инструментировать агентные трейсы с записью внутри страны и деидентификацией на входе, измерить фактическую долю попаданий в префиксный кеш и долю повторного предзаполнения.
  2. 02Поднять базовый контур обслуживания. Непрерывное группирование запросов, разбиение предзаполнения на порции, маршрутизация с учётом кеша и зафиксированная матрица квантования по поколениям парка.
  3. 03Собрать свои среды и оценки. 20–50 задач из реальных отказов, проверка через компиляцию и исполнение, скрытый до момента оценки проверяющий код, приватный сплит и постоянно обновляемый конвейер задач.
  4. 04Взять дешёвые победы в вычислениях. Хирургия токенизатора под свою языковую смесь, маршрутизация и дистиллированная малая модель, уводящая массовый трафик с дорогой.
  5. 05Провести учение по замене базы. Не после того, как чужой релиз изменится, а по расписанию — с заложенными GPU-часами, неделями и критерием паритета на своей оценке.
  6. 06Написать план по запасным частям. Считать деградацию парка частью продуктовой стратегии, а не эксплуатационной рутиной.

Управлять этим стоит по короткому набору чисел, и ни одно из них не про качество модели: число экспериментов в неделю, стоимость одной принятой задачи, доля попаданий в префиксный кеш, доля трафика, обслуженного дешёвой моделью, время от появления трейса до появления соответствующей оценки и время замены базового чекпоинта в тестовом контуре.

Вопрос, который не планируют

Есть тема, которой нет ни в одной известной мне публичной стратегии: парк стареет и не заменяется. Ускорители поколения Ampere — это кремний 2020 года, у которого в текущих условиях нет обычного пути гарантийной замены. Значит, запас узлов, план перезапуска с контрольных точек на ненадёжном и невосполнимом оборудовании и допустимая доля выбывших узлов — это решения о будущих способностях компании, а не эксплуатационная рутина. Способности в 2029 году определит план по запасным частям, написанный сейчас.

Сюда же примыкает вопрос безопасности, который в публичной инженерной литературе почти не разобран: агент с доступом к терминалу внутри защищённого периметра. Политика исходящего трафика, обращение с секретами, перечень того, что модель вправе прочитать, и отдельный вопрос — становится ли сам контур обслуживания значимым объектом инфраструктуры. Готового правила здесь нет, и это стоит признавать, а не изображать решённым.

Выводы

Что стоит унести с собой

  1. 01«Сквозной» в России означает не предобучение с нуля, а замкнутый контур от трейса до выпуска: пять звеньев из шести локальны, шестое арендовано у чужого релиза открытых весов.
  2. 02Дефицит ускорителей ограничивает не достижимое качество, а число проходов по контуру; при цене GPU-часа примерно втрое выше зарубежной выигрывает тот, кто замыкает более узкий контур быстрее.
  3. 03Доктрина расходования вычислений важнее их объёма: сначала обслуживание, затем пост-тренинг и среды, затем токенизатор и данные; предобучение с нуля доказано в стране ровно одним игроком.
  4. 04Обучение с подкреплением — единственный крупный режим обучения, структурно терпимый к слабой сети, и именно поэтому он подходит фрагментированному парку лучше, чем предобучение.
  5. 05Обвязка даёт больше разброса результата, чем выбор модели, и слабая модель чувствительнее к её качеству — это слой, который стоит инженерного вкуса, а не ускорителей.
  6. 06Зависимость от чужих открытых весов четырёхкратная, и она снимается не риторикой о суверенитете, а отделением инвариантов от чекпоинта и регулярно проводимым учением по замене базы.
Источники

Первичные материалы, исследования и документация

  1. 01DeepSeek · DeepSeek-V3 Technical Report — таблица затрат: 2 664 тыс. GPU-часов предобучения против 5 тыс. на пост-тренинг; самоотчёт по финальному прогону.
  2. 02DeepSeek · Insights into DeepSeek-V3: Scaling Challenges and Hardware Reflections — какие архитектурные решения вынудил урезанный интерконнект: MLA, маршрутизация не более чем на 4 узла, FP8, коммуникационные ядра на PTX.
  3. 03DeepSeek · DeepSeek-R1 (Nature, 17 сентября 2025) — рецензированная работа: обучение с подкреплением поднимает AIME 2024 с 15,6% до 77,9%; стоимость этапа RL не включает базовую модель.
  4. 04Cottier et al. (Epoch AI) · The rising costs of training frontier AI models — рост стоимости финального прогона примерно в 2,4 раза в год; оборудование — 47–67% стоимости разработки.
  5. 05Cursor · Composer 1.5 — заявление компании: вычисления пост-тренинга превысили вычисления предобучения базовой модели.
  6. 06Khatri et al. · The Art of Scaling Reinforcement Learning Compute for LLMs — сигмоидные кривые масштабирования RL, предсказанные до прогона в 100 тыс. GPU-часов — RL становится планируемой статьёй бюджета.
  7. 07Gen-T Team (Т-Технологии) · T-pro 2.0 — единственный подробно опубликованный российский рецепт: база Qwen3-32B, хирургия токенизатора, SFT и DPO на 4×8 H100.
  8. 08Salute Developers · GigaChat family — семейство MoE, обученное с нуля; вычисления обучения ни для одной версии не раскрыты.
  9. 09Яндекс · Техрепорт Alice AI — прямое утверждение об инициализации весами Qwen3-235B; цифра «4 тыс. GPU» — бенчмарк коммуникационной библиотеки, а не размер обучающего кластера.
  10. 10Douillard et al. · DiLoCo — обучение с редкой синхронизацией: примерно в 500 раз меньше коммуникации при сопоставимом качестве.
  11. 11Douillard et al. · Streaming DiLoCo — сокращение объёма обмена в 400 раз и пиковой полосы в 8 раз на масштабе 1 млрд параметров.
  12. 12Epoch AI · How far can decentralized training over the internet scale? — необходимый противовес: распределённые прогоны примерно в 300 раз ниже фронтира, а методы сокращения обмена стоят качества.
  13. 13Prime Intellect · INTELLECT-3 — модель на 106 млрд параметров, дообученная поверх открытой базы на 512 H200 за два месяца; заявления компании.
  14. 14Yin et al. · Pangu Ultra на Ascend NPU — 52% MFU на 8192 NPU при межузловой сети всего 200 Гбит/с; показатели заявлены вендором.
  15. 15Huawei · Pangu Ultra MoE — честный контрапункт: 718 млрд параметров на 6000 NPU дают лишь 30% MFU.
  16. 16Huawei · CloudMatrix384 — обслуживание чужих открытых весов на ограниченном кремнии даёт публикуемые показатели там, где обучение не пошло.
  17. 17Stop Comparing LLM Agents Without Disclosing the Harness — дисперсия от обвязки 18,48 pp² против 2,37 pp² от модели — отношение 7,8; слабая модель чувствительнее к обвязке.
  18. 18Harness-Bench — разрыв 23,8 процентного пункта между обвязками на одних задачах и одном пуле моделей.
  19. 19Polar · обучение агентов поверх чужой обвязки — перехват на границе API модели поднимает Codex на SWE-bench Verified с 3,8% до 26,4% без изменения кода обвязки.
  20. 20Alibaba Qwen · Qwen3-Coder — 20 тысяч параллельных сред как ось масштабирования обучения агента; заявление команды.
  21. 21Chen et al. · SWE-Universe — 807 693 автоматически построенных проверяемых среды из реальных pull request.
  22. 22Prime Intellect · Scaling agentic RL — около 365 тыс. задач и 135 тыс. готовых образов; проверочный материал скрыт до момента оценки.
  23. 23Together AI · DeepSWE — 64 H100 за шесть дней дают 42,2% на SWE-bench Verified — счёт за вычисления скромный и разовый.
  24. 24Epoch AI · FAQ по средам обучения с подкреплением — цена задачи 200–2000 долларов, реплики продуктов дороже на порядки — среды это труд, а не FLOPs.
  25. 25OpenAI · Why we no longer evaluate SWE-bench Verified — загрязнение и некорректные задачи: более 60% из 138 проверенных сложных задач нерешаемы как сформулированы.
  26. 26Anthropic · Demystifying evals for AI agents — начинать с 20–50 задач из реальных отказов, разделять траекторию и результат, калибровать судей по экспертам.
  27. 27Databricks · coSTAR — два зеркальных контура — судьи калибруются людьми, агент чинится против судей; результаты — самоотчёт.
  28. 28GitHub · Офлайн-оценка GitHub MCP Server — контур улучшения, работающий на поверхности инструментов и не требующий обучения модели.
  29. 29Nebius · SWE-rebench — непрерывно обновляемый конвейер задач как ответ на загрязнение публичных наборов.
  30. 30Сбер · 1C Code Bench — компиляция и исполнение на реальной платформе 1С: у лучших зарубежных моделей около половины верных решений, российских моделей в таблице нет.
  31. 31Яндекс · SourceCraft Code Assistant — CLI поставляется со встроенным OpenCode под лицензией MIT — крупнейший локальный вендор выбрал адаптацию, а не свою обвязку.
  32. 32Anomaly · OpenCode — обвязка под MIT, не привязанная к одному поставщику модели.
  33. 33Разбор доступности GitHub и PyPI из российских сетей — по данным измерений OONI доля неудачных соединений с GitHub выросла с ~4% до 16% в мае 2026 года; агент наследует надёжность git clone и pip install.
  34. 34ComNews · Оценка российских инструментов разработки — средняя оценка 5,8 из 10 и около 70% респондентов, продолжающих параллельно использовать зарубежные платформы.
  35. 35Cloud.ru · Тарифы на GPU-ускоренные вычисления — единственный проверенный опубликованный российский прайс-лист; цена за GPU-час выводится из геометрии инстанса, а не указана напрямую.
  36. 36TOP500 · список за июнь 2026 года — пять российских систем совокупно около 69 PFlop/s — это молчание публичного реестра, а не измеренный потолок страны.
  37. 37Anthropic · Поддерживаемые страны — перечень стран обслуживания как регуляторный факт, определяющий доступность зарубежных агентных инструментов.
  38. 38GitHub · Торговые ограничения — условия распространения Copilot и Enterprise Server применительно к ограниченным направлениям.
  39. 39Yang et al. · SWE-smith — 50 тыс. задач, построенных программной поломкой существующих тестов в 128 репозиториях.
  40. 40Ai2 · OLMo 3 — раскрытые GPU-часы на кластере не более 1024 H100 и полный «поток модели» как отличающий актив вместо масштаба.
  41. 41Mistral AI · Анонс Mistral 7B — первая конкурентоспособная модель на полностью арендованных вычислениях; собственные мощности профинансированы лишь три года спустя.
  42. 42TII · Falcon-H1 — лаборатория с неограниченным доступом к железу выбрала эффективность параметров, а не их количество.
  43. 43OpenTelemetry · Семантические соглашения GenAI — переносимая схема полей трейсов агента и предупреждения о чувствительных данных.
Поделиться
TelegramLinkedIn