«Сквозной» — это не про предобучение, а про то, какой контур действительно замыкается
Начать стоит с вычёркивания. Слово «сквозной» обычно тянет за собой картинку полной вертикали от кремния до продукта, и именно эта картинка делает разговор бессмысленным. Публичная запись довольно скупа: в списке TOP500 за июнь 2026 года у России пять систем совокупно примерно на 69 PFlop/s — это машины поколений V100 и A100. Важно правильно прочитать это молчание: оно означает отсутствие публично измеренного кластера национального масштаба на более новых ускорителях, а не отсутствие таких ускорителей в стране.
Ещё скупее запись о том, на чём в России реально обучают. Единственные подробные раскрытия оборудования — это 96 ускорителей A100 для первой версии T-lite — модели на 8 млрд параметров — в 2024 году и четыре узла по восемь H100 на этапы SFT и DPO в рецепте T-pro 2.0. Оба числа описывают дообучение, а не предобучение. Семейство GigaChat обучено с нуля, но вычисления обучения не раскрыты ни для одной версии, поэтому соотношение «вычисления к качеству» посчитать невозможно.01Мне кажется важным не подменять здесь тезис: отсутствие публикации — не доказательство отсутствия мощностей. Разбирал в канале тренд-репорт RedMadRobot про российский GenAI, и там та же картина с другой стороны: новейшие ускорители официально недоступны, ставка сделана на собственные мощности, а с нуля учит по сути один игрок.Книжный куб · тренд-репорт про рынок GenAI в России
Если убрать предобучение, остаётся вполне рабочий контур: открытая база → пост-тренинг → обвязка и инструменты → и среды → трейсы → и снова пост-тренинг. Четыре его звена локальны. Пятое — чужой релиз открытых весов, и это зависимость, о которой ниже будет отдельный разговор. Ограничение по железу при этом бьёт не по достижимому качеству, а по числу проходов: единственный проверенный опубликованный российский прайс-лист даёт цену примерно втрое выше медианы нишевых зарубежных провайдеров и примерно в полтора раза выше прайс-листа крупного гиперскейлера. Это моё сопоставление публичных прайсов на июль 2026 года, а не отраслевой индекс: медиана считалась по открытым тарифам нишевых провайдеров, и при другой выборке отношение сдвинется. Втрое дороже эксперимент — это налог на количество итераций.
Класс доказательства для каждого числа
В этой теме половина публичных чисел — маркетинг, поэтому дальше каждое число стоит мысленно относить к одной из трёх колонок.
| Класс | Что сюда попадает | Что с этим делать |
|---|---|---|
| Первичный источник | Рецензированные работы, отчёты с раскрытыми числами, тексты лицензий, официальные тарифы и списки TOP500 | Можно строить вывод |
| Заявление поставщика | Показатели из собственных блогов и карточек моделей: ускорения, MFU, доли принятого кода, прирост производительности | Годится как направление, не как измерение |
| Сообщение по источникам | Публикации агентств и отраслевой прессы со ссылкой на неназванные источники: закупки, сроки, планы | Только как снимок рынка |
Доктрина расходования вычислений важнее их количества
Самое полезное число во всей теме компания DeepSeek опубликовала о себе сама. В отчёте по V3 таблица затрат выглядит так: предобучение — 2 664 тыс. GPU-часов, расширение контекста — 119 тыс., пост-тренинг — 5 тыс. Внутри одной модели соотношение примерно 500 к 1. Это самоотчёт, он описывает только финальный прогон и не включает предшествующие исследования и неудачные запуски. Но планировать надо именно по соотношению, а не по сумме: если вы не можете оплатить первую колонку, вся поверхность вашего продукта решается в третьей.02Джон Шульман в подкасте Cafe Cursor формулирует это ещё жёстче: по его мнению, ChatGPT-3.5 можно было собрать силами двух-трёх человек на паре машин с ускорителями, потому что дело было не в объёме вычислений, а в умном пост-тренинге. Разбирал этот выпуск в канале.Книжный куб · Джон Шульман про масштабирование RL
Дальше это подтверждается с двух сторон. В рецензированной работе о DeepSeek-R1 обучение с подкреплением поднимает результат на AIME 2024 с 15,6% до 77,9% — поверх уже существующей базовой модели и за долю её стоимости (сама база в эту стоимость не входит, и это надо произносить вслух). А в феврале 2026 года Cursor сообщил, что вычисления пост-тренинга Composer 1.5 превысили вычисления предобучения базовой модели. Инверсия стала явной.
Одновременно вход в предобучение дорожает: по оценке Epoch AI стоимость финального прогона растёт примерно в 2,4 раза в год. Это кривая, которая структурно исключает игрока без капитала уровня гиперскейлера — не потому, что он хуже, а потому, что билет дорожает быстрее любого правдоподобного роста закупок. Зато обучение с подкреплением перестало быть ремеслом: работа о масштабировании вычислений RL строит сигмоидные кривые и предсказывает результат прогона на 100 тыс. GPU-часов. Это превращает RL в планируемую статью бюджета.
Самая дешёвая победа при этом лежит не в обучении, а в токенизаторе. В рецепте T-pro 2.0 замена 34 тыс. низкочастотных нецирилличных токенов на кириллические при неизменном размере словаря снижает число токенов на слово с 3,12 до 2,38, а доля русских слов, укладывающихся в два токена, растёт с 38,2% до 60,1%. Это примерно на четверть меньше вычислений на одном и том же русском тексте — и на обучении, и на . Скидка выдаётся ровно в той валюте, которой не хватает.
- приоритет 1 — сервинг
- приоритет 2 — пост-тренинг и среды
- приоритет 3 — токенизатор и данные
- предобучение с нуля — только для того, кто уже показал прогон на десятках триллионов токенов
Архитектуру обучения выбирают по объёму обмена, а не только по качеству
Канонический пример того, как дефицит сети переезжает в архитектуру модели, снова даёт DeepSeek. В отдельной работе они описывают, что урезанная вдвое пропускная способность межускорительной шины была скомпенсирована не только сетью: появились латентное внимание, сокращающее кеш ключей и значений в несколько раз, ограничение маршрутизации эксперта не более чем четырьмя узлами, обучение в FP8 и коммуникационные ядра, написанные вручную и занимающие лишь 20 потоковых мультипроцессоров. Дефицит сети был отвечен в модели, а не только в фабрике.
Похожая история у Huawei. В Pangu Ultra плотная модель на 135 млрд параметров обучена на 8192 ускорителях Ascend при межузловой сети всего 200 Гбит/с, и заявленная утилизация превысила 52%. Но честный контрапункт публикует сама же компания: Pangu Ultra MoE на 718 млрд параметров и 6000 ускорителях даёт лишь 30%. Разреженность окупается не всегда, а показатели здесь — заявления вендора.
Отдельная и наиболее применимая линия — обучение с редкой синхронизацией. DiLoCo демонстрирует примерно в 500 раз меньше обмена при сопоставимом качестве, Streaming DiLoCo сокращает объём переданных бит в 400 раз, а пиковую полосу — в восемь. Соблазн объявить это решением проблемы велик, поэтому сразу противовес: по разбору Epoch AI распределённые прогоны находятся примерно в 300 раз ниже фронтира, а сами методы сокращения обмена стоят качества. Вывод узкий и потому полезный: редкая синхронизация — это способ занять фрагментированный парк пост-тренингом и работой среднего масштаба, а не способ дойти до фронтира предобучения. Лучше всего в этот режим укладывается обучение с подкреплением: обновления весов в нём редки, а эпизоды генерации независимы, поэтому слабая сеть между узлами перестаёт быть определяющим ограничением. Терпимость эта не уникальна — SFT малого масштаба и генерация дистилляционных данных так же нетребовательны к сети, — но из крупных режимов обучения именно RL выигрывает от неё больше всего.03Мне нравится, что здесь ограничение и решение совпали по форме. Обратную сторону этой терпимости хорошо видно в техрепорте GigaChat 3 Ultra, который я разбирал в канале: обучение большой разреженной модели упирается в дикий объём обмена между ускорителями, дисбаланс нагрузки по экспертам и контрольные точки за десяток терабайт.Книжный куб · техрепорт GigaChat 3 Ultra
На практике есть ещё одно жёсткое ограничение: доступные форматы квантования зависят от поколения ускорителя, а не от предпочтений инженера. На Ampere формат FP8 остаётся приёмом экономии памяти и не даёт арифметического ускорения, поэтому рабочий выбор там — INT8 и четырёхбитные веса. Смешанный парк означает, что для разных поколений придётся собирать разные артефакты одной и той же модели.
На нерасширяемом парке эффективность сервинга — продуктовое решение
Когда парк нельзя увеличить, каждый множитель эквивалентен закупке, которой не будет. Порядок величин задан двумя опубликованными результатами: страничное внимание даёт двух-четырёхкратный рост при той же задержке, а разбиение стадии предзаполнения на порции — от 2,6 до 5,6 раза больше обслуживаемой нагрузки под ограничением хвостовой задержки (2,6× на Mistral-7B, 5,6× на Falcon-180B). Это лишь нижняя оценка эффекта: стек, который всё ещё группирует запросы статически, уступает современной реализации в разы — речь не о нескольких процентах оптимизации.
Следующий по величине рычаг — маршрутизация с учётом кеша. В опубликованном бенчмарке llm-d точное знание о размещении префиксов снизило P90 задержки первого токена с 92,551 до 0,542 секунды по сравнению со случайной маршрутизацией: запросы с общим префиксом перестали разбрасываться по репликам и повторно проходить предзаполнение. Дальше идёт вынос кеша ключей и значений из быстрой памяти в оперативную и на диск; в прайс-листе DeepSeek кешированный токен стоит примерно в десять раз дешевле обычного. Это заявление поставщика о цене, а не измерение экономии вычислений на своём парке: на себестоимость собственного сервинга оно не переносится.
Две техники стоит применять осознанно, потому что вокруг них больше всего заблуждений. Спекулятивное декодирование прежде всего сокращает задержку отдельного ответа. Пока запросов мало и основной ускоритель недогружен, небольшая черновая модель предлагает сразу несколько следующих токенов, а большая модель проверяет их за один проход — пользователь быстрее получает продолжение. При высокой параллельности свободных вычислений уже нет: черновая модель и проверка конкурируют с обычным декодированием за тот же бюджет, поэтому общий объём обработанных запросов почти не растёт. Отсюда практический вывод: глубину спекуляции стоит увеличивать при пустой очереди ради отзывчивости и сокращать или отключать под нагрузкой, когда важнее пропускная способность.04Ровно то же видно и на масштабе одной машины: в статье про локальные модели, которую я разбирал в канале, спекулятивное декодирование ускоряло плотную модель примерно в полтора раза на коде и переводе, а на разреженной модели аккуратная раскладка тензоров давала примерно трёхкратный отрыв от наивного запуска на том же железе.Книжный куб · как выжать больше из локальных LLM
Разнесение стадий предзаполнения и декодирования по разным пулам рассчитано прежде всего на крупномасштабный сервинг. Авторы DistServe прямо отмечают, что при нескольких ускорителях или даже одном пространство конфигураций резко сужается и система с трудом улучшает распределение ресурсов. Поэтому для малого парка разумным умолчанием остаётся совмещённое размещение.
Здесь же лежит стратегическая асимметрия, которую стоит запомнить. Когда Huawei публиковала CloudMatrix384, показатели сервинга чужой открытой модели на собственном кремнии оказались вполне публикуемыми — при том что обучение на том же кремнии в тот же период давалось заметно хуже. Сервинг терпит слабую сеть, терпит перезапуски и масштабируется добавлением стоек. Крупное синхронное обучение не терпит ничего из этого. Поэтому для страны с ограниченным парком приоритетом становится сервинг: это первый слой, который реально можно целиком обеспечить локальными мощностями. Крупное обучение по-прежнему требует гораздо большего парка ускорителей и более сильного интерконнекта.
Обвязка даёт наибольшую отдачу: здесь решает качество инженерных решений, а не число ускорителей
Есть измерение, которое стоит держать в голове при любом разговоре о локальном стеке. В контролируемой сетке «три обвязки × три модели» дисперсия результата, вносимая , составила 18,48 pp² против 2,37 pp² у модели — отношение 7,8 по дисперсии, а не по баллам. В отдельном бенчмарке Harness-Bench разрыв между лучшей и худшей обвязкой на одних и тех же задачах и одном пуле моделей достигал 23,8 процентного пункта.
Но по-настоящему важна не сама величина, а асимметрия внутри неё: обе работы отмечают, что более сильные модели показывают меньший разброс между обвязками. Иначе говоря, слабая модель чувствительнее к качеству обвязки, а не наоборот. Для игрока, который заведомо работает не на фронтирной модели, это лучшая из возможных новостей: слой, где он может выиграть больше всего, стоит инженерного вкуса и совершенно не стоит вычислений.05Честный контрапункт: Ник Пэш из Cline утверждает ровно обратное — выигрывают способности модели, а умные надстройки над ней устарели. Разбирал его доклад в канале и думаю, что оба тезиса верны, просто в разных местах шкалы: на фронтире обвязки сходятся, а ниже фронтира именно обвязка и решает.Книжный куб · Cline о том, что модель побеждает обвязку
Один из крупнейших российских вендоров, к слову, уже проголосовал за этот вывод ногами. Yandex SourceCraft CLI не содержит проприетарной обвязки — в нём работает встроенный OpenCode под лицензией MIT, а инженерия компании ушла в интеграцию с собственными моделями, платформенными инструментами и навыками. Это сильный довод в пользу «адаптировать, а не писать заново» на уровне обвязки.
Что именно в обвязке определяет доступную ёмкость, показывает исследование TraceLab (Zhu et al., 2026): соотношение входа к выходу около 294 к 1, подавляющая часть входных токенов попадает в префиксный кеш, а доля попаданий заметно падает на новом сообщении пользователя по сравнению с продолжением после результата инструмента. Отсюда конкретный список решений, ни одно из которых не требует вычислений: стабильность и порядок префикса, форма и объём результатов инструментов, политика обрезки контекста, горизонт удержания кеша и между моделями разного размера. Наивная обрезка контекста уничтожает актив, на котором держится ёмкость.
Слой, о котором все забывают: субстрат
Агент, который собирает проект, ставит зависимости и запускает тесты, наследует надёжность git clone и pip install. В 2026 году это перестало быть теоретическим соображением: по данным независимых измерений доля неудачных соединений с крупнейшим хостингом кода из российских сетей выросла с примерно 4% до 16% в мае, а в июне на сутки стал недоступен основной репозиторий пакетов Python. Ответом отрасли стали зеркала пакетных хранилищ внутри страны. Вывод для проектирования простой: прежде чем настраивать качество обвязки, надо добиться, чтобы плоскости зависимостей и контейнеров, в которые бьют вызовы инструментов, разрешались детерминированно.
И сразу поправка к оптимизму: по опросу крупных заказчиков российские инструменты разработки получили среднюю оценку 5,8 из 10, а около 70% продолжают параллельно использовать зарубежные платформы. Корпоративный код не лежит ни чисто локально, ни чисто в отечественном контуре — он расщеплён, и обвязка, спроектированная под одну чистую среду, будет работать хуже заявленного.
Трейсы, эвалы и окружения — единственный актив, который нельзя арендовать
Веса моделей можно скачать, движок сервинга взять открытым, обвязку адаптировать. Трейсы собственного продукта, эвалы на собственных задачах и окружения, воспроизводящие собственную работу, нельзя ни купить, ни арендовать. Это единственный слой, где локальный игрок структурно сильнее любого внешнего поставщика — и именно поэтому его стоит строить первым.
Среда — вещь конкретная: снимок репозитория, формулировка задачи, скрытая до момента оценки проверяющая программа и награда. Публичная ось масштабирования сместилась именно сюда: от 20 тысяч параллельных сред у Qwen до 807 693 сред, автоматически построенных из реальных запросов на слияние. Экономика при этом удобна для игрока с дефицитом железа: по разбору Epoch AI задача стоит от 200 до 2000 долларов и это труд, а не вычисления, тогда как счёт за сам прогон скромен — в открытом эксперименте DeepSWE 64 ускорителя за шесть дней дали 42,2% на SWE-bench Verified. Корпус сред — актив постоянный и трудоёмкий, прогон — расход разовый и планируемый.
Отдельно стоит отметить работу Polar: обучение агента с подкреплением можно вести поверх чужой, немодифицированной обвязки, перехватывая обмен на границе API модели. В опубликованных замерах это подняло один из агентов на SWE-bench Verified с 3,8% до 26,4% без единой правки в коде обвязки. Практический смысл для локального игрока велик: владение обвязкой и владение обучением можно развязать.
Ценность собственных эвалов при этом растёт по внешней причине. В феврале 2026 года OpenAI перестала публиковать результаты на SWE-bench Verified: модели воспроизводили эталонную правку по одному идентификатору задачи, а из 138 проверенных сложных задач более 60% оказались нерешаемыми в том виде, в каком сформулированы. Публичный лидерборд перестал быть измерительным прибором — и это ровно тот аргумент, который поднимает ценность приватного, свежесобранного набора.
Русскоязычная часть картины подтверждает то же самое с другой стороны. В открытом стенде для 1С задачи компилируются и исполняются на реальной платформе, и лучшие зарубежные модели решают около половины; российских моделей в таблице нет вовсе. Домен, где у локального игрока больше всего данных, — это домен, где любая модель слабее всего. Такое расхождение и есть определение возможности.06Здесь стоит остановиться: проверка через компиляцию и исполнение на настоящей платформе — самый дешёвый способ получить честную награду, её не надо ни у кого покупать и нельзя загрязнить чужим набором данных. Ровно так устроен и Cline-Bench, который я разбирал в канале: снимок репозитория, настоящий запрос пользователя и проверки, взятые из кода, который действительно уехал в продакшен.Книжный куб · Cline-Bench и фабрика сред для RL
Зависимость от открытых весов: назвать, оценить и отрепетировать замену
Тезис, который индустрия проговаривает неохотно, опубликован самими компаниями. В техрепорте Alice AI прямо сказано, что обучение ведётся поверх инициализации весами Qwen3-235B и что этот вариант выбран сознательно вместо обучения с нуля. Т-Технологии никогда этого и не скрывали.
Существеннее самого факта то, что зависимость не одинарная. В опубликованном рецепте T-pro 2.0 чужие открытые веса появляются минимум четырежды: как базовый чекпоинт, как учитель, которым перегенерированы ответы в обучающем наборе, как инициализация модели наград и как черновая модель для спекулятивного декодирования. Прекращение публикации открытых весов сломало бы не одну вещь, а четыре.07Это давняя и сознательная стратегия, а не случайность. В отчёте об обучении T-lite и T-pro, который я разбирал в канале, всё сказано прямым текстом: смысл продолженного предобучения в том, чтобы дообучать уже сильные открытые модели, тратя на порядки меньше ресурсов, чем создатели этих моделей.Книжный куб · отчёт об обучении T-lite и T-pro
Юридический слой при этом создаёт меньше риска, чем принято думать, — и это стоит сказать честно, потому что рынок обычно боится не того. Ведущие открытые семейства — например, Qwen3 под Apache 2.0 и DeepSeek-R1 под MIT — распространяются по всемирным лицензиям без географических ограничений. Зато встречается обратная асимметрия: открытые веса YandexGPT 5 Lite опубликованы под собственной лицензией. После 10 миллионов выходных токенов в месяц она требует в течение 30 дней обратиться к Яндексу и согласовать дальнейшие условия. Если за этот срок не обратиться или не договориться, лицензии аннулируются, а соглашение прекращает действовать. То есть локальная «открытость» бывает жёстче зарубежной, и читать надо текст, а не ярлык.
Настоящую цену зависимости определяет не лицензия, а регуляторная категория. Законопроект № 1271570-8 различает модель, для которой требуется полная воспроизводимость всего цикла, и модель, в которой допускаются иностранные компоненты под открытыми лицензиями. Ключевые определения — считаются ли веса «компонентом» и признаётся ли конкретная лицензия «открытой» — на момент публикации отнесены к подзаконным актам, которых ещё нет. Практический смысл: старт с чужой базы не дисквалифицирует, но решение по этим определениям способно поменять категорию модели без единого технического изменения. Похожий прецедент уже есть: в южнокорейском проекте Sovereign AI Foundation Model команду Naver Cloud не допустили во второй этап, поскольку комиссия сочла её модель не соответствующей критериям технологической независимости — включая свободу от лицензионных ограничений и внешнего контроля.
У правового триггера есть свойство, которое легко потерять при планировании запасных вариантов: он срабатывает не по вендору, а по классу. Решение о статусе лицензии в логике законопроекта дисквалифицирует не конкретный чекпоинт, а весь класс иностранных открытых баз разом. Обе базы, названные выше, — Qwen и DeepSeek — принадлежат одному классу и одной юрисдикции происхождения, поэтому их риски коррелированы почти полностью: событие, которое закрывает первую, в тот же день закрывает и вторую. Запасная база того же класса страхует от технического отказа — смены курса апстрима, деградации релиза, — но не от правового: против него две иностранные базы дают не резерв, а иллюзию резерва.
Учения по замене базы
Из всего перечисленного следует не риторика, а упражнение. План замены базы, который ни разу не выполняли, — это не план, а надежда.
- рецепт пост-тренинга написан так, что не зависит от конкретного чекпоинта: токенизатор, данные, среды, эвалы и стек сервинга отделены от базы;
- вторая база держится прогретой заранее — не как идея, а как проходящая сборка;
- минимум один прогон в год идёт на базе другого класса — на отечественных открытых весах, со всеми сделанными выше оговорками про их лицензии и с честной ценой в виде более долгого возврата к паритету; если такой прогон невозможен, остаточный правовой риск явно помечается как непокрытый;
- заложены конкретные GPU-часы и конкретные недели на возврат к паритету;
- паритет измеряется на собственном русскоязычном эвале, а не на публичном лидерборде;
- триггером считается и правовое событие тоже, а не только техническое — решение о статусе лицензии наступает мгновенно и без предупреждения.
У учения должна быть и цена — по той же логике, по которой выше оценены среды и RL-прогоны. Точную цифру даст только собственная смета, но порядок ясен: прогон рецепта пост-тренинга на второй базе — это обычный цикл дообучения среднего масштаба, сопоставимый с уже раскрытыми этапами таких рецептов, а не второе предобучение. Важно не число само по себе, а то, что оно стоит отдельной строкой бюджета и повторяется ежеквартально: непосчитанное учение первым и вычеркнут из плана.
Чего не строить — и почему эти ставки не сработают
При дефиците вычислений неудачная ставка отнимает ресурсы у более сильной. Поэтому программе нужен не только список приоритетов, но и явный список решений, в которые мы не вкладываемся, — с объяснением причины и рабочей альтернативой.
| Соблазн | Почему не сработает | Что делать вместо |
|---|---|---|
| Свой ускоритель | Кремния нет: публично известны техпроцесс и рамки энергопотребления, но не показатели производительности | Планировать на существующем парке и на открытых движках сервинга |
| Предобучение с нуля | Входной билет дорожает быстрее любого правдоподобного роста капитальных затрат | Пост-тренинг поверх открытой базы плюс собственные среды |
| Зарубежная аренда как «своя» ёмкость | Рублёвый прайс-лист не означает размещения внутри страны, а ёмкость вне юрисдикции не может быть якорем контура | Считать локальной только ту ёмкость, которую видно в своей юрисдикции |
| Приёмы гиперскейла на малом парке | Разнесение стадий, самая большая открытая разреженная модель и спекуляция фиксированной глубины на загруженном парке | Совмещённое размещение, порционная обработка контекста и маршрутизация с учётом кеша |
| Зарубежный SaaS для трейсов | Прямое столкновение с требованием к стадии сбора персональных данных | Своё хранилище, деидентификация на входе, короткое окно хранения |
| Гонка за публичным лидербордом | Загрязнение и некорректные задачи: по итогам собственного аудита OpenAI перестала публиковать результаты SWE-bench Verified | Свежесобранный приватный набор на своих репозиториях и инцидентах |
Отдельно про отечественное железо, потому что вокруг него больше всего ожиданий. Публично известны техпроцесс и рамки энергопотребления анонсированных решений, но данных об измеренной производительности и пропускной способности памяти нет. Этого достаточно, чтобы отнести их к решениям для периферийного инференса, но недостаточно для содержательного сравнения с доступными ускорителями. Пока нет открытых данных, позволяющих рассчитывать, что российские решения смогут использоваться для обучения крупных моделей до конца десятилетия. Поэтому стратегию нужно строить на доступном железе, а не на обещаниях из дорожных карт.08Важно, что барьер здесь не только в кремнии. В докладе с CodeFest про железо для нейросетей, который я разбирал в канале, хорошо показано: монополия NVIDIA держится на софте — экосистему CUDA строили двадцать лет, Flash Attention на картах AMD появился на год позже, а потребительские карты не объединить в кластер для обучения эффективно: быстрых межкарточных линков у них нет.Книжный куб · куда катится железо для нейронок
Организация, программа и вопрос, который не планируют
Разделение ответственности удобнее описывать не логотипами, а решением «своё или арендованное». Своими остаются два слоя: эвалы, трейсы и среды — и обвязка вместе с инструментами и . Арендованными остаются базовые веса, предобучение и апстрим движка сервинга. Логика разделения проста: чужие эвалы, трейсы, среды и обвязка не заменят знания о собственных задачах, поэтому эти слои нужно создавать внутри. Базовые веса, предобучение и апстрим сервинга уже доступны извне; воспроизводить их с нуля при дефиците ускорителей невыгодно.
Ломается это по-разному в зависимости от размера. На полусотне инженеров первым отказывает измерение: все поставляют, никто не меряет, а эвалы и инфраструктура трейсов делаются последними. На пяти сотнях отказывает другое — граница прав песочницы, политика квот на ускорители и доля попаданий в префиксный кеш, которая обваливается, как только маршрутизация фрагментируется между командами. Обе поломки организационные, и обе дешевле предупредить, чем чинить.
Минимальная программа на год
- 01Измерить, а не закупать. Инструментировать агентные трейсы с записью внутри страны и деидентификацией на входе, измерить фактическую долю попаданий в префиксный кеш и долю повторного предзаполнения.
- 02Поднять базовый контур сервинга. Непрерывное группирование запросов, разбиение предзаполнения на порции, маршрутизация с учётом кеша и зафиксированная матрица квантования по поколениям парка.
- 03Собрать свои среды и эвалы. 20–50 задач из реальных отказов, проверка через компиляцию и исполнение, скрытый до момента оценки проверяющий код, приватный сплит и постоянно обновляемый конвейер задач.
- 04Взять дешёвые победы в вычислениях. Хирургия токенизатора под свою языковую смесь, маршрутизация и дистиллированная малая модель, уводящая массовый трафик с дорогой.
- 05Провести учение по замене базы. Не после того, как чужой релиз изменится, а по расписанию — с заложенными GPU-часами, неделями и критерием паритета на своём эвале.
- 06Написать план по запасным частям. Считать деградацию парка частью продуктовой стратегии, а не эксплуатационной рутиной.
Управлять этим стоит по короткому набору чисел, и ни одно из них не про качество модели: число экспериментов в неделю, стоимость одной принятой задачи, доля попаданий в префиксный кеш, доля трафика, обслуженного дешёвой моделью, время от появления трейса до появления соответствующего эвала и время замены базового чекпоинта в тестовом контуре.
Вопрос, который не планируют
Есть тема, которой нет ни в одной известной мне публичной стратегии: парк не просто стареет — он отстаёт от движущейся технологической базы. Ampere и A100 вышли в 2020 году, Hopper и H100 — в 2022-м, Blackwell — в 2024-м, а Vera Rubin вошла в серийное производство в 2026-м. За шесть лет ориентир для крупных AI-систем сменился трижды, тогда как у имеющегося парка в текущих условиях нет обычного пути гарантийной замены.
Разрыв измеряется не только в TFLOPS. Hopper принёс FP8 и четвёртое поколение NVLink, Blackwell — FP4 и пятое, Vera Rubin — HBM4 и шестое. Вместе с поколением меняются форматы квантования, ядра, объём и пропускная способность памяти, а также ожидаемая топология — от отдельного ускорителя к системе масштаба стойки. Поэтому сборка, оптимизированная под Blackwell или Vera Rubin, может потребовать отдельного пути отката для эффективной работы на Ampere или Hopper.
Планировать нужно по поколениям: какие модели остаются на Ampere, какие задачи имеет смысл переносить на Hopper и как артефакты из мира Blackwell и Vera Rubin будут упрощаться под доступный парк. Запас узлов, возврат с контрольных точек, допустимая доля выбывших ускорителей, запасные форматы квантования и ядра — это решения о будущих способностях компании, а не эксплуатационная рутина. Способности в 2029 году определит план миграции и запасных частей, написанный сейчас.
Сюда же примыкает вопрос безопасности, который в публичной инженерной литературе почти не разобран: агент с доступом к терминалу внутри защищённого периметра. Политика исходящего трафика, обращение с секретами, перечень того, что модель вправе прочитать, и отдельный вопрос — становится ли сам контур сервинга значимым объектом инфраструктуры. Готового правила здесь нет, и это стоит признавать, а не изображать решённым.
В России есть игрок, способный вести предобучение с нуля: команда GigaChat описывает своё семейство моделей именно так. Но это возможность масштаба крупнейших компаний, а не реалистичный критерий сквозности для любого локального игрока. Для большинства команд сквозность означает замкнуть контур от трейса до выпуска целиком внутри своей юрисдикции — и получить преимущество там, где оно не покупается ускорителями: в средах, эвалах, контрактах инструментов и скорости, с которой реальный отказ превращается в безопасное улучшение. Разница между стратегией и лозунгом здесь ровно одна: названа ли зависимость и отрепетирована ли её замена.
Что стоит унести с собой
- 01«Сквозной» в России означает не предобучение с нуля, а замкнутый контур от трейса до выпуска: предобучение с нуля доказано в стране ровно одним игроком, а дефицитные вычисления идут сначала в сервинг, затем в пост-тренинг и среды, и только потом в токенизатор и данные.
- 02Дефицит ускорителей ограничивает не достижимое качество, а число проходов по контуру; при цене GPU-часа примерно втрое выше медианы нишевых зарубежных провайдеров выигрывает тот, кто замыкает более узкий контур быстрее.
- 03Обучение с подкреплением структурно терпимо к слабой сети — обновления разрежены, а эпизоды независимы, — и потому фрагментированному парку оно подходит лучше, чем предобучение.
- 04Обвязка даёт больше разброса результата, чем выбор модели, и слабая модель чувствительнее к её качеству — это слой, который стоит инженерного вкуса, а не ускорителей.
- 05Зависимость от чужих открытых весов четырёхкратная, и она снимается не риторикой о суверенитете, а отделением инвариантов от чекпоинта и регулярно проводимым учением по замене базы.
Первичные материалы, исследования и документация
Обучение и рецепты
- DeepSeek · DeepSeek-V3 Technical Reportтаблица затрат: 2 664 тыс. GPU-часов предобучения против 5 тыс. на пост-тренинг; самоотчёт по финальному прогону
- DeepSeek · Insights into DeepSeek-V3: Scaling Challenges and Hardware Reflectionsкакие архитектурные решения вынудил урезанный интерконнект: MLA, маршрутизация не более чем на 4 узла, FP8, коммуникационные ядра на PTX
- DeepSeek · DeepSeek-R1 (Nature, 17 сентября 2025)рецензированная работа: обучение с подкреплением поднимает AIME 2024 с 15,6% до 77,9%; стоимость этапа RL не включает базовую модель
- DeepSeek · лицензия DeepSeek-R1MIT: всемирная разрешительная лицензия для кода и весов модели
Прочие источники
- Cottier et al. (Epoch AI) · The rising costs of training frontier AI modelsрост стоимости финального прогона примерно в 2,4 раза в год; оборудование — 47–67% стоимости разработки
- Cursor · Composer 1.5заявление компании: вычисления пост-тренинга превысили вычисления предобучения базовой модели
- Khatri et al. · The Art of Scaling Reinforcement Learning Compute for LLMsсигмоидные кривые масштабирования RL, предсказанные до прогона в 100 тыс. GPU-часов — RL становится планируемой статьёй бюджета
- Gen-T Team (Т-Технологии) · T-pro 2.0единственный подробно опубликованный российский рецепт: база Qwen3-32B, хирургия токенизатора, SFT и DPO на 4×8 H100
- Государственная Дума · законопроект № 1271570-8категории суверенной и национальной моделей: полный российский цикл против допустимости иностранных компонентов под открытыми лицензиями
- Министерство науки и ИКТ Республики Корея · результаты первого этапа Sovereign AI Foundation Modelофициальное объяснение, почему Naver Cloud не прошла во второй этап: модель не соответствовала критериям технологической независимости
- Salute Developers · GigaChat familyсемейство MoE, обученное с нуля; вычисления обучения ни для одной версии не раскрыты
- Douillard et al. · DiLoCoобучение с редкой синхронизацией: примерно в 500 раз меньше коммуникации при сопоставимом качестве
- Douillard et al. · Streaming DiLoCoсокращение объёма обмена в 400 раз и пиковой полосы в 8 раз на масштабе 1 млрд параметров
- Epoch AI · How far can decentralized training over the internet scale?необходимый противовес: распределённые прогоны примерно в 300 раз ниже фронтира, а методы сокращения обмена стоят качества
- Prime Intellect · INTELLECT-3модель на 106 млрд параметров, дообученная поверх открытой базы на 512 H200 за два месяца; заявления компании
- Yin et al. · Pangu Ultra на Ascend NPU52% MFU на 8192 NPU при межузловой сети всего 200 Гбит/с; показатели заявлены вендором
- Huawei · Pangu Ultra MoEчестный контрапункт: 718 млрд параметров на 6000 NPU дают лишь 30% MFU
- Huawei · CloudMatrix384сервинг чужих открытых весов на ограниченном кремнии даёт публикуемые показатели там, где обучение не пошло
- Stop Comparing LLM Agents Without Disclosing the Harnessдисперсия от обвязки 18,48 pp² против 2,37 pp² от модели — отношение 7,8; слабая модель чувствительнее к обвязке
- Harness-Benchразрыв 23,8 процентного пункта между обвязками на одних задачах и одном пуле моделей
- Zhu et al. · TraceLab: Characterizing Coding Agent Workloads for LLM Servingоколо 4,3 тыс. сессий Claude Code и Codex: 95,7% входных токенов попадают в префиксный кеш, а вход превышает выход примерно в 294 раза
- Polar · обучение агентов поверх чужой обвязкиперехват на границе API модели поднимает Codex на SWE-bench Verified с 3,8% до 26,4% без изменения кода обвязки
- Alibaba Qwen · Qwen3-Coder20 тысяч параллельных сред как ось масштабирования обучения агента; заявление команды
- Chen et al. · SWE-Universe807 693 автоматически построенных проверяемых среды из реальных запросов на слияние
- Prime Intellect · Scaling agentic RLоколо 365 тыс. задач и 135 тыс. готовых образов; проверочный материал скрыт до момента оценки
- Together AI · DeepSWE64 H100 за шесть дней дают 42,2% на SWE-bench Verified — счёт за вычисления скромный и разовый
- Epoch AI · FAQ по средам обучения с подкреплениемцена задачи 200–2000 долларов, реплики продуктов дороже на порядки — среды это труд, а не FLOPs
- OpenAI · Why we no longer evaluate SWE-bench Verifiedзагрязнение и некорректные задачи: более 60% из 138 проверенных сложных задач нерешаемы как сформулированы
- Anthropic · Demystifying evals for AI agentsначинать с 20–50 задач из реальных отказов, разделять траекторию и результат, калибровать судей по экспертам
- Databricks · coSTARдва зеркальных контура — судьи калибруются людьми, агент чинится против судей; результаты — самоотчёт
- GitHub · Офлайн-эвал GitHub MCP Serverконтур улучшения, работающий на поверхности инструментов и не требующий обучения модели
- Nebius · SWE-rebenchнепрерывно обновляемый конвейер задач как ответ на загрязнение публичных наборов
- Яндекс · SourceCraft Code AssistantCLI поставляется со встроенным OpenCode под лицензией MIT — один из крупнейших локальных вендоров выбрал адаптацию, а не свою обвязку
- ComNews · Оценка российских инструментов разработкисредняя оценка 5,8 из 10 и около 70% респондентов, продолжающих параллельно использовать зарубежные платформы
- NVIDIA · выход Ampere A100A100 на архитектуре Ampere вышел в серийное производство в мае 2020 года
- NVIDIA · выход Hopper H100Hopper и H100 представлены в марте 2022 года; FP8 Transformer Engine и NVLink четвёртого поколения
- NVIDIA · выход платформы BlackwellBlackwell представлен в марте 2024 года; FP4 и NVLink пятого поколения меняют требования к оптимизированному стеку
- NVIDIA · платформа Vera Rubinв марте 2026 года семь компонентов Vera Rubin объявлены в серийном производстве; NVLink шестого поколения связывает платформу масштаба стойки
- NVIDIA · устройство платформы Vera Rubinтехническое описание Rubin GPU с HBM4, NVLink шестого поколения и перехода от отдельного ускорителя к стойке как единице вычисления
- Anthropic · Поддерживаемые страныперечень стран обслуживания как регуляторный факт, определяющий доступность зарубежных агентных инструментов
- Yang et al. · SWE-smith50 тыс. задач, построенных программной поломкой существующих тестов в 128 репозиториях
- Ai2 · OLMo 3раскрытые GPU-часы на кластере не более 1024 H100 и полный «поток модели» как отличающий актив вместо масштаба
- Mistral AI · Анонс Mistral 7Bпервая конкурентоспособная модель на полностью арендованных вычислениях; собственные мощности профинансированы лишь три года спустя
- TII · Falcon-H1лаборатория с неограниченным доступом к железу выбрала эффективность параметров, а не их количество
- OpenTelemetry · Семантические соглашения GenAIпереносимая схема полей трейсов агента и предупреждения о чувствительных данных
Лицензии
- Alibaba Qwen · лицензия Qwen3-32BApache 2.0: всемирная разрешительная лицензия без порога использования и географических ограничений
- Яндекс · лицензия YandexGPT 5 Liteпосле 10 млн выходных токенов в месяц требуется за 30 дней обратиться к Яндексу и согласовать дальнейшие условия; иначе лицензии аннулируются
Инфраструктура и доступность
- Яндекс · Техрепорт Alice AIпрямое утверждение об инициализации весами Qwen3-235B; цифра «4 тыс. GPU» — бенчмарк коммуникационной библиотеки, а не размер обучающего кластера
- Сбер · 1C Code Benchкомпиляция и исполнение на реальной платформе 1С: у лучших зарубежных моделей около половины верных решений, российских моделей в таблице нет
- Anomaly · OpenCodeобвязка под MIT, не привязанная к одному поставщику модели
- Разбор доступности GitHub и PyPI из российских сетейпо данным измерений OONI доля неудачных соединений с GitHub выросла с ~4% до 16% в мае 2026 года; агент наследует надёжность клонирования репозиториев и установки зависимостей
- GitHub · Торговые ограниченияусловия распространения GitHub Copilot и GitHub Enterprise Server применительно к ограниченным направлениям
Сервинг
- Kwon et al. · PagedAttention (vLLM)рост пропускной способности в 2–4 раза при той же задержке относительно FasterTransformer и Orca; выигрыш тем больше, чем длиннее последовательности и крупнее модель
- Agrawal et al. · Sarathi-Serveразбиение предзаполнения на порции под ограничением хвостовой задержки: 2,6× на Mistral-7B (один A100), 3,7× на Yi-34B (два A100), 5,6× на Falcon-180B с конвейерным параллелизмом
- Zhong et al. · DistServeразнесение предзаполнения и декодирования для крупномасштабного сервинга; авторы отдельно предупреждают, что при нескольких ускорителях или даже одном пространство решений слишком ограничено
- llm-d · KV-Cache Wins You Can Seeбенчмарк проекта на 8 подах vLLM: точная маршрутизация по префиксному кешу снизила P90 задержки первого токена с 92,551 до 0,542 с относительно случайной
Вычисления и цены
- Cloud.ru · Тарифы на GPU-ускоренные вычисленияединственный проверенный опубликованный российский прайс-лист; цена за GPU-час выводится из геометрии инстанса, а не указана напрямую
- TOP500 · список за июнь 2026 годапять российских систем совокупно около 69 PFlop/s — это молчание публичного реестра, а не измеренный потолок страны