К основному содержимому
ко всем лонгридам
Лонгрид#MLSystems#PlatformEngineering

Фронтир инференса LLM: десять направлений, которые ещё не доказаны, но обещают кратный выигрыш

Предыдущий разбор закончился на том, что инференс стал распределённой системой из движка, KV-контура, маршрутизатора и планировщика мощности. Этот текст — о следующем витке: что исследователи и вендоры обещают после разделения стадий, какие из этих обещаний уже измерены на чужих трейсах, а какие пока держатся на препринте и пресс-релизе. Для каждого из десяти направлений — механизм, числа вместе с их базой сравнения и честная ступень зрелости.

7 сентября 2026≈ 72 минутыпервичные источники ↓

Исследования, документация и состояние движков проверены по источникам на 22 августа 2026 года. Числа из работ относятся только к указанным авторами моделям, ускорителям, распределениям входа и базам сравнения. Результаты компаний помечены как заявления поставщика; препринты 2026 года — сигнал направления, а не сложившийся стандарт. Ни одно направление здесь не рекомендуется к внедрению само по себе: статья описывает ставки, а не решения.

01

Фронтир — это ставки, а не стандарты

Предыдущая статья была о норме: непрерывные пакеты, страничная KV-память, префиксный кеш, порционная обработка контекста, разделение стадий. У нормы есть удобное свойство — её можно измерить на своём трейсе и купить готовой в открытом движке. У фронтира свойства другие. Его результаты получены на чужих моделях, чужих ускорителях и, как правило, против удобной авторам базы сравнения. Поэтому прежде чем перечислять направления, нужно договориться, как читать заявления о них.

Полезно держать в голове лестницу из шести ступеней. Идея существует как препринт или демонстрация. Другая команда воспроизвела эффект или измерила его границы. Функция появилась в открытом движке — vLLM, SGLang или TensorRT-LLM. Есть публичный отчёт об эксплуатации у одной компании. Есть несколько компаний с разными нагрузками. Наконец, приём стал ожиданием по умолчанию, и его отсутствие требует объяснения. PagedAttention прошёл все шесть ступеней за два года. Разделение стадий в августе 2026 года стоит между третьей и четвёртой: в документации vLLM функция по-прежнему помечена как экспериментальная, а у Moonshot и DeepSeek она в эксплуатации. Переход с первой ступени сразу на пятую не случается, и каждая ступень — отдельное доказательство.

схема 01 · лестница зрелости заявлений об инференсе
Лестница зрелости заявлений об инференсеКАЖДАЯ СТУПЕНЬ — ОТДЕЛЬНОЕ ДОКАЗАТЕЛЬСТВОИДЕЯпрепринт, демоВОСПРОИЗВЕДЕНОдругой командойВ ОТКРЫТОМ ДВИЖКЕvLLM · SGLang · TRT-LLMВ ЭКСПЛУАТАЦИИу одной компанииУ МНОГИХразные нагрузкиСТАНДАРТожидание по умолчаниюВПРАВО ПАДАЕТ РИСК, НО ДОРОЖАЕТ ДОКАЗАТЕЛЬСТВОКАКОЙ РЕСУРС ЭКОНОМИТ?байты · шаги · простои · ваттыПРОТИВ КАКОЙ БАЗЫ?та же модель, трейс и SLOЧТО ДОЛЖНО СТАТЬ ПРАВДОЙ?железо · ядра · качествоКратный выигрыш на первой ступени — гипотеза, на пятой — инженерный факт
Ступень
1 · Идея
Что есть
Препринт, демонстрация, заявление вендора
Чего это не доказывает
Числа получены одной командой на своей конфигурации
Ступень
2 · Воспроизведено
Что есть
Другая команда повторила эффект или измерила его границы
Чего это не доказывает
Появились первые отрицательные результаты
Ступень
3 · В открытом движке
Что есть
Функция есть в vLLM, SGLang или TensorRT-LLM
Чего это не доказывает
Её можно включить на своём трейсе; часто ещё с пометкой «экспериментально»
Ступень
4 · В эксплуатации у одной компании
Что есть
Есть публичный отчёт о развёртывании с числами
Чего это не доказывает
Условия компании могут не совпадать с вашими
Ступень
5 · У многих
Что есть
Несколько компаний с разными нагрузками
Чего это не доказывает
Выигрыш воспроизводится при разных профилях
Ступень
6 · Стандарт
Что есть
Ожидание по умолчанию, как непрерывные пакеты
Чего это не доказывает
Отсутствие функции требует объяснения

К любому заявлению есть три вопроса. Первый: какой ресурс экономится — байты, прочитанные из памяти, последовательные шаги, простой ускорителя или ватты. Приём, экономящий не тот ресурс, который ограничивает вашу нагрузку, даст ноль. Второй: против какой базы. «В десять раз быстрее» против движка без кеша и «в 1,2 раза» против настроенного vLLM могут описывать одну и ту же систему. Третий: что должно стать правдой, чтобы выигрыш случился у вас, — ядра под формат, железо нужного поколения, качество модели на ваших задачах.

Отдельная ловушка — токены в секунду на одного пользователя против на ускоритель. Спекулятивное декодирование показывает её лучше всего. EAGLE 3.1 на Kimi K2.6 (GB200, май 2026 года) даёт 2,03× при одном потоке и 1,66× при шестнадцати; P-EAGLE против EAGLE-3 — 1,55–1,69× при одном потоке и всего 1,05–1,25× при 64. Почти каждое «в N раз» на фронтире получено при малой параллельности, а платформенная команда живёт при большой.

Десять направлений ниже идут от модели к дата-центру: как модель считает (архитектуры и параллельная генерация), как кластер режет работу (разделение глубже стадий), где живёт состояние (KV-кеш как хранилище), в каких числах хранятся веса (FP4 и ниже), на каком кремнии (за пределами GPU), какие нагрузки всё это обслуживают (рассуждения, агенты, мультимодальность) и что ограничивает сверху (энергия, управление, доверие). Последний раздел собирает их в одну карту зрелости.

02

Архитектуры меняют физику генерации

Весь стек сервинга из предыдущей статьи построен вокруг одного свойства трансформера: состояние запроса растёт на блок KV с каждым токеном и читается целиком на каждом шаге генерации. Страничная память, префиксный кеш, передача KV между пулами — инструменты для растущего объекта. Фронтир 2025–2026 годов атакует само свойство двумя способами: сделать состояние фиксированным или читать не всё.

Первый способ — и модели пространства состояний, где на запрос приходится состояние фиксированного размера, которое перезаписывается, а не накапливается. Рабочим слоем гибридов стал Gated DeltaNet (NVIDIA, декабрь 2024 года): гейт забывания плюс дельта-правило. На нём построены Qwen3-Next (сентябрь 2025 года: три слоя DeltaNet на один слой внимания с гейтом), Qwen3.5-397B-A17B (февраль 2026 года, тот же рецепт и контекст в миллион токенов), Kimi Linear (октябрь 2025 года, вариант KDA, 3:1 с MLA) и Kimi K3 (июль 2026 года: 93 слоя, из них 69 KDA и 24 MLA, 2,8 триллиона параметров при примерно 104 миллиардах активных). NVIDIA идёт той же дорогой через Mamba-2: Nemotron-H (апрель 2025 года), Nemotron 3 Nano (декабрь 2025 года: 23 слоя Mamba-2, 6 внимания и 23 MoE) и Nemotron 3 Ultra (июнь 2026 года, 550B/55B). IBM Granite 4.0 держит соотношение 9:1, Falcon-H1 кладёт оба типа голов в один слой. Mamba-3 (март 2026 года) и Gated DeltaNet-2 (май 2026 года) пока остаются препринтами.

Единственное контролируемое сравнение одинакового размера дал Kimi Linear: 48B с 3B активных против такой же модели на MLA — KV-кеш меньше на 75%, время на токен на контексте в миллион лучше в 6,3 раза, на 512K — в 2,2 раза, а на 128K выигрыш незначителен; RULER-128K — 84,3 против 81,3. Остальные множители — вендорские и составные. «В десять раз выше пропускная способность на контексте больше 32K» у Qwen3-Next измерено против Qwen3-32B и смешивает MoE, предсказание нескольких токенов и саму архитектуру внимания. «До 3,3×» у Nemotron 3 Nano против Qwen3-30B-A3B получено на одном H200 при 8K входа и 16K выхода в FP8. «Около 6×» у Nemotron 3 Ultra против GLM-5.1 и Kimi K2.6 превращается в 1,6× против Qwen3.5, которая сама гибрид, — и при разных серверных стеках. На длинном контексте картина неоднозначна: Qwen3.5 даёт RULER 80,3 на миллионе против 84,5 у Qwen3-235B с полным вниманием — гибрид выигрывает до 256K и уступает на 512K и выше.

Второй способ — : состояние растёт, но на каждом шаге читается лишь отобранное подмножество. NSA (февраль 2025 года) показала 11,6× на генерации при 64K против FlashAttention-2 на A100; MoBA от Moonshot обслуживает длинный контекст Kimi. DeepSeek Sparse Attention в V3.2-Exp (29 сентября 2025 года) ввела лёгкий индексатор, который отбирает 2048 токенов под MLA, — сложность O(L·k) вместо O(L²), качество «на уровне V3.1-Terminus», а цена API в тот же день снижена более чем вдвое; DSA переняла GLM-5 (февраль 2026 года). DeepSeek-V4 (апрель 2026 года) пошла дальше: сжатое разреженное и сильно сжатое внимание вместе дают на миллионе токенов 27% операций и 10% KV-кеша от V3.2, а KV-кеш на диске стал штатным уровнем хранения. Но и у этой линии есть счёт: по измерениям LongCat (Meituan, август 2026 года) индексатор DSA на миллионе занимает до 90% задержки слоя, а иерархический индекс ускоряет обучение в полтора раза и генерацию — лишь на 4–13%.

схема 02 · три формы состояния запроса при генерации
Три формы состояния запроса при генерацииЧТО РАСТЁТ С КАЖДЫМ ТОКЕНОМ, А ЧТО НЕТПОЛНОЕ ВНИМАНИЕGQA · MLAЛИНЕЙНОЕ ВНИМАНИЕ · SSMMamba · DeltaNetРАЗРЕЖЕННОЕ ВНИМАНИЕDSA · NSAKV-КЕШ: +1 БЛОК НА ТОКЕНчтение ∝ T на каждом шагеСОСТОЯНИЕ ФИКСИРОВАННОГО РАЗМЕРАПЕРЕЗАПИСЫВАЕТСЯ, НЕ НАКАПЛИВАЕТСЯчтение ∝ const · память с потерямиЧИТАЕТ k ИЗ T БЛОКОВиндекс выбирает их на каждом токенеСЕГОДНЯстраницы · префиксный кеш · передача KVпамять и чтение растут с TЧТО ЛОМАЕТСЯпрефикс → контрольная точкаP/D → передача состоянияЧТО МЕНЯЕТСЯядра выбора · индекспромах = пересчётВЕСЬ СТЕК СЕРВИНГА ПОСТРОЕН ВОКРУГ ЛЕВОЙ КОЛОНКИКогда состояние не растёт, кешировать и передавать нужно другой объект — и другими инструментами
Форма состояния
Полное внимание (GQA, MLA)
Как растёт
Растёт на блок с каждым токеном
Чем обслуживается
Страницы, префиксный кеш, передача блоков
Что ломается
Память и чтение ∝ длине контекста
Форма состояния
Линейное внимание, SSM
Как растёт
Фиксированный размер, перезаписывается
Чем обслуживается
Контрольные точки состояния, передача одним блоком
Что ломается
Частичное совпадение префикса невозможно; память с потерями
Форма состояния
Разреженное внимание (DSA, NSA)
Как растёт
Растёт, но читается частично
Чем обслуживается
Индекс плюс обычные страницы
Что ломается
Индексатор сам становится затратой на длинном контексте

Системный слой отстаёт от моделей примерно на год

Что именно ломается, движки описали сами. По данным vLLM (ноябрь 2025 и апрель 2026 года), блок KV на 16 токенов занимает около 64 КиБ, а состояние Mamba — около 2,57 МиБ на последовательность; на 128K контекста KV-кеш примерно в 200 раз больше состояния. Выигрыш по памяти очевиден, но состояние перезаписывается на месте, и его нельзя «отмотать». Префиксный кеш теряет частичные совпадения: vLLM раздувает блок внимания до 528–672 токенов, чтобы он совпал со страницей состояния, и в апреле 2026 года это вылилось в проблему #40696 — запросы короче 528 токенов давали около нуля попаданий, а QPS в эксплуатации упал с 200 до менее чем 100, когда запросы стали короче границы. SGLang (декабрь 2025 года) пошёл через контрольные точки: дерево префиксов хранит снимки состояния, спекуляция получает отдельный слот состояния на каждый черновой токен, а разделение стадий передаёт состояние одним непрерывным блоком, а не потоком страниц. Marconi (MLSys 2025) показала, что вместимость такого кеша нужно считать по операциям, а не по токенам.

Moonshot раскрыла цену контрольных точек для K3: около 0,4 ГиБ каждая, то есть примерно 40 ГБ на контекст в миллион при шаге в 10K токенов. Компания сама добавила в vLLM префиксный кеш для KDA и сообщает, что её API работает в разделённом режиме с долей попаданий в кеш «более 90%» на кодинге — это заявление поставщика. Разделение стадий для гибридных моделей vLLM выпустил в апреле 2026 года: состояние едет через NIXL одним блоком, и на 8×H200 разделённая схема обходит совмещённую выше примерно 64 одновременных пользователей; для моделей на DeltaNet функция ещё «в работе». Предложение ReplaySSM (июль 2026 года) — буферизовать входы состояния вместо записи на каждом шаге — даёт 1,40× и 1,21× на пакете 128, но на 22 августа не слито.

Контраргумент от тех, кто попробовал и вернулся

MiniMax-M1 (июнь 2025 года) была построена на молниеносном внимании в пропорции 7:1. В заметке от 29 октября 2025 года руководитель предобучения объяснил, почему M2 осталась моделью с полным вниманием: гибриды совпадали с ней по MMLU, BBH, MATH и LongBench, но при масштабе показали «явные дефициты в сложных многошаговых рассуждениях»; линейное внимание «гораздо чувствительнее к числовой точности», что плохо совместимо с низкоточным хранением состояния; совместная работа с префиксным кешем, у которого в диалогах очень высокая доля попаданий, и со спекулятивным декодированием — «открытая и нерешённая проблема»; инфраструктура незрела, многие линейные ядра упираются в память даже на обучении. M2.7 (май 2026 года) по-прежнему целиком на полном внимании, а абляция гибрида со скользящим окном у той же команды даёт RULER-128K 72 против 90.

Исследовательские работы добавляют границы. Meta FAIR (октябрь 2025 года) нашла оптимум около одного слоя внимания на пять слоёв Mamba, но показала, что гибриды удерживают извлечение «иголки» только до полутора длин обучения. HALO (январь 2026 года) зафиксировала, что дистиллированные гибриды рушатся на 128K: Jet-Nemotron 2B даёт 0,0 против 96,4 у Qwen3. Авторы Mooncake в апреле 2026 года показали обратную сторону медали: гибридное внимание сжимает KV настолько, что обработку контекста можно выносить в другой дата-центр — плюс 54% пропускной способности и минус 64% P90 TTFT на внутренней модели в триллион параметров. Объект передачи меняется, и вместе с ним — география инференса.

03

Параллельная генерация: диффузия, предсказание нескольких токенов и черновики

Второй способ изменить физику генерации — не трогать состояние, а уменьшить число последовательных шагов. Три ветки: диффузионные языковые модели, которые порождают блок токенов за несколько проходов, предсказание нескольких токенов внутри самой модели и спекуляция нового поколения, где черновик пишет блок за один проход.

расшумливает холст из сотен токенов за десятки шагов и на каждом шаге фиксирует те позиции, в которых уверена. Mercury от Inception (июнь 2025 года) показала 1109 токенов в секунду на одного пользователя на H100 для Mercury Coder Mini; Mercury 2 (24 февраля 2026 года) стала первой «рассуждающей» диффузионной моделью с контекстом 128K — вендор заявляет 1009 токенов в секунду на Blackwell, а Artificial Analysis измерила 881, первый токен через 3,62 секунды и 22 балла индекса интеллекта (63-е место из 172). Gemini Diffusion спустя пятнадцать месяцев после показа остаётся «экспериментальной демонстрацией». Самый честный документ здесь — DiffusionGemma (10 июня 2026 года): Gemma 4 на 26B с 4B активных и диффузионной головой, холст 256 токенов, до 48 шагов, 15–20 токенов за проход, 1008 токенов в секунду на H100 в FP8 при пакете 1 — «в 5–6 раз быстрее авторегрессии». Качество ниже исходной Gemma 4: MMLU Pro 77,6 против 82,6, AIME 2026 69,1 против 88,3, GPQA Diamond 73,2 против 82,3. И оговорка самой Google: при высоком QPS авторегрессионные модели насыщают вычислители, параллельная генерация даёт убывающую отдачу «и может обойтись дороже в обслуживании»; ускорение рассчитано на локальный и низкопараллельный инференс.

Масштаб в 100B есть у LLaDA2.0 (Ant Group, декабрь 2025 года): MoE, преобразованный из авторегрессионной модели, на 8×H20 даёт 500 токенов в секунду против 258 у базы — «до 1,9×» при малой параллельности; дорожная карта SGLang для диффузионных моделей закрыта на один пункт из одиннадцати. Seed Diffusion Preview от ByteDance (июль 2025 года) заявляет 2146 токенов в секунду на H20 и «5,4×» против авторегрессии того же масштаба, которая не названа. Обслуживать такие модели трудно по структурным причинам: двунаправленное внимание лишает точного KV-кеша, каждый холст требует десятков проходов, запросы сходятся с разной скоростью и пакет ждёт отстающих, а логиты материализуются на весь холст. Ответы 2025–2026 годов — блочная диффузия с KV между блоками, приближённый кеш Fast-dLLM (27,6× — против базы без кеша; версия 2 — 2,5× над авторегрессией), движок dInfer (больше 1100 токенов в секунду на 8×H800 при пакете 1 — против модели 3B на vLLM) и повторное использование порционной обработки в SGLang. Вывод Optimus (май 2026 года) совпадает с выводом Google: «выигрыш по пропускной способности исчезает за порогом насыщения».

Честнее всех оказалась NVIDIA. Nemotron-Labs-Diffusion (июль 2026 года) — одна модель в трёх режимах: авторегрессия, блочная диффузия и самоспекуляция, где диффузия предлагает, а авторегрессионная голова проверяет за один проход. В самоспекуляции модель выдаёт 5,99 токена за проход, в чистой диффузии — 2,57, и для высокой параллельности авторы рекомендуют авторегрессионный режим. I-DLM (апрель 2026 года) называет себя первой диффузионной моделью, сравнявшейся с авторегрессионной того же размера, — на малом масштабе. Так диффузия превращается из замены в черновик.

схема 03 · три способа получить несколько токенов за один последовательный шаг
Три способа получить несколько токенов за один последовательный шагМЕНЬШЕ ПОСЛЕДОВАТЕЛЬНЫХ ШАГОВ — ЗА РАЗНУЮ ЦЕНУАВТОРЕГРЕССИЯодин токен за шаг8 ШАГОВ8 чтений весовДИФФУЗИОННАЯ LLMблок за k шаговk ШАГОВk чтений на блокСПЕКУЛЯЦИЯчерновик + проверка1 ШАГ ЦЕЛЕВОЙпринято 1…8БЛОК ИЗ 8 ТОКЕНОВ · k ШАГОВ РАСШУМЛИВАНИЯ ВСЕГО БЛОКАОДНА ПАРАЛЛЕЛЬНАЯ ПРОВЕРКАцелевой модельюAR платит шагами · диффузия — точностью и кешем · спекуляция — долей принятияГенерацию ограничивают последовательные шаги, поэтому каждый метод фронтира бьёт по их числу

Черновики нового поколения и где они перестают платить

встроено в саму модель: DeepSeek-V3 принимает второй токен в 85–90% случаев и получает 1,8× при малой нагрузке, но в SGLang на H200 прирост падает с 60,8% при двух запросах на ранг до 14,2% при 128. MiMo-V2-Flash (Xiaomi, январь 2026 года) с тремя такими слоями заявляет 2,6×; Qwen3-Next выпускает модуль без опубликованных чисел. Внешние черновики ушли дальше. EAGLE-3 (март 2025 года) стал стандартом движков: до 6,5× в одном потоке и 1,38× на пакете 64. DFlash (февраль 2026 года, ICML) заменил черновик пятислойной блочно-диффузионной сеткой, которая выдаёт блок из 16 токенов за один проход: на Qwen3-8B — 4,86× против 1,76–2,02× у EAGLE-3, на B200 — 5,1× при четырёх потоках и 2,8× при 32. NVIDIA в июне 2026 года показала на gpt-oss-120b и 8×DGX B300 «более 15×» против авторегрессии и 1,5× против EAGLE-3 — при ограничении 500–600 токенов в секунду на пользователя, то есть как пропускную способность под интерактивным SLO, а не как пик. DBLAST (август 2026 года) добавила оговорку: принятая длина падает с ростом энтропии выбора токенов.

DeepSeek свела всё вместе в DSpark (июль 2026 года): параллельный черновик с лёгкой последовательной коррекцией и адаптивная длина проверки по уверенности. На V4-Pro и 8×B300 первый токен блока из семи принимается более чем в 70% случаев, седьмой — менее чем в 10%; на пользователя выходит на 60–85% быстрее при той же пропускной способности против одношагового предсказания, а «на пакете 256 черновые токены конкурируют с реальными за те же вычисления». Метод «развёрнут в системе сервинга DeepSeek-V4»; 14 августа 2026 года vLLM добавил адаптивную проверку. AngelSpec у Tencent и P-EAGLE у Amazon с NVIDIA — та же волна.

Метод
MTP-1 на DeepSeek-V3
При малой параллельности
Принятие 85–90%, 1,8× при малой нагрузке
При большой
+14,2% при 128 запросах на ранг
Где измерено
SGLang, H200, июль 2025
Метод
EAGLE 3.1 на Kimi K2.6
При малой параллельности
2,03× при одном потоке
При большой
1,66× при шестнадцати
Где измерено
vLLM, GB200 NVFP4, май 2026
Метод
DFlash на Qwen3-8B
При малой параллельности
5,1× при четырёх потоках
При большой
2,8× при 32
Где измерено
SGLang, B200, ICML 2026
Метод
P-EAGLE против EAGLE-3
При малой параллельности
1,55–1,69× при одном потоке
При большой
1,05–1,25× при 64
Где измерено
vLLM, B200, март 2026
Метод
DSpark на DeepSeek-V4-Pro
При малой параллельности
+60–85% на пользователя при той же пропускной способности
При большой
Черновик конкурирует с реальными токенами за вычисления на пакете 256
Где измерено
8×B300, в эксплуатации у DeepSeek, июль 2026

Первая оценка в эксплуатационной vLLM (декабрь 2025 года) объяснила, почему таблица выглядит именно так: между наблюдаемым и теоретическим ускорением «существенный разрыв», проверка доминирует, а доля принятия гуляет по позиции, запросу и набору данных. Правило простое: спекуляция платит, пока проверяющая модель ограничена памятью; при 64–256 потоках на Blackwell она уже ограничена вычислениями. Исключение — длинный контекст, где проверка упирается в чтение KV даже при большом пакете: MagicDec получает 2,51× на пакете 32–256 с разреженным черновиком. ATLAS у Together (октябрь 2025 года) показал ещё один рычаг — адаптивный черновик, у которого доля принятия на дрейфующей RL-нагрузке выросла с менее чем 10% до более чем 80% за 1,4 тысячи шагов.

04

Разделение глубже стадий: внимание, эксперты и кремний под стадию

Разделение обработки контекста и генерации режет запрос по времени. Следующий разрез проходит внутри шага генерации, по типу слоя. Внимание читает весь KV-кеш запроса ради горстки операций, и его арифметическая интенсивность задана архитектурой: около 32 операций на байт у GQA, 128 у MFA, 512 у MLA при восьмибитном KV — и пакет её не повышает, потому что KV не делится между запросами. Веса FFN и экспертов, напротив, общие для всех токенов шага, и их интенсивность растёт с числом токенов на эксперта, пока не упрётся в вычисления. В совмещённом пуле один ускоритель должен вместить столько KV, чтобы собрать FFN в вычислительный режим, — ёмкость и полоса воюют друг с другом. подбирает пул внимания по ёмкости и полосе памяти, а пул экспертов — по операциям, и прячет обмен активациями на каждом слое за чередованием микропакетов.

m ≥ 2 × (1 + T_comm / T_ffn), при условии T_comm < T_ffn

Здесь m — число микропакетов в полёте, T_comm — задержка обмена между пулами, T_ffn — время слоя экспертов. Для Step-3 при бюджете 50 миллисекунд на токен и 61 слое это меньше 272 микросекунд на слой, включая два сетевых перехода. MoE уже платит обмен «все со всеми» на каждом слое, поэтому для неё лишний переход почти бесплатен; для плотной модели — нет, о чём авторы DistServe прямо написали в ретроспективе в ноябре 2025 года: разделение стадий стало «отраслевым стандартом», а разделение внимания и FFN — «следующим фронтиром» только для MoE.

Измерений в эксплуатации три. MegaScale-Infer у ByteDance (SIGCOMM 2025): реплики внимания кормят пул экспертов через собственную библиотеку обмена вместо NCCL — от 2,56× на Mixtral 8×22B до 7,11× на модели 317B генерации на GPU против vLLM и 1,28–1,90× против TensorRT-LLM на Ampere; гетерогенная связка H20 для внимания и L40S для экспертов даёт 3,24× по пропускной способности на доллар; компания заявляет снижение стоимости сервинга в 1,5–2 раза, код не опубликован. Step-3 у StepFun (июль 2025 года): внимание MFA специально настроено на интенсивность 128, чтобы попадать в профиль дешёвых ускорителей, а обмен идёт через StepMesh — RDMA без единого потокового мультипроцессора; измерено 3910 токенов в секунду на GPU при TPOT 50 миллисекунд и контексте 4K на 32 Hopper против 2324 у профиля DeepSeek-V3, а таблица стоимости — $0,055 за миллион токенов на H800 и $0,040 на H20 против $0,068 и $0,128 у V3 — теоретическая, при пиковой загрузке. Huawei Cloud (август 2025 года, обновление март 2026 года) обслуживает внимание, FFN и экспертов отдельными пулами на суперузле из 384 Ascend 910C: 2400 токенов в секунду на чип при 50 миллисекундах — на проприетарной шине с общей памятью, у которой нет массового аналога.

схема 04 · разделение внимания и FFN и кремний под стадию
Разделение внимания и FFN и кремний под стадиюСПЕЦИАЛИЗИРОВАТЬ РЕСУРС ПОД АРИФМЕТИЧЕСКУЮ ИНТЕНСИВНОСТЬПУЛ ВНИМАНИЯKV-кеш · полоса памятимало операций на байтПУЛ ЭКСПЕРТОВ / FFNвеса MoE · матрицымного операций на байтактивации слоя ℓрезультат слоя ℓКАЖДЫЙ СЛОЙидёт через сетьМИКРОПАКЕТЫ ЧЕРЕДУЮТСЯ: ПОКА ОДИН СЧИТАЕТСЯ, ДРУГОЙ ЕДЕТКРЕМНИЙ ПОД КОНТЕКСТмного FP4-вычисленийдешёвая память GDDRКРЕМНИЙ ПОД ГЕНЕРАЦИЮHBM · полосаширокий NVLink-доменЦЕНАмежсоединение на каждом слоебаланс пулов · больше отказовЧЕМ ТОНЬШЕ ГРАНИЦА, ТЕМ ЧАЩЕ ТЕНЗОРЫ ПЕРЕСЕКАЮТ СЕТЬРазделение по типу слоя и по типу кремния подчиняются одной логике — и платят по одному счёту

Что говорят симуляции 2026 года

Исследователи из Технологического института Джорджии (май 2026 года) прогнали проектное пространство на 128 B200: при строгих SLO разделение внимания и экспертов держит около 4000 токенов в секунду на DeepSeek-V3.2 там, где совмещённая схема не укладывается вовсе, — при соотношении 2 узла внимания на 126 узлов экспертов для префикса в 524K токенов. Но там же: пока порционная обработка помещается в совмещённый пул, она сохраняет преимущество по сырой пропускной способности. Imperial и Cambridge (август 2026 года) пошли дальше — четырёхстадийное разделение обработки контекста, генерации, внимания и FFN даёт до 1,92× на агентных трейсах и 1,29× на чате, но только при отношении вход/выход не меньше 10; на H100 и A100 «обычное P/D не хуже для шести из восьми моделей», разделение одного лишь внимания и FFN на GPU не выигрывает никогда, а четырёхкратный рост активных экспертов срезает выигрыш до 73%. ExpertPlex (июль 2026 года) предложил обратный разрез — общие эксперты для обработки контекста и генерации при отдельном внимании — и получил на H800 полезную пропускную способность в 2,01 раза выше, чем у разделения на уровне экземпляров. Это прямой довод против того, что P/D — конечная точка для MoE.

Кремний под стадию: чип умер, идея выжила

9 сентября 2025 года NVIDIA анонсировала Rubin CPX — «первый GPU с CUDA, созданный для огромного контекста»: 30 ПФЛОПС в NVFP4, 128 ГБ GDDR7 вместо HBM, «втрое быстрее внимание, чем у GB300 NVL72», стойка NVL144 CPX на 8 эксафлопс и «$5 миллиардов выручки от токенов на каждые $100 миллионов вложений», поставки «в конце 2026 года». SemiAnalysis на следующий день оценила чип в 2 ТБ/с полосы по PCIe без NVLink и около 800 Вт, а GDDR7 — в пять раз дешевле HBM за гигабайт. Это был кремний ровно под обработку контекста из предыдущей статьи: много вычислений, мало полосы. К GTC в марте 2026 года чип исчез из всех материалов; «Rubin CPX умер через три месяца после анонса», — подытожил Гленн Локвуд, страница продукта отдаёт 404, а официального заявления нет.

Его место заняла противоположная идея. После лицензионной сделки с Groq (24 декабря 2025 года; в отчёте NVIDIA за четвёртый квартал — отток $13 миллиардов с пометкой «Groq») NVIDIA показала Groq 3 LPX: внимание и обработка контекста остаются на GPU Vera Rubin с HBM, а FFN и эксперты уезжают на LPU с 500 МБ SRAM и 150 ТБ/с на чип; 256 чипов в стойке дают 128 ГБ SRAM. В блоге NVIDIA прямо называет эту схему «разделением внимания и FFN» и обещает «35× пропускной способности на мегаватт» против GB200 NVL72 при 400 токенах в секунду на пользователя — без единого независимого измерения. AMD ответила покупкой Taalas (август 2026 года) под генерацию в стойках Helios и партнёрством с Cerebras: Helios для контекста, пластина для генерации, «до 5× токенов в секунду на ватт» — по модели, а не по замеру. AWS в марте 2026 года объявила ту же пару из Trainium и CS-3. Специализация кремния пережила отмену: умер чип под стадию с бедной полосой, живёт чип под слой с бедной ёмкостью.

Состояние открытых движков на август 2026 года

Разделение стадий в vLLM по-прежнему «экспериментально и может измениться», хотя коннектор NIXL закрыл гетерогенный TP, MLA и гибридные модели, а KV в FP8 и NVFP4 ещё в плане; два предложения о разделении внимания и FFN закрыты как устаревшие. SGLang снял пометку с P/D, но его ветка AFD «не готова к замерам скорости». Dynamo вышел в версию 1.0 (16 марта 2026 года) с заявленными «до 7×» запросов на Blackwell по InferenceX и списком пользователей от ByteDance до CoreWeave; llm-d показывает около 3100 токенов в секунду на B200 генерации при широком параллелизме экспертов, а AWS измерила +70% при 128 потоках. ByteDance описала автомасштабирование парка из десятков тысяч H20 и L20 с отношениями от 1P:5D до 9P:1D, где единственным сигналом служит скорость генерации, — минус 41,3% GPU на одном мультимодальном сервисе. Это уже норма; фронтир — разрез глубже.

05

KV-кеш становится уровнем хранения, а контекст — данными

Самое весомое доказательство этого направления — не статья, а прайс-лист. Все крупные API оценивают как уровень хранения: чтение стоит десятую часть входа у Anthropic, OpenAI, Google и Alibaba и тридцатую у DeepSeek; запись дороже входа; Google берёт плату за час хранения. Сроки жизни ложатся на физические уровни. Минуты — это DRAM: пять минут у Anthropic и Alibaba, пять-десять в памяти у OpenAI. Часы — локальный SSD: час у Anthropic, сутки у OpenAI «выгрузкой KV-тензоров в локальное хранилище GPU», как буквально пишет документация Microsoft. Дни — распределённое хранилище: у DeepSeek кеш на диске «очищается обычно в срок от нескольких часов до нескольких дней».

Провайдер
Anthropic
Срок жизни
5 минут; 1 час
Тариф
Запись 1,25× или 2×, чтение 0,1×
Что это значит
Сессионного кеша дольше часа нет
Провайдер
OpenAI
Срок жизни
5–10 минут в памяти; до 24 часов выгрузкой на локальное хранилище GPU
Тариф
Чтение 0,1×; у GPT-5.6 запись 1,25× и точный TTL 30 минут
Что это значит
Суточное удержание — по умолчанию для gpt-5.5
Провайдер
Google Gemini
Срок жизни
Неявный кеш без платы за хранение; явный — час по умолчанию
Тариф
Чтение 0,1×; хранение $4,50 за миллион токенов в час у 3.1 Pro
Что это значит
Единственный тариф, где кеш оплачивается по времени
Провайдер
DeepSeek
Срок жизни
«От нескольких часов до нескольких дней» на диске
Тариф
Попадание 1/30 цены промаха: $0,022 против $0,66 у V4-Pro
Что это значит
Кеш на распределённом хранилище, а не в памяти
Провайдер
Alibaba, Moonshot
Срок жизни
5 минут с продлением; у Kimi K3 — системный
Тариф
Запись 1,25×, чтение 0,1×; у Kimi $0,30 против $3,00
Что это значит
Неявный кеш у Alibaba нельзя отключить

Под тарифами лежат системы, которые в 2026 году вышли из лабораторий. Mooncake Store (март 2025 года) с движком передачи на 87 ГБ/с по четырём портам 200G и 190 ГБ/с по восьми 400G перечислен в экосистеме PyTorch с адоптерами от Moonshot и Alibaba Cloud до Ant, JD и Tencent. Его совместный с vLLM бенчмарк (май 2026 года) — 610 трейсов Codex с медианой в 33 хода на Kimi-2.5 в NVFP4 и 12 GB200: доля попаданий с 1,7% до 92,2%, пропускная способность 3,8×, P50 TTFT ниже в 46 раз. База — «без пула вообще», так что это верхняя оценка. Уровень SSD (июль 2026 года) измерен на двухчасовом трейсе кластера Qwen: без него попадания падали с 83% до 36% после исчерпания DRAM, а TTFT рос с 6 до 16 секунд; с ним — больше 84% и не выше 9,4 секунды. Калькулятор бюджета от той же команды даёт на трейсе Claude Code 84% попаданий при 512 ГБ и 88,5% при 2 ТБ, где и находится колено. Идеальное ускорение обработки контекста при доле попаданий r простое:

S_ideal = 1 / (1 − r): при r = 0,9 — 10×, при r = 0,95 — 20×

Переход от 90 к 95 процентам удваивает выигрыш — поэтому борьба идёт за последние проценты, а не за первые десятки. LMCache (версия 0.5.4 от 20 августа 2026 года) получил координатор масштаба парка и работает у Cohere через CoreWeave; SGLang HiCache обещает у Novita минус 56% TTFT и рост попаданий с 40 до 80%, у Ant минус 84% TTFT против пересчёта — по словам партнёров; vLLM выпустил коннектор выгрузки в DRAM (январь 2026 года: TTFT лучше в 2–22 раза на H100 с 500 ГБ памяти, многоуровневость — в предварительном просмотре). NVIDIA строит менеджер блоков KV в Dynamo с четырьмя уровнями от HBM до облачного объектного хранилища, но бенчмарков в документации нет, а партнёрские «27× быстрее загрузка» у DDN и «4–10×» у WEKA приходят без баз сравнения. DualPath (февраль 2026 года, с участием DeepSeek) показала, что KV можно держать в распределённой файловой системе 3FS вовсе без DRAM: сетевая карта 400G узла обработки контекста насыщается, поэтому блоки ведут через узлы генерации — 1,96× в рамках SLO на 48 узлах обработки и 96 генерации.

схема 05 · KV-кеш как иерархия хранения
KV-кеш как иерархия храненияКОНТЕКСТ СТАНОВИТСЯ ДАННЫМИ СО СВОИМИ УРОВНЯМИДИСТАНЦИЯ ПОВТОРА ↑ · ЦЕНА ГБ ↓ · ЗАДЕРЖКА ↑HBMТБ/с · десятки ГБDRAM УЗЛАсотни ГБ/с · сотни ГБNVMeГБ/с · терабайтыУДАЛЁННЫЙ ПУЛсеть · CXL · общийПРАВИЛОхранить блок, только еслипересчёт дорожедоставкиЦЕНОВОЙ СИГНАЛкешированные токеныуже дешевлев каждом крупном APIНЕ ТОЛЬКО ПРЕФИКСсклейка блоковпозиционно-независимый кешСЖАТИЕквантование KV · вытеснениеобученное сжатиеКОНТРАКТвладелец блока · срок жизниизоляция арендаторовУровни, повтор вне префикса, сжатие и контракт владения превращают кеш в систему хранения

Повтор вне префикса и обученное сжатие

Префиксный кеш переиспользует только начало. CacheBlend (EuroSys 2025) склеивает KV фрагментов в любой позиции, пересчитывая 10–15% токенов с наибольшим отклонением: TTFT ниже в 2,2–3,3 раза при качестве в пределах 0,02 F1 — на вопросах с ответами и суммаризации, не на длинных рассуждениях; с августа 2026 года LMCache ищет такие фрагменты по всему парку. EPIC (ICML 2025) пересчитывает не более 32 первых токенов каждого фрагмента и теряет 0–7% точности — для эксплуатации это не ноль. Самая дерзкая ставка — Cartridges из Stanford (июнь 2025 года): обучить небольшой KV-кеш корпуса на синтетических диалогах и подгружать его вместо текста; на Llama-8B это 38,6× меньше памяти и 26,4× выше пропускная способность против обычного контекста. Amazon в июне 2026 года воспроизвёл идею на Qwen3-8B и коллекциях больше миллиона токенов — в пределах 2–6 пунктов от полного контекста при десятикратном сжатии — и показал, что наивная композиция нескольких картриджей рушится до случайного угадывания. Сами авторы пишут, что самообучение «гораздо дороже обычной обработки контекста» и окупается только там, где корпус спрашивают многократно.

Сжатие уже лежащего кеша разделилось на то, что работает, и то, что нет. Квантование KV до двух бит в духе KIVI почти не теряет; TurboQuant теряет 35% на суммаризации; вытеснение токенов — SnapKV, H2O, PyramidKV — теряет 8–15% на суммаризации, проваливается в многоходовом контексте и на длинных рассуждениях, а бенчмарк из Байройта (2026 год) подытоживает: «степень сжатия сама по себе плохо предсказывает итоговую производительность». Эксплуатация пошла архитектурным путём: MLA, межслойное разделение K и V в Gemma 3n, гибридное внимание у DeepSeek-V4 и Kimi K3; конвертеры TransMLA и MHA2MLA переводят GQA-модели в MLA с 92–93% сжатия после дообучения — на моделях класса 7B. Актив сжимается быстрее, чем зреют уровни хранения под него.

Общий кеш — это граница безопасности

Предыдущая статья называла попадание в кеш тайминговым побочным каналом. За год это стало измеренным фактом: аудит из Stanford (ICML 2025) нашёл глобальный, межпользовательский кеш у семи провайдеров, включая OpenAI; атаки вроде PromptPeek восстанавливают чужие префиксы в 95–99% случаев; SafeKV защищает более чем в 94% случаев, снижая накладные на изоляцию с 50 до 12% TTFT. Повтор вне префикса открыл новый канал: слияние в vLLM с LMCache даёт разницу в 104 миллисекунды, и в ограниченной энтропии извлечение доходит до 100%. «Shadow in the Cache» (NDSS 2026) пошла дальше — инверсия KV-тензоров восстанавливает вход с BERTScore 1,0 на первом слое. Когда KV лежит на общем SSD или в пуле CXL, он становится новым классом данных в покое.

06

Числовой фронтир: FP4, модели, рождённые в низкой точности, и то, что ниже

Правило из предыдущей статьи — формат без быстрого ядра только экономит память — никуда не делось. Новое в том, что у четырёх бит появились тензорные ядра и модели, которые в этих четырёх битах рождаются. Форматов два. NVFP4: элементы E2M1, блок из 16, масштаб E4M3 на блок и масштаб FP32 на тензор — около 4,5 бита на параметр с учётом масштабов. MXFP4 из спецификации OCP: блок из 32 и масштаб E8M0, то есть степень двойки, — 4,25 бита. Blackwell считает оба: независимое измерение на B200 (декабрь 2025 года) дало FP4 ровно 2,01× от FP8 на уровне инструкций; у GB300 NVL72 — 1080 плотных петафлопс в FP4; у Vera Rubin NVL72 — 3600 петафлопс NVFP4 при 50 на GPU и «в десять раз меньшая стоимость миллиона токенов» — заявление вендора.

Модели подтянулись за железом. gpt-oss (август 2025 года) выпущена с весами MoE в MXFP4 — 4,25 бита на параметр для более чем 90% параметров, так что 120B помещается в одну карту на 80 ГБ, и все оценки карточки выполнены в этом формате. Kimi K2 Thinking (ноябрь 2025 года) применила на пост-обучении и получила INT4 для экспертов «без потерь» с «двукратным ускорением в режиме низкой задержки»; мотивация сформулирована честно — думающие модели «страдают от квантования из-за чрезмерной длины генерации», — но все бенчмарки приведены в INT4, а абляции против BF16 нет; K2.5 и K2.6 используют тот же метод. DeepSeek-V3.1 (август 2025 года) перешла на масштаб UE8M0 «под следующее поколение отечественных чипов», а DeepSeek-V4 (апрель 2026 года) хранит маршрутизируемых экспертов в FP4 после QAT на пост-обучении, считает индексатор внимания в FP4 и проверена на NVIDIA и Huawei Ascend — с оговоркой, что «пик FP4×FP8 сейчас равен FP8×FP8, а на будущем железе может быть на треть эффективнее». NVIDIA переквантовала V4-Pro в NVFP4 и получила GPQA Diamond 89,33 против 89,49 у FP8. Nemotron 3 Ultra (июнь 2026 года) предобучена целиком в NVFP4 на 20 триллионах токенов: разрыв по функции потерь при переключении на BF16 на отметках 5T, 10T и 16T — меньше 0,4%, по абляции самой NVIDIA; в статье о 12B-модели годом раньше MMLU-Pro совпали (62,58 против 62,62), но код просел (56,67 против 59,52), а MXFP4 на 8B потребовал на 36% больше токенов.

схема 06 · лестница низкой точности и что требует каждая ступень
Лестница низкой точности и что требует каждая ступеньБАЙТЫ НА ВЕС ↓ → ТРАФИК ГЕНЕРАЦИИ ↓BF1616 бит на весНУЖНОтензорные ядра FP16FP88 бит · масштаб на тензор/блокНУЖНОядра FP8калибровка выбросовFP4 (NVFP4 / MXFP4)4 бита + масштабы блокаНУЖНОтензорные ядра FP4ядра с блочными масштабамиINT4 С ОБУЧЕНИЕМQAT · веса рождаются в 4 битНУЖНОобучение под форматядра INT4ТРОИЧНЫЕ1,58 бита · {−1, 0, 1}НУЖНОсвои ядра · CPU/ASICпока малые моделиКАЧЕСТВО РАССУЖДЕНИЙ ПРОВЕРЯТЬ ОТДЕЛЬНОдлинная цепочка шагов накапливает ошибку форматаметрика — точность задачи, а не перплексияФормат без быстрого ядра только экономит память; формат без обучения под него теряет качество

Где FP4 платит, а где только сжимает

Ядра решают. Независимое измерение на Blackwell (январь 2026 года) даёт FP4 для MoE 3,54× над BF16 на пакете 4096, 2,23× на пакете 128 и 0,86× — то есть медленнее BF16 — на пакете 1 в vLLM из-за квантования активаций. Группа ISTA и Red Hat заключает, что «FP4 не обгоняет INT4 автоматически», а её ядра дают 2,2× сквозного ускорения на B200 против FP16. Выигрыш сосредоточен в матрицах экспертов при высокой загрузке — это обработка контекста и большие пакеты генерации; при пакете 1 остаётся только экономия чтения весов, и только если ядро не трогает активации. KV-кеш в FP4 существует лишь в TensorRT-LLM на Blackwell при FP8-весах, в SGLang помечен экспериментальным, а vLLM документирует только FP8.

Качество рассуждений — отдельная проверка. Исследование COLM 2025 (апрель 2025 года) нашло W8A8 и W4A16 без потерь, а агрессивные четыре бита для активаций и KV стоили 2,33% на 32B и больше 10% на 1,5–7B. Meta в мае 2026 года описала механизм поломки: трёхбитная AWQ на R1-Distill-Qwen-1.5B роняет MATH-500 с 85,6 до 47,0, а цепочка растёт с 5,2 до 23,4 тысячи токенов — до 52% неудачных ответов доходят до верного решения и не фиксируют его. ReQAT (ICML 2026) показала, что это лечится обучением: на R1-Distill-Qwen-14B AIME падает с 56,83 до 50,13 после обычного NVFP4 для весов, активаций и KV и поднимается до 65,63 после QAT, выровненного по трассам рассуждений. Два бита без лечения — 17,2% на MATH-500 у Qwen3-8B. MLPerf держит планку в 99% точности FP16, и в сентябре 2025 года NVIDIA прошла её в NVFP4 во всех заявках на DeepSeek-R1 и Llama, а в апреле 2026 года GB300 NVL72 показал 9821 токен в секунду на GPU.

Ниже четырёх бит доказательств в масштабе нет. BitNet b1.58 2B4T (апрель 2025 года) — 2,4 миллиарда троичных весов, ядра проекта BitNet для обычных процессоров быстрее в 2,37–6,17 раза при экономии энергии 72–82%; крупнее 2,4B официальной троичной модели на август 2026 года не существует, троичного кремния — тоже. ParetoQ от Meta (NeurIPS 2025) показала, что троичные, двух- и трёхбитные веса выигрывают у четырёхбитных по точности на единицу размера при масштабе до 8B — на задачах здравого смысла, не на длинных цепочках.

07

За пределами GPU: память-центричный кремний, пластина и оптика

Генерация покупает байты в секунду. Из всего, что поставляется в 2026 году, экономику байтов на токен для массовых моделей меняют только две вещи. Первая — HBM4 на Rubin: с 8 до целевых 22 ТБ/с на GPU при тех же 288 ГБ, с оговоркой SemiAnalysis, что поставщики поначалу дадут около 20; стойки идут в пять облаков. Вторая — кремний, который меняет ёмкость на полосу, держа веса в SRAM: пластина Cerebras WSE-3 с 44 ГБ и 21 ПБ/с, LPU Groq с 500 МБ и 150 ТБ/с на чип, карта d-Matrix Corsair с 4 ГБ и 300 ТБ/с. при этом становится частью устройства: 256 LPU в стойке дают лишь 128 ГБ SRAM, и модель на 405B в FP16 потребует порядка девятнадцати пластин Cerebras.

Независимые измерения есть только у тех, кто продаёт токены через API. Artificial Analysis в августе 2026 года показывает на gpt-oss-120b: Cerebras 1733 токена в секунду при $0,15 за миллион, SambaNova 699, Groq 474 при $0,06 — против низких сотен у GPU-провайдеров, из которых CoreWeave дешевле всех при $0,04; на Llama 3.3 70B — Groq 307, SambaNova 291, Google Vertex 131. В MLPerf версий 5.1 и 6.0 ни Cerebras, ни Groq, ни SambaNova, ни d-Matrix, ни Tenstorrent не участвуют. Отдельная оценка GroqRack против GPU (2026 год) совпадает с интуицией: GPU выигрывают обработку контекста и пакетную генерацию, Groq — генерацию в одном потоке, без пакетирования.

Cerebras за год прошла путь от демонстраций к контрактам: многолетняя сделка с OpenAI на 750 МВт (январь 2026 года), GPT-5.6 Sol в режиме «Ultrafast» до 750 токенов в секунду в ограниченном превью (август), первые поставки CS-4 в третьем квартале 2026 года с обещанием «в 30 раз быстрее GPU-систем» без названной базы, IPO в мае. SambaNova заявляет для SN50 895 токенов в секунду на Llama 3.3 70B против 184 на B200 по собственному тесту и привлекла раунд при оценке $11 миллиардов. Tenstorrent продаёт Galaxy Blackhole за $110 тысяч: 6,2 ГБ SRAM при 2,9 ПБ/с и терабайт GDDR6 при 16 ТБ/с — ставка на дешёвую ёмкость, а не на полосу чипа. Etched обещает стойки Sohu «этим летом» без чисел, Taalas впаивает веса модели 8B в кремний и получает 16 960 токенов в секунду — и становится частью AMD. Собственные чипы гиперскейлеров — Ironwood с 7,37 ТБ/с, Trainium3 с 4,9, Maia 200 с 7 — стоят в той же точке графика, что и GPU с HBM: это ставка на цену и экосистему, а не на байты на токен.

схема 07 · ёмкость памяти против полосы памяти у кремния для генерации
Ёмкость памяти против полосы памяти у кремния для генерацииГЕНЕРАЦИЯ ПОКУПАЕТ БАЙТЫ В СЕКУНДУЁМКОСТЬ ПАМЯТИ НА УСТРОЙСТВО →ПОЛОСА ↑SRAM-ЧИПЫпластина · LPUдесятки ГБ · огромная полосаGPU + HBM4сотни ГБ · ТБ/сPIMвычисления в DRAMполоса внутри банкаGDDR7-КРЕМНИЙ ПОД КОНТЕКСТдешевле, ужеCPU + DRAMтерабайты · медленноОПТИКАмежсоединение, а не память:шире домен, а не больше байт на токенКаждая альтернатива GPU платит либо ёмкостью (и потолком размера модели), либо экосистемой

Вычисления в памяти: прототипы и симуляции

обещают самый радикальный сдвиг — умножать веса на вектор там, где они лежат. На август 2026 года ни один модуль DRAM с вычислениями не выпускается серийно: AiMX от SK hynix на CES 2026 по-прежнему прототип, LPDDR5X-PIM от Samsung измерен эмуляцией на смартфоне, на реальном устройстве генерацию «измерить не удалось». Единственный измеренный на прототипе результат — NELSSA (SK hynix и KAIST, MICRO 2026): четыре CXL-устройства с процессорными ядрами рядом с H100 дают до 5,5× токенов в секунду на контексте 128K–1M против одного GPU на Llama3-8B. Всё остальное — циклоточные симуляции с множителями от 3 до 15 против H100, а не Blackwell, и в основном на длинном контексте, где байты тратит внимание, а не FFN.

Пулы памяти по CXL и оптика решают другие задачи. Samsung в июне 2026 года измерила пул CXL 2.0 на восьми RTX PRO 6000: 92,3% производительности локальной DRAM при 35–47 ГБ/с — уровень ёмкости для KV, на два-три порядка ниже HBM. Коммутатор CXL 3.0 от Marvell на 4 ТБ/с совокупно — в образцах с третьего квартала. Совмещённая оптика реальна — Quantum-X Photonics доступен, Spectrum-X Photonics во второй половине 2026 года с «пятикратной энергоэффективностью против сменных модулей», Ayar Labs привлекла $500 миллионов и вошла в NVLink Fusion, Marvell закрыла покупку Celestial AI с выручкой только с 2028 года, — но оптика не меняет байты на токен; она меняет, сколько пулов HBM можно связать в один домен на ватт.

08

Рассуждения: инференс как бюджетируемая нагрузка

перевернули форму запроса. В эксплуатационных трейсах Alibaba (NSDI 2026) рассуждение в среднем вчетверо длиннее ответа, и распределение бимодально. DeepSeek в феврале 2025 года раскрыла свою систему: 608 миллиардов входных токенов в день при 56,3% попаданий в кеш и 168 миллиардов выходных; блок обработки контекста из четырёх узлов против блока генерации из восемнадцати; $87 тысяч расходов в день против $562 тысяч теоретической выручки. o3 на ARC-AGI-1 (декабрь 2024 года) получила 75,7% при $26 за задачу и примерно 55 тысячах токенов на попытку — и 87,5% при $4560 за задачу и 1024 попытках. К июню 2026 года Artificial Analysis считает стоимость и время задачи индекса: Opus 4.8 на максимальном усилии — $1,78 и 6,4 минуты, GPT-5.5 на xhigh — $0,99 и 3,7 минуты, DeepSeek V4 Pro — $0,04; время задачи у фронтира — от полутора до тринадцати с половиной минут. Единица учёта сместилась с токена на задачу.

Объёмы растут быстрее цен падают — и одновременно с ними. Google на I/O 19 мая 2026 года назвала больше 3,2 квадриллиона токенов в месяц, в семь раз больше, чем годом раньше; OpenRouter в январе 2026 года показал, что доля рассуждающих моделей в токенах выросла с почти нуля в начале 2025 года до более чем половины, средний запрос — с 1,5 до 6 с лишним тысяч токенов. Epoch AI (март 2025 года) фиксирует падение цены за фиксированный уровень качества в 9–900 раз в год; работа «The Price of Progress» (ноябрь 2025 года) — 5–10 раз в год за единицу качества, но запуск самого фронтира дорожает в 3–18 раз в год из-за масштаба и рассуждений; анализ «Tiered Super-Moore's Law» (март 2026 года) оценивает премию за рассуждение в 31,5 раза к цене обычных моделей.

схема 08 · форма запроса с рассуждением и рычаги его бюджета
Форма запроса с рассуждением и рычаги его бюджетаВЫХОД В ДЕСЯТКИ РАЗ ДЛИННЕЕ ВХОДАВХОДРАЗМЫШЛЕНИЕОТВЕТтокены →P:D ПЕРЕВОРАЧИВАЕТСЯгенерация держит память минутамиБЮДЖЕТ — РУЧКАтокены размышления задаются через APIПАРАЛЛЕЛЬНЫЕ ПОПЫТКИ ×Nлучший из N · цена ×NРАННИЙ ВЫХОДучиться останавливатьсяЛАТЕНТНЫЕ ШАГИдумать без токеновпока препринтКогда доминирует размышление, узкое место — память генерации и число шагов, а не обработка контекста

Бюджеты мягкие, параллельные попытки непрозрачные

Управление бюджетом в API дозрело до шестой ступени, но все ручки мягкие. Anthropic объявила budget_tokens «целью, а не жёстким лимитом», затем заменила его уровнями усилия от низкого до максимального и добавила бюджет задачи (бета с марта 2026 года) — «мягкую подсказку, а не жёсткий лимит»; единственное жёсткое ограничение — max_tokens, а смена усилия сбрасывает кеш. Gemini перешёл на дискретные уровни размышления, OpenAI — на reasoning_effort от «нет» до «max», а у GPT-5.6 режим Pro «агрегирует работу в один ответ» с предупреждением «ожидайте большего расхода токенов». Важная деталь для памяти: предыдущие размышления теперь остаются в контексте и оплачиваются как вход — у Anthropic с версии 4.6, у OpenAI по умолчанию «все ходы». Параллельные попытки вышли в продукт у OpenAI (GPT-5 Pro «использует параллельные вычисления во время ответа» — алгоритм не раскрыт) и у Google (Deep Think с «параллельным мышлением» и квотой на число запросов в день); Anthropic описала вариант с 256 выборками и обученным оценщиком, давший 84,8% на GPQA, и не развернула его.

Исследования обещают кратный выигрыш — на открытых моделях до 14B. Certaindex (2025 год) измеряет устойчивость ответа и выходит рано: до 50% сэкономленных вычислений и 3,3× пропускной способности без потери точности. SpecReason проверяет шаги рассуждения малой моделью — 1,4–3,0×. Обучение с штрафом за длину (ALP, JET) срезает 46–50% токенов у моделей в 1,5B. Вытеснение думающих токенов из KV — R-KV, ThinKV, ForesightKV — оставляет 5–10% кеша при сохранении точности и даёт 5,8–6,6× пропускной способности; в эксплуатации ни одного такого вытеснения не видно, а вендоры движутся в обратную сторону. Латентные рассуждения без токенов — рекуррентная глубина Geiping и соавторов (3,5B, февраль 2025 года), Coconut у Meta, Ouro на 2,6B, LOTUS на 3B (июнь 2026 года), WeLM-HD4 на 617B (июль 2026 года, четыре потока на токен, без развёртывания) — не добрались ни до одного фронтирного продукта. Вычисления во сне от Letta (апрель 2025 года) — впятеро меньше вычислений при равной точности — живут в продукте Letta, у крупных API их нет.

09

Агентные нагрузки: сессия, инструмент и песочница как единицы планирования

В 2026 году появились первые публичные трейсы агентов, и они сходятся в одном. TraceLab из Университета Вашингтона (июнь 2026 года) собрал 4265 сессий Claude Code и Codex у 43 разработчиков: на один запрос человека приходится 0,9 его шага и 7,8 шагов, инициированных инструментами, с 10,8 вызовами; медианный префикс — 126K токенов у Claude и 116K у Codex, дописывается около 860, выход — 252 и 184. Microsoft (июль 2026 года) опубликовала характеристику GitHub Copilot за одну неделю июня: 3,2 миллиона пользователей, 13,5 миллиона сессий, 761 миллион вызовов модели; 87% вызовов инициирует агент. Inferact вместе с vLLM (май 2026 года) выложила 610 трейсов Codex на SWE-bench Pro с медианой в 33 хода. Агентный трафик — это обработка контекста с огромным повтором: вход к выходу от 131:1 до 630:1.

Показатель
Вход к выходу
TraceLab (Claude Code, Codex)
294:1 суммарно, 470–630:1 на шаг
GitHub Copilot (Microsoft)
Более 275:1
Codex на SWE-bench Pro (Inferact)
131:1 на вызов
Показатель
Шагов на запрос человека
TraceLab (Claude Code, Codex)
0,9 своих и 7,8 от инструментов
GitHub Copilot (Microsoft)
4,5 вызова и 4 инструмента на ход (медиана)
Codex на SWE-bench Pro (Inferact)
33 хода на задачу (медиана)
Показатель
Попадания в префикс
TraceLab (Claude Code, Codex)
95,7%; провал при паузе дольше 5 минут
GitHub Copilot (Microsoft)
~98% внутри хода, 55% на границе хода, 8% после смены модели
Codex на SWE-bench Pro (Inferact)
1,7% без пула → 92,2% с пулом
Показатель
Время инструмента
TraceLab (Claude Code, Codex)
Медиана 0,3 с, среднее 16,8 с; 4,9% вызовов дольше минуты дают 92% времени
GitHub Copilot (Microsoft)
Медиана 166 мс, P99 79 с
Codex на SWE-bench Pro (Inferact)
Пауза между ходами 5,2 с (медиана), 81 с (P99)
Показатель
Параллельность в сессии
TraceLab (Claude Code, Codex)
GitHub Copilot (Microsoft)
Медиана 1,15; 93% пакетов инструментов — одиночные
Codex на SWE-bench Pro (Inferact)
Показатель
Стоимость
TraceLab (Claude Code, Codex)
Медиана сессии $0,61, среднее $9,70; 59,5% — префиксные токены
GitHub Copilot (Microsoft)
Codex на SWE-bench Pro (Inferact)

Префикс уже работает — пока следующий вызов быстро попадает в тот же узел. Попадания 95,7% у TraceLab и около 98% внутри хода у GitHub Copilot обрываются на паузах человека: 55% на границе хода, промахи при простое дольше пяти минут и почти все после часа, минус 66 процентных пунктов после уплотнения контекста и 8% после смены модели. У TraceLab 41% времени запроса занимает модель и 60% — инструменты, при этом медианный вызов длится 0,3 секунды, а 4,9% вызовов дольше минуты дают 92% всего времени инструментов. Параллельность внутри сессии у GitHub Copilot — медиана 1,15, 93% пакетов инструментов одиночные: всплеск субагентов в реальных трейсах пока не виден, и «15× токенов чата» у Anthropic для мультиагентных систем остаётся заявлением. Manus сформулировала это год назад: «доля попаданий в KV-кеш — главная метрика», при 100:1 и десятикратной разнице цены кешированного и нового токена.

схема 09 · одна сессия агента как лента вычислений и ожиданий
Одна сессия агента как лента вычислений и ожиданийВЫЧИСЛЕНИЯ ПРЕРЫВИСТЫ, СОСТОЯНИЕ НЕПРЕРЫВНОКОНТЕКСТГЕНЕРАЦИЯИНСТРУМЕНТKV ждётДОПИСАТЬГЕНЕРАЦИЯЧЕЛОВЕК · ЧАСЫсостояние отложеноПРОДОЛЖИТЬвремяTTL КЕША = ДЛИТЕЛЬНОСТЬ ИНСТРУМЕНТАдержать в HBM или выгрузитьДОЛГАЯ ПАУЗАна NVMe или удалённо · восстановить к продолжениюСЕССИЯединица размещения и локальностиВЫЗОВ ИНСТРУМЕНТАединица планирования памятиПЕСОЧНИЦА · СУБАГЕНТЫединица всплеска: ×N параллельноПланировать нужно сессию с её паузами и ветвлениями, а не отдельный запрос

Планировать сессию, а не запрос

Исследовательская линия тянется от Parrot (OSDI 2024), где приложение размечает семантические переменные и сервис видит граф вызовов, через Autellix (февраль 2025 года) с программой как единицей планирования — 4–15× пропускной способности при равной задержке против vLLM 0.6.1 с очередью FCFS, в основном за счёт снятой блокировки головы очереди, — к Continuum (ноябрь 2025 года, ICLR 2026): при вызове инструмента KV закрепляется в HBM на срок, равный ожидаемой длительности инструмента по его эмпирическому распределению. На 500 задачах SWE-bench Verified это 8,18× ниже среднее время задачи против SGLang 0.5.5 и Dynamo 0.7; инструмент в SWE-bench длится 925 ± 3550 миллисекунд за 10,9 хода. KVFlow (NeurIPS 2025) вытесняет по графу шагов агентов — 1,83–2,19× над SGLang; CacheScout (июль 2026 года) учит переходы между агентами на лету и прибавляет 10–18 процентных пунктов попаданий над Continuum; ConServe (июнь 2026 года) делает единицей размещения целый разговор — минус 51% P95; PASTE (март 2026 года) спекулятивно запускает инструменты во время генерации — минус 43,5% времени задачи. SAGA (май 2026 года) — единственная работа на 64 GPU: время задачи на SWE-bench и WebArena ниже в 1,64 раза, но пиковая пропускная способность на 30% ниже, чем у планирования под максимальный поток. Это самая честная цена атомарного планирования из опубликованных.

Серверная сторона движется от кеша к сессии. Anthropic держит 5 минут и час; OpenAI — сутки по умолчанию для gpt-5.5 без наценки, а с GPT-5.6 вводит явные точки разрыва, точный TTL в 30 минут и платную запись. Claude Managed Agents (бета с апреля 2026 года) переносят на сервер сессию, контейнер-песочницу и историю за $0,08 в час активной сессии плюс токены — срок жизни KV при этом не опубликован. Prism (OSDI 2026) показывает, что происходит с парком из многих моделей, которые простаивают больше 70% времени: баллонная виртуальная память GPU перераспределяет KV между ними, и авторы сообщают о развёртывании на более чем 10 тысячах GPU с 3,89× токенов на GPU у неназванной компании.

10

Мультимодальность и модели мира: новая форма нагрузки

Мультимодальный инференс — не текстовый с предобработкой, а другой профиль ресурсов на каждой стадии. ModServe у Microsoft (SoCC 2025) измерила на эксплуатационных трейсах: кодирование изображения занимает от 25% TTFT у InternVL-26B до 79% у Llama 3.2 с перекрёстным вниманием, а одна картинка 896×896 стоит от 1280 до 7290 токенов в зависимости от архитектуры. Раздельные пулы кодировщика и текста с масштабированием по модальности дали 3,3× и 5,5× пропускной способности против монолитного vLLM на 128 A100 при экономии 25–41% стоимости. Huawei (ICML 2025) довела E/P/D до 71% снижения TTFT и 22× большего пакета, а её EPD-Serve на Ascend (январь 2026 года) — до 57–69% над обычным P/D. Аргумент из HeteroServe (март 2026 года) объясняет, почему разрез проходит именно по модальности: между кодировщиком и моделью едут мегабайты вложений, а не гигабайты KV.

Видео превращает контекст в бюджет времени. По документации Gemini кадр стоит 258 токенов при одном кадре в секунду плюс 32 звуковых токена — около 300 токенов на секунду, то есть контекст в миллион токенов — примерно час видео. Моя арифметика при типичном для моделей класса 8B KV в 128 КиБ на токен: час видео — порядка 130 ГиБ кеша, больше одного GPU. Qwen3-VL (ноябрь 2025 года) отвечает на это 32-кратным пространственным и двукратным временным сжатием при родном контексте в 256K; карточка Qwen3-Omni честно показывает цену: 78,85 ГБ памяти на 15 секунд видео и 144,81 ГБ на 120 секунд — около 0,63 ГБ на каждую секунду. В движках стадия кодировщика только появляется: у vLLM трекер E/P/D открыт с 15 августа 2026 года, коннекторы кеша кодировщика через Mooncake, NIXL и LMCache сливаются по одному; SGLang стадии кодировщика не имеет и 21 августа удалил её мёртвый код; TensorRT-LLM поддерживает «только декодерные модели», а его тесты E/P/D нестабильны. Отдельный проект vLLM-Omni обслуживает омни-модели, диффузию и политики роботов с «полностью разделёнными» стадиями и экспериментальным дуплексом.

схема 10 · мультимодальные стадии и цикл генерации в реальном времени
Мультимодальные стадии и цикл генерации в реальном времениБОЛЬШЕ СТАДИЙ СВЕРХУ · ЖЁСТКИЙ ТАКТ КАДРА СНИЗУКОДИРОВЩИКизображение · звук · видеоОБРАБОТКА КОНТЕКСТАтысячи визуальных токеновГЕНЕРАЦИЯтекст · речь · кадрыE / P / D: У КАЖДОЙ СТАДИИ СВОЙ ПУЛ И СВОЙ ОБЪЕКТ ПЕРЕДАЧИСЖАТИЕ ВИЗУАЛЬНЫХ ТОКЕНОВ: ОТБРОСИТЬ, СЛИТЬ, УМЕНЬШИТЬ — И ИЗМЕРИТЬ ТОЧНОСТЬСОСТОЯНИЕ + ДЕЙСТВИЕпамять сцены · ввод игрокаКАДР t+1≤ 40 мс при 24 к/сОБНОВИТЬ ПАМЯТЬ СЦЕНЫсогласованность на минутахкаждый кадр — авторегрессионный шаг с памятьюМультимодальность добавляет стадии и объём токенов; интерактивная генерация — срок на каждый кадр

Сжатие визуальных токенов: не всякое «меньше» быстрее

Линия FastV (ECCV 2024, минус 45% операций), SparseVLM (ICML 2025, минус 54% операций при 97% точности), PyramidDrop (CVPR 2025) и VisionZip (8× быстрее обработка контекста) выглядела флагманской, пока DART (2025 год) не показала, что отбор по важности внимания «обычно хуже случайного», а по дублированию можно убрать 89% токенов при 1,99× сквозного ускорения. Пилот из августа 2026 года на 30 примерах добавил главное: «меньше визуальных токенов не гарантирует меньшую задержку» — авторегрессионные пробы оставались медленнее полной базы, а выигрывала только маршрутизация до кодировщика, которая пропускает предобработку и кодирование целиком, даже с восьмикратно меньшим сокращением токенов. GSTEP срезает 75% видеотокенов ради 1,17×. Ни один из этих методов не описан как функция vLLM, SGLang или TensorRT-LLM, а современные модели с динамическим разрешением уже распределяют токены сами — запас для инференс-времени структурно меньше, чем на LLaVA.

Дуплексная речь и генерация кадров: SLO — это поток

У речи в реальном времени SLO — не токен, а непрерывный поток. Moshi от Kyutai держит два параллельных потока с задержкой 160 миллисекунд в теории и 200 на практике; Qwen3-Omni (сентябрь 2025 года) в архитектуре Thinker–Talker заменила блочную диффузию лёгкой причинной свёрткой, чтобы синтез шёл с первого кадра кодека, — 234 миллисекунды до первого пакета в теории, и vLLM обслуживает только Thinker. У OpenAI транспорт даёт около 100 миллисекунд по WebRTC и 200 по WebSocket при лимите сессии в 60 минут; Gemini Live всё ещё в превью, а его тариф на аудио — единственное, из чего выводится цена часа дуплексной речи: около $1,38 на пользователя, по моим расчётам из $3 и $12 за миллион. LiveServe (июнь 2026 года) показала, что планировщик должен видеть прогресс воспроизведения и перебивание: на vLLM-Omni P90 задержки первого пакета ниже в 1,55 раза, завершённых запросов больше в 1,15 раза.

Генерация кадров — третий режим. вроде Genie 3 (5 августа 2025 года: 24 кадра в секунду при 720p, несколько минут взаимодействия, память около минуты) к лету 2026 года стали платным продуктом Project Genie в подписке Google AI Ultra за €99,99 или €219,99 в месяц в 140 странах — без раскрытия стоимости часа, квоты сессий или числа одновременных пользователей. World Labs запускает RTFM «на одном H100» и формулирует масштаб задачи: интерактивный поток 4K при 60 кадрах в секунду — это больше 100 тысяч токенов в секунду. Открытые воспроизведения — Matrix-Game 3.0 с 40 кадрами при 720p на модели 5B и мультиплеер на четверых при 20 кадрах на одном B200 — однопользовательские. Разрыв между пакетной и интерактивной генерацией измерим: четырёхсекундный клип Sora 2 на Azure создавался 67 секунд, то есть в 17 раз медленнее реального времени, а Veo 3 стоит $0,40 за секунду; кеширование шагов диффузии вроде TeaCache даёт 4,41× против недистиллированной базы и почти ничего на четырёхшаговых моделях, где Chorus вытягивает +45% повтором между запросами. Эти два порядка закрывает дистилляция, а не кеш.

11

Энергия, управление и доверие: пределы и умная среда выполнения

Энергия стала пределом роста парка — но не эксплуатации существующего. По обновлению IEA (апрель 2026 года) центры обработки данных потребили 485 ТВт·ч в 2025 году, на 17% больше, а ориентированные на ИИ — на 50%; к 2030 году — около 950 ТВт·ч, примерно 3% мирового спроса, и 15–27 ГВт газовой генерации прямо на площадках, в основном в США; линии электропередачи строятся четыре — восемь лет, сроки поставки трансформаторов удвоились. Epoch AI (январь 2026 года) оценивает мощность ИИ-центров на конец 2025 года примерно в 30 ГВт — сопоставимо с пиком штата Нью-Йорк — и путь к гигаваттной площадке в один — три с половиной года. SemiAnalysis (июнь 2026 года) считает, что американские центры добавят 21 ГВт в 2026 году и 84 в 2030 году против примерно 15 ГВт чистого прироста сети в год, а турбины и трансформаторы ждут три-четыре года вместо привычных полутора; отсюда прогноз «40+ ГВт генерации за счётчиком к 2028 году». Энди Джасси в феврале 2026 года: AWS «росла бы быстрее, будь предложение доступно»; финансовый директор Microsoft: «не хватает мощности и площадей уже много кварталов». Капитальные затраты четвёрки на 2026 год — от $120 до $200 миллиардов у каждого.

Что может планировщик? Генерация ограничена памятью, поэтому рычаг — частота, а не лимит мощности. Работа из Эрлангена (май 2026 года) показала на H200, что генерация потребляет 137–300 Вт из 700 и лимит мощности «никогда не срабатывает», зато фиксация частоты потоковых мультипроцессоров возвращает до 32% энергии генерации при минимальной потере скорости, а MLA и линейное внимание вдвое снижают энергию запроса против GQA. Регуляторы показывают экономию, пропорциональную простою: GreenLLM (август 2025 года) — до 34% против DVFS по умолчанию при менее чем 3,5% дополнительных нарушений SLO, но 27,5% при одном запросе в секунду и лишь 6,8% при десяти; DynamoLLM (HPCA 2025) — 53% энергии при SLO «P99 не хуже пятикратной ненагруженной задержки», в основном за счёт суточной недозагрузки и в симуляции на масштабе парка. Честнее формулировать мощность как планируемый ресурс: RAPID у AMD (январь 2026 года) перекидывает её между узлами обработки контекста и генерации за доли секунды и получает 1,7× QPS на ватт при бюджете узла на 20% ниже; KAIROS (апрель 2026 года) использует контекст агентного цикла как сигнал и снижает мощность на 27–46%; AFlex (август 2026 года) даёт разным частотам внимание и FFN — минус 49% энергии на токен.

схема 11 · мощность как ограничение и обученный контур управления
Мощность как ограничение и обученный контур управленияВАТТЫ И ДОВЕРИЕ ВХОДЯТ В ЦЕЛЕВУЮ ФУНКЦИЮЛИМИТ МОЩНОСТИплощадка · стойка · тарифРЕГУЛЯТОРчастота · пакет · отношение P:DЭНЕРГИЯ НА ТОКЕН ↓ · TPOT ↑пока SLO выполняетсяТРЕЙССИМУЛЯТОР / МОДЕЛЬПОЛИТИКАпакет · маршрут · масштабSLO · СТОИМОСТЬОБУЧЕННЫЙ ПЛАНИРОВЩИКсначала доказан в симуляцииДОВЕРИЕ: КОНФИДЕНЦИАЛЬНЫЙ ИНФЕРЕНСдоверенная среда GPU · цена в пропускной способности · проверяемостьЭнергия на токен и гарантии изоляции стоят рядом с TTFT и TPOT в целевой функции 2026 года

Обученное управление дошло до выпусков, но не до бенчмарков

Lodestar (ByteDance и UIUC, май 2026 года) заменяет ручные эвристики маршрутизатора онлайн-обучаемым предсказателем TTFT: в 1,41 раза ниже средний TTFT против эвристики по кешу и нагрузке и до 4,4 раза — на гетерогенном парке из старых A30 и V100; стенд на 16 GPU. TokenScale (декабрь 2025 года) делает единственным сигналом автомасштабирования «скорость токенов» через обработку, сеть и генерацию — выполнение SLO с 50–88% до 80–96% при экономии 4–14%. Симулятор Vidur остался рабочим инструментом планирования мощности: ошибка меньше 9%, подбор конфигурации для 70B за час на CPU вместо 42 тысяч GPU-часов. В открытых средах выполнения маршрутизация по SLO дошла до релизов: расширение Gateway API Inference Extension для Kubernetes в версии 1.5 (апрель 2026 года) получило упорядочивание по дедлайну и сброс по предсказанной задержке, llm-d 0.9 (август 2026 года) — предиктор задержки на XGBoost и руководство по автомасштабированию по SLO; планировщик Dynamo по SLA требует профилирования заранее, у SGLang обученных политик нет. Ни одна официальная страница не публикует бенчмарк для маршрута по предсказанной задержке. Единственное эксплуатационное свидетельство «умной среды выполнения» — Prism на стороне памяти.

Семантический кеш ответов прошёл похожий путь: vCache (ICLR 2026) заменил глобальный порог похожести порогами на запрос с гарантией доли ошибок — до 12,5× попаданий и в 26 раз меньше ошибок против статических порогов; оценки для эксплуатации — 40–60% попаданий в повторяющихся категориях против 5–15% в изменчивых; LaCache (август 2026 года) формализовала отравление кеша коллизиями как новую атаку.

Доверие: конфиденциальный инференс выходит из первой стороны

получил три независимых измерения накладных расходов. ETH (сентябрь 2025 года): H100 в конфиденциальном режиме теряет 4–8% пропускной способности, и разрыв тает с ростом пакета. Mozilla (май 2026 года): при фиксированной интенсивности запросов TTFT растёт на 22–28%, пропускная способность падает на 18–21% — «резервируйте 15–25% мощности». Phala: меньше 7%, у больших моделей около нуля, потому что накладные — это передача по PCIe. Чисел для Blackwell нет ни у кого, а NVIDIA обещает «производительность, сопоставимую с незашифрованной». Сигнал направления дала Apple 8 июня 2026 года: Private Cloud Compute впервые работает вне кремния Apple — на Google Cloud с конфиденциальными GPU NVIDIA, Intel TDX и корнем доверия Titan при тех же гарантиях: отсутствие состояния, никакого привилегированного доступа, неадресуемость, проверяемая прозрачность. Google Private AI Compute (ноябрь 2025 года) и Private Processing у Meta (апрель 2025 года) — та же модель для собственных продуктов; Anthropic и Pattern Labs называют свою работу «наброском исследования»; у облаков есть конфиденциальные H100, но нет Blackwell. Проверяемость без доверенной среды — TOPLOC с 258 байтами на 32 токена и доказательства zkLLM за 15 минут на 13B — остаётся исследованием, а обзор из Imperial (май 2026 года) заключает, что сквозной основы для агентных систем «пока нет».

12

Карта зрелости и план действий

Соберём десять направлений на одной карте: по горизонтали — ступень лестницы из первого раздела, по вертикали — размер обещания. Положение точек — моё прочтение источников на август 2026 года, а не измерение; чем правее точка, тем меньше риск, чем выше — тем больше обещание и тем строже нужна база сравнения.

схема 12 · десять направлений по зрелости и масштабу обещания
Десять направлений фронтира по зрелости и масштабу обещанияПРАВЕЕ — МЕНЬШЕ РИСК · ВЫШЕ — БОЛЬШЕ ОБЕЩАНИЕпрепринтвоспроизведенооткрытый движокэксплуатациястандартОБЕЩАНИЕ ↑гибридное вниманиедиффузионные LLMAFD + кремний под стадиюKV как хранилищеFP4 и нижекремний без GPUбюджеты рассужденийагентные сессиимультимодальные стадииэнергия и управлениеПоложение точек — авторское прочтение источников на август 2026 года, а не измерение
Направление
Гибридное и разреженное внимание
Что доказано
Ступень 4–5: модели Alibaba, Moonshot, NVIDIA, DeepSeek в эксплуатации; движки поддерживают
Что нет
Префиксный кеш, спекуляция и P/D для фиксированного состояния; качество многошаговых рассуждений на фронтире
Сигнал до 2028 года
Вернётся ли MiniMax к гибриду; закроет ли vLLM контрольные точки состояния
Что делать сейчас
Измерить долю запросов длиннее 128K — ниже неё выигрыша нет
Направление
Диффузионные LLM
Что доказано
Ступень 3–4: Mercury 2 у клиентов, DiffusionGemma в vLLM; 1000+ ток/с на пользователя
Что нет
Паритет качества с AR того же размера; выигрыш полезной пропускной способности при насыщении
Сигнал до 2028 года
Первая dLLM на 100B+, сравнявшаяся с AR по рассуждениям
Что делать сейчас
Рассматривать только для интерактивных задач с малой параллельностью
Направление
Спекуляция нового поколения
Что доказано
Ступень 5: EAGLE-3 — стандарт движков; DFlash и DSpark в эксплуатации у DeepSeek
Что нет
Выигрыш при параллельности ≥ 64 и при выборе токенов с высокой энтропией
Сигнал до 2028 года
Адаптивная длина проверки в vLLM и SGLang по умолчанию
Что делать сейчас
Включать, пока проверка ограничена памятью; измерять на своём пакете
Направление
Разделение внимания и FFN, кремний под стадию
Что доказано
Ступень 4: ByteDance и StepFun отчитались об эксплуатации; Rubin CPX анонсирован
Что нет
Независимое воспроизведение; экономика вне широкого NVLink-домена
Сигнал до 2028 года
Поставки Rubin CPX и первые бенчмарки не от NVIDIA
Что делать сейчас
Не проектировать под AFD без межсоединения класса NVLink
Направление
KV-кеш как хранилище
Что доказано
Ступень 6 для префиксного кеша с тарифом; ступень 4–5 для пулов DRAM/SSD
Что нет
Повтор вне префикса, обученное сжатие, CXL-пулы, изоляция арендаторов
Сигнал до 2028 года
Продлят ли провайдеры сроки жизни или, как OpenAI, введут платную запись
Что делать сейчас
Посчитать бюджет кеша по своему трейсу; колено обычно около 2 ТБ
Направление
FP4 и модели, рождённые в низкой точности
Что доказано
Ступень 5 для весов экспертов MoE: gpt-oss, Kimi K2, DeepSeek-V4, Nemotron 3
Что нет
FP4 для активаций и KV при рассуждениях без QAT; что-либо ниже 4 бит в масштабе
Сигнал до 2028 года
Независимая абляция BF16 против FP4 на модели 100B+
Что делать сейчас
Проверять точность задач с длинной цепочкой шагов, а не перплексию
Направление
Кремний без GPU
Что доказано
Ступень 3–4: Cerebras и Groq продают токены; PIM и оптика — образцы и анонсы
Что нет
Стоимость полезного токена при большом пакете; потолок размера модели у SRAM
Сигнал до 2028 года
Независимые замеры цены и скорости на фронтирных моделях
Что делать сейчас
Покупать как услугу для задач, где платят за задержку
Направление
Бюджеты рассуждений
Что доказано
Ступень 6 для мягких бюджетов в API; ступень 1–2 для раннего выхода и латентных шагов
Что нет
Жёсткий бюджет на задачу; вытеснение думающих токенов в эксплуатации
Сигнал до 2028 года
Остановится ли рост стоимости задачи фронтира в данных Artificial Analysis
Что делать сейчас
Считать стоимость задачи и P95 времени ответа, а не токены
Направление
Агентные сессии
Что доказано
Ступень 4: сроки жизни кеша 5 мин / 1 ч / 24 ч в API; пулы KV у Moonshot и Alibaba
Что нет
Планировщики уровня сессии вне лабораторий; всплески субагентов в реальных трейсах
Сигнал до 2028 года
Опубликует ли кто-то SLA на долю попаданий для суточных сессий
Что делать сейчас
Стабильный префикс, маршрут по сессии, выгрузка KV на паузах человека
Направление
Мультимодальные стадии и модели мира
Что доказано
Ступень 3: E/P/D в vLLM; потоковая речь в продуктах; интерактивные миры — демо
Что нет
Точность после сжатия визуальных токенов; стоимость часа интерактивной генерации
Сигнал до 2028 года
Раскроет ли кто-то цену часа пользователя в генеративном мире
Что делать сейчас
Профилировать кодировщик отдельно: у него свой пул и свой объект передачи
Направление
Энергия, управление, доверие
Что доказано
Ступень 4 для SLO-маршрутизации в Kubernetes и llm-d; ступень 5 для конфиденциальных вычислений у Apple, Google, Meta
Что нет
Экономия энергии при насыщенном парке; накладные конфиденциального режима на Blackwell
Сигнал до 2028 года
Опубликует ли гиперскейлер полезные токены на мегаватт
Что делать сейчас
Фиксировать частоту на генерации; резервировать 15–25% под конфиденциальный режим

Из карты следует не список покупок, а порядок экспериментов. Сначала — трейс, потому что каждое направление окупается только при определённой форме нагрузки: гибридное внимание — выше 128K контекста, разделение внимания и FFN — при MoE и быстром межсоединении, четырёхстадийное разделение — при отношении вход/выход от 10, спекуляция — при малой параллельности, кеш на SSD — при паузах в минуты и часы. Затем — ставки без сожалений, которые выигрывают почти при любом профиле. Потом — условные, у каждой из которых есть измеримый порог. И список того, чего делать не стоит, пока ступень не сменилась.

Порядок действий для платформенной команды

  • Снять трейс с четырьмя распределениями из предыдущей статьи и добавить к ним долю запросов длиннее 128K, отношение вход/выход, повтор префикса в зависимости от паузы и параллельность внутри сессии.
  • Для каждого направления — один эксперимент с честной базой: та же модель, тот же движок без экспериментальных флагов, SLO на P95 и стоимость задачи, а не лучший показатель токенов в секунду.
  • Ставки без сожалений: префиксный кеш с уровнями DRAM и SSD по бюджету с трейса; FP4 или INT4 для весов экспертов с проверкой точности задач; спекуляция, пока проверка ограничена памятью; фиксация частоты на узлах генерации.
  • Ставки с порогом: гибридное внимание при доле длинных контекстов; разделение внимания и экспертов только в NVLink-домене; отдельный пул кодировщика при заметной доле изображений; кремний на SRAM как услуга для задач, где платят за задержку.
  • Чего не делать: диффузионную модель как основную при высокой параллельности; вытеснение думающих токенов без проверки на своих задачах; квантование ниже четырёх бит для рассуждений; проектирование под анонсированный, но не поставленный кремний.
  • Пересмотреть карту через полгода по сигналам: поставки LPX и CS-4 с независимыми замерами, снятие пометки «экспериментально» с P/D в vLLM, следующий отчёт MiniMax об архитектуре, стоимость задачи фронтира у Artificial Analysis, первое SLA на долю попаданий для суточных сессий.
  • Фронтир читается по трём вопросам: какой ресурс, против какой базы, что должно стать правдой.
  • Кратный выигрыш на первой ступени — гипотеза; на четвёртой — чей-то инженерный факт; на шестой — ваше ожидание по умолчанию.
  • Самый частый способ ошибиться — перемножить множители из разных ступеней и разных параллельностей.

Трейс → ступень лестницы → эксперимент с базой → порог окупаемости → решение → пересмотр через полгода

Главный вывод карты совпадает с выводом предыдущей статьи, но на ступень выше. Инференс остаётся распределённой системой, где модель задаёт форму состояния и допустимые числа, кремний — байты в секунду и домен межсоединения, среда выполнения — порядок работы, а нагрузка — рассуждения, агенты, видео — форму запроса. Фронтир 2026 года не отменяет ни одного слоя, он спорит о границах между ними: где проходит разрез, кто владеет состоянием и чем платить за следующий множитель.

Выводы

Семь выводов с фронтира

  1. 01Фронтир отличается от нормы не новизной идей, а ступенью доказательства: каждое «в N раз» нужно читать вместе с базой сравнения, параллельностью, при которой оно получено, и ресурсом, который оно экономит.
  2. 02Физику генерации меняют два направления — фиксированное состояние и разреженное чтение; модели с ними уже в эксплуатации, а системный слой — префиксный кеш, спекуляция, разделение стадий — отстаёт примерно на год, и MiniMax с DeepSeek показывают, что «внимание, сделанное дешевле» пока держит фронт.
  3. 03Параллельная генерация выиграла не как замена авторегрессии, а как черновик: диффузионные модели платят качеством и кешем, спекуляция нового поколения — долей принятия при большом пакете; у DeepSeek и Tencent в эксплуатации именно гибрид.
  4. 04Разделение глубже стадий доказано у ByteDance, StepFun и Huawei на MoE с быстрым межсоединением, а кремний под стадию прошёл через отмену Rubin CPX и анонс Groq 3 LPX без единого независимого замера.
  5. 05KV-кеш уже продаётся как хранилище с тарифом за чтение, запись и час; уровни DRAM → SSD → пул измерены на трейсах, а повтор вне префикса, обученное сжатие, CXL и изоляция арендаторов остаются ставками.
  6. 06FP4 и обучение с учётом квантования стали нормой для весов экспертов MoE, но доказательств для активаций и KV при рассуждениях без QAT и для чего-либо ниже четырёх бит в масштабе нет.
  7. 07Рассуждения и агенты перевернули форму нагрузки: выход в десятки раз длиннее входа, сессия с паузами человека — единица планирования, а единица учёта — задача, не токен; энергия при этом ограничивает рост парка, а не эксплуатацию существующего.
Источники

Работы, документация и границы доказательности

Список сгруппирован по направлениям. Рядом с каждым числом в статье названа база сравнения; у заявлений компаний указано, что это заявление. Документация и прайс-листы фиксируют состояние на дату проверки — 22 августа 2026 года.

Метод и базы сравнения

  1. Liu et al. · Speculative Decoding: Performance or Illusion?препринт от 31 декабря 2025 года: первая оценка спекуляции в эксплуатационной vLLM — существенный разрыв между наблюдаемым и теоретическим ускорением; проверка доминирует
  2. vLLM · EAGLE 3.1блог от 26 мая 2026 года: на Kimi K2.6 NVFP4 (GB200, TP4) ускорение 2,03× при одном потоке и 1,66× при шестнадцати — пример того, как «в N раз» зависит от параллельности

Архитектуры внимания и состояния

  1. Yang, Kautz, Hatamizadeh · Gated Delta NetworksICLR 2025: гейт забывания плюс дельта-правило; рекуррентный слой гибридов Qwen3-Next, Qwen3.5 и, в расширенном виде, Kimi Linear/K3
  2. Kimi Team · Kimi Linearпрепринт от 30 октября 2025 года: единственное контролируемое сравнение одинакового размера — KV −75%, TPOT 6,3× на 1M против MLA, выигрыш ниже 128K незначителен
  3. vLLM · Kimi K3 day-0блог от 27 июля 2026 года: 69 слоёв KDA и 24 слоя MLA, контрольные точки состояния для префиксного кеша, 111 → 331 ток/с на пользователя со спекуляцией на GB300 NVL72; доля попаданий «более 90%» — заявление Moonshot
  4. Sun · Why Did M2 End Up as a Full Attention Model?заметка MiniMax от 29 октября 2025 года: гибриды совпадали по бенчмаркам, но показали дефициты в многошаговых рассуждениях, чувствительность к точности и незрелость инфраструктуры; главный контраргумент раздела
  5. DeepSeek-AI · DeepSeek-V3.2 and DeepSeek Sparse Attentionотчёт от 2 декабря 2025 года: индексатор отбирает 2048 токенов под MLA — O(L·k) вместо O(L²); качество «на уровне V3.1-Terminus», цена API снижена более чем вдвое
  6. DeepSeek-AI · DeepSeek-V4отчёт 2026 года: гибрид сжатого разреженного и сильно сжатого внимания — на 1M токенов 27% операций и 10% KV-кеша от V3.2; FP4 для экспертов через QAT; KV-кеш на диске как уровень хранения
  7. vLLM · Disaggregated Serving for Hybrid SSM Modelsблог от 21 апреля 2026 года: состояние Mamba передаётся одним блоком через NIXL; разделение выигрывает у совмещённого пула выше ~64 одновременных пользователей на 8×H200; GDN-модели — «в работе»
  8. vLLM · issue #40696: short prompts get no prefix-cache hits on hybrid modelsапрель 2026 года: из-за раздутого блока внимания запросы короче 528 токенов давали ~0% попаданий, а QPS в эксплуатации упал с 200 до менее 100 — цена фиксированного состояния для префиксного кеша
  9. Chen et al. · Hybrid Linear Attention Done Rightпрепринт от 29 января 2026 года: дистиллированные гибриды рушатся на 128K (Jet-Nemotron 2B — 0,0 против 96,4 у Qwen3); рецепт с NoPE-вниманием даёт 3,0× генерации на 512K

Параллельная генерация и спекуляция

  1. Google DeepMind · DiffusionGemmaанонс от 10 июня 2026 года: 1008 ток/с на H100 при пакете 1, качество ниже Gemma 4 на 5–19 пунктов; оговорка самой Google о том, что при высоком QPS параллельная генерация может стоить дороже
  2. Artificial Analysis · Mercury 2независимое измерение диффузионной модели Inception: 881 ток/с, первый токен через 3,62 с, индекс интеллекта 22 против заявленных вендором 1009 ток/с
  3. Bie et al. · LLaDA2.0: Scaling Up Diffusion Language Models to 100Bпрепринт Ant Group от 10 декабря 2025 года: 100B MoE, преобразованный из AR-модели; на 8×H20 500 ток/с против 258 у AR-базы — «до 1,9×» при малой параллельности
  4. Fu et al. · Nemotron-Labs-Diffusionпрепринт NVIDIA от 7 июля 2026 года: одна модель в трёх режимах — 5,99 токена за проход в самоспекуляции против 2,57 в чистой диффузии; для высокой параллельности рекомендован авторегрессионный режим
  5. SGLang · Multi-token prediction on DeepSeek-V3блог от 17 июля 2025 года: принятая длина 2,44; +60,8% пропускной способности при двух запросах на ранг и лишь +14,2% при 128
  6. Chen, Liang, Liu · DFlash: Block Diffusion for Flash Speculative DecodingICML 2026: пятислойный блочно-диффузионный черновик выдаёт 16 токенов за проход; 4,86× на Qwen3-8B против 1,76–2,02× у EAGLE-3; на B200 5,1× при четырёх потоках и 2,8× при 32
  7. DeepSeek-AI · DSparkпрепринт от 6 июля 2026 года: параллельный черновик с коррекцией и адаптивной длиной проверки; на V4-Pro (8×B300) первый токен блока принимается более чем в 70% случаев, седьмой — менее чем в 10%; «развёрнуто в системе сервинга DeepSeek-V4»
  8. Sadhukhan et al. · MagicDecпрепринт 2024–2025 годов: на длинном контексте проверяющая модель ограничена чтением KV даже при большом пакете, поэтому разреженный черновик даёт 2,51× на пакете 32–256

KV-кеш как хранилище

  1. vLLM · Serving Agentic Workloads at Scale with vLLM × Mooncakeблог от 6 мая 2026 года: Kimi-2.5 NVFP4 на 12 GB200, 610 трейсов Codex — попадания 1,7% → 92,2%, 3,8× пропускной способности, 46× ниже P50 TTFT; база — «без пула вообще»
  2. KVCache.AI · How Much KV Cache Budget Do We Need?заметка от 26 июня 2026 года: на трейсе Claude Code 512 ГБ дают 84% попаданий, 2 ТБ — 88,5%, идеальное ускорение 1/(1−r); колено бюджета около 2 ТБ
  3. KVCache.AI · Scaling KV Cache Beyond Memory with Mooncake SSD Offloadingзаметка от 15 июля 2026 года: на двухчасовом трейсе кластера Qwen без SSD попадания падали с 83% до 36%, а TTFT росло с 6 до 16 с; с SSD — более 84% и не выше 9,4 с
  4. Yang et al. · Beluga: CXL memory pooling for KV cacheSIGMOD 2026, Alibaba Cloud: пул 8 ТБ через коммутатор CXL 2.0 — TTFT при попадании 1,36 с против 13,0 с у Mooncake v3.2 и 18,2 с пересчёта на H20; прототип
  5. Yao et al. · CacheBlendEuroSys 2025: повтор KV фрагментов в любой позиции с пересчётом 10–15% токенов — TTFT 2,2–3,3× ниже при качестве в пределах 0,02 F1 на QA и суммаризации; в LMCache с августа 2026 года поиск по всему парку
  6. Eyuboglu et al. · Cartridgesпрепринт Stanford от 6 июня 2025 года: обученный KV-кеш корпуса — 38,6× меньше памяти и 26,4× выше пропускная способность против обычного контекста на Llama-8B; авторы признают, что самообучение дороже обработки контекста и окупается при многократных запросах
  7. Agrawal, Mayer · Benchmarking KV-Cache Optimizations across Task Quality and System Performanceпрепринт 2026 года: вытеснение и агрессивное квантование теряют 8–36% на суммаризации; «степень сжатия сама по себе плохо предсказывает итоговую производительность»
  8. Gu et al. · Auditing Prompt Caching in Language Model APIsICML 2025: тайминговый аудит нашёл глобальный, межпользовательский кеш у семи провайдеров, включая OpenAI; доказательство того, что область разделения кеша — решение безопасности
  9. DeepSeek · API pricingпрайс-лист, проверенный 22 августа 2026 года: попадание в кеш V4-Pro стоит $0,022 за миллион токенов в непиковое время против $0,66 при промахе; кеш «на диске» живёт от часов до дней
  10. Microsoft Learn · Prompt caching with Azure OpenAIдокумент от 11 августа 2026 года: суточное удержание кеша «выгрузкой KV-тензоров в локальное хранилище GPU», по умолчанию для gpt-5.5; у GPT-5.6 — явные точки разрыва, минимальный TTL 30 минут и платная запись

Числовые форматы

  1. NVIDIA · Introducing NVFP4блог от 24 июня 2025 года: блок 16 с масштабом E4M3 и масштабом FP32 на тензор против блока 32 с масштабом E8M0 у MXFP4; DeepSeek-R1 в NVFP4 — потеря «1% и меньше» против FP8 по таблицам вендора
  2. NVIDIA · Nemotron 3 Ultraотчёт от 12 июня 2026 года: 550B/55B гибрид, все 20T токенов предобучения в NVFP4; разрыв по функции потерь менее 0,4% по абляции самой NVIDIA; независимого воспроизведения нет
  3. OpenAI · gpt-oss-120b & gpt-oss-20b Model Cardкарточка от 8 августа 2025 года: веса MoE «пост-обучены с квантованием в MXFP4» — 4,25 бита на параметр, более 90% параметров; все оценки выполнены в MXFP4
  4. Moonshot AI · Kimi K2 Thinking model cardноябрь 2025 года: INT4 для весов MoE через обучение с учётом квантования на пост-обучении — «без потерь, двукратное ускорение в режиме низкой задержки»; все бенчмарки в INT4, абляции против BF16 не опубликовано
  5. Lotfi et al. · Quantized Reasoning Models Think They Need to Think Longer, but They Do Notпрепринт Meta от 29 мая 2026 года: 3-битная AWQ на R1-Distill-Qwen-1.5B роняет MATH-500 с 85,6 до 47,0 при росте цепочки с 5,2K до 23,4K токенов; до 52% неудач доходят до верного ответа и не фиксируют его
  6. Lee et al. · ReQAT: Full-Precision Reasoning Accuracy with 4-bit Floating-Point QATICML 2026: на R1-Distill-Qwen-14B AIME падает с 56,83 до 50,13 после обычного NVFP4 W4A4KV4 и поднимается до 65,63 после QAT с выравниванием по трассам рассуждений
  7. Ma et al. · BitNet b1.58 2B4T Technical ReportMicrosoft, 16 апреля 2025 года: 2,4B троичных весов на 4T токенов; bitnet.cpp даёт 2,37–6,17× на x86 и −72–82% энергии; крупнее 2,4B официальной троичной модели на август 2026 года нет
  8. apsys · TFLOPS Gap: FP4 MoE kernels on Blackwellянварь 2026 года: FP4-ядра MoE дают 3,54× над BF16 на пакете 4096, 2,23× на 128 и 0,86× — медленнее BF16 — на пакете 1 в vLLM; где именно окупается FP4

Рассуждения и бюджеты

  1. Alibaba · ServeGen: Workload Characterization and Generation of LLM ServingNSDI 2026: в эксплуатационных трейсах длина рассуждения в среднем в четыре раза больше длины ответа, распределение бимодально; многоходовые запросы — 9,6% трафика DeepSeek-R1
  2. DeepSeek · V3/R1 Inference System Overview27–28 февраля 2025 года: 608B входных токенов в день при 56,3% попаданий, 168B выходных; блок обработки контекста из 4 узлов против блока генерации из 18; $87 тыс. расходов против $562 тыс. теоретической выручки в день
  3. Artificial Analysis · Intelligence Index v4.115 июня 2026 года: стоимость и время задачи индекса — Opus 4.8 max $1,78 и 6,4 минуты, GPT-5.5 xhigh $0,99 и 3,7 минуты, DeepSeek V4 Pro max $0,04; единица учёта сместилась с токена на задачу
  4. Google · Sundar Pichai at I/O 202619 мая 2026 года: более 3,2 квадриллиона токенов в месяц, семикратный рост за год; число охватывает все поверхности Google и не разделяет токены рассуждений
  5. Gundlach et al. · The Price of Progressпрепринт от 28 ноября 2025 года: цена за единицу качества падает в 5–10 раз в год, но запуск фронтира дорожает в 3–18 раз в год из-за масштаба и рассуждений
  6. Anthropic · Effort and task budgetsдокументация, проверенная 22 августа 2026 года: budget_tokens заменён уровнями усилия, а бюджет задачи — «мягкая подсказка, а не жёсткий лимит»; единственное жёсткое ограничение — max_tokens
  7. Geiping et al. · Scaling up Test-Time Compute with Latent Reasoningпрепринт от 7 февраля 2025 года: рекуррентная глубина вместо токенов рассуждения на модели 3,5B; к августу 2026 года ни один фронтирный продукт латентные рассуждения не использует
  8. Fu et al. · Efficiently Serving LLM Reasoning Programs with Certaindexпрепринт 2024–2025 годов: метрика устойчивости ответа для раннего выхода — до 50% сэкономленных вычислений и 3,3× пропускной способности без потери точности на открытых моделях

Агентные нагрузки

  1. Zhu et al. · TraceLab: Characterizing Coding Agent Workloads for LLM Servingпрепринт Университета Вашингтона от 29 июня 2026 года: 4265 сессий Claude Code и Codex — 294:1 вход к выходу, 95,7% попаданий в префикс, промахи на паузах дольше пяти минут, 59,5% стоимости — префиксные токены
  2. Liu et al. · Agentic Coding in the Wild: GitHub Copilot Traces at Production Scaleпрепринт Microsoft от 30 июля 2026 года: 13,5 млн сессий за неделю — 87% вызовов инициирует агент, попадания ~98% внутри хода и 55% на границе хода, −66 п. п. после уплотнения контекста, параллельность внутри сессии около единицы
  3. Li et al. · Continuum: Multi-Turn Agent Scheduling with KV Cache Time-to-Liveпрепринт от 4 ноября 2025 года, ICLR 2026: срок жизни KV равен ожидаемой длительности инструмента — среднее время задачи на 500 SWE-bench Verified в 8,18 раза ниже, чем у SGLang 0.5.5 и Dynamo 0.7
  4. Luo et al. · Autellix: Serving LLM Agents as General Programsпрепринт от 19 февраля 2025 года: программа как единица планирования — 4–15× пропускной способности при равной задержке против vLLM 0.6.1 с FCFS; выигрыш в основном за счёт снятой блокировки головы очереди
  5. Guo, Wu, Yiu · SAGA: Workflow-Atomic Scheduling for Agent Inferenceпрепринт от 1 мая 2026 года: на 64 GPU время задачи на SWE-bench и WebArena ниже в 1,64 раза, но пиковая пропускная способность на 30% ниже, чем у планирования под максимальный поток
  6. Yu et al. · Prism: Multi-LLM Serving via GPU Memory BallooningOSDI 2026: виртуальная память GPU перераспределяет KV между моделями — до 2× ниже стоимость при равном SLO; авторы сообщают о развёртывании на 10K+ GPU и 3,89× токенов на GPU у неназванной компании
  7. Anthropic · Prompt cachingдокументация, проверенная 22 августа 2026 года: срок жизни 5 минут или час, запись 1,25× или 2× цены входа, чтение 0,1×; сессионного кеша дольше часа нет
  8. Anthropic · Claude Managed Agentsбета с апреля 2026 года: сессия, песочница и история хранятся на стороне сервера, $0,08 за час активной сессии плюс токены; срок жизни KV не опубликован

Разделение глубже стадий и кремний под стадию

  1. Zhu et al. · MegaScale-Infer: Disaggregated Expert ParallelismSIGCOMM 2025, ByteDance: пул внимания и пул экспертов с чередованием микропакетов — 2,56–7,11× генерации на GPU против vLLM на Ampere; в эксплуатации у ByteDance с заявленным снижением стоимости в 1,5–2 раза; код не опубликован
  2. StepFun · Step-3: Model-System Co-design for Cost-effective Decodingпрепринт от 25 июля 2025 года: внимание MFA с интенсивностью 128 операций на байт под дешёвые GPU и разделение внимания и FFN через StepMesh — 3910 ток/с на GPU при TPOT 50 мс на 32 Hopper против 2324 у DeepSeek-V3; цена за миллион токенов — теоретическая таблица
  3. Forys et al. · When Does Disaggregation Pay? Simulating Prefill–Decode–Attention–FFN Specializationпрепринт от 4 августа 2026 года: четырёхстадийное разделение даёт до 1,92× на агентных трейсах, но только при отношении вход/выход не меньше 10; на H100 и A100 обычное P/D не хуже для шести из восьми моделей; симуляция
  4. Wu et al. · ExpertPlex: Disaggregated Serving for MoE with Adaptive Persistent Kernelsпрепринт от 20 июля 2026 года: обратный разрез — эксперты общие для обработки контекста и генерации, разделено только внимание; полезная пропускная способность в 2,01 раза выше, чем у P/D на уровне экземпляров, на H800
  5. NVIDIA · Rubin CPX announcementпресс-релиз от 9 сентября 2025 года: 30 ПФЛОПС NVFP4, 128 ГБ GDDR7, «втрое быстрее внимание, чем GB300 NVL72», поставки «в конце 2026 года»; к GTC 2026 чип исчез из дорожной карты без официального заявления
  6. NVIDIA · Inside NVIDIA Groq 3 LPXблог от 16 марта 2026 года: внимание на GPU Vera Rubin, FFN и эксперты на LPU с 500 МБ SRAM и 150 ТБ/с — NVIDIA сама называет это «разделением внимания и FFN»; «35× пропускной способности на мегаватт» — заявление без независимых измерений
  7. Lockwood · GTC 2026 recapзаметка от 23 марта 2026 года: «Rubin CPX умер через три месяца после анонса»; разбор ограничений LPX — нет HBM, SRAM кончается при большом пакете, активации пересекают сеть на каждом слое
  8. NVIDIA · Dynamo 1.0 is production ready16 марта 2026 года: «до 7×» запросов на Blackwell по InferenceX на DeepSeek R1 в FP4 при 1K/1K; среди пользователей названы ByteDance, Meituan, Tencent Cloud, Together, Baseten и CoreWeave

Кремний за пределами GPU

  1. Artificial Analysis · gpt-oss-120b providersснимок от 22 августа 2026 года: Cerebras 1733 ток/с при $0,15 за миллион, SambaNova 699, Groq 474 при $0,06 — против низких сотен у GPU-провайдеров; единственные независимые измерения кремния на SRAM
  2. Cerebras · Introducing CS-4август 2026 года: три пластины WSE-3 Turbo на стойку, «в 30 раз быстрее GPU-систем», первые поставки в третьем квартале 2026 года; базы сравнения не названы, в MLPerf компания не участвует
  3. MLCommons · MLPerf Inference v6.0 results1 апреля 2026 года: 24 участника, новые тесты gpt-oss-120B и интерактивный DeepSeek-R1 со спекуляцией; среди участников нет ни Cerebras, ни Groq, ни SambaNova, ни d-Matrix
  4. SK hynix, KAIST · NELSSA: near-memory processing over CXL for long-context decodeMICRO 2026: единственный измеренный на реальном прототипе результат вычислений у памяти — четыре CXL-устройства с процессорными ядрами рядом с H100 дают до 5,5× токенов в секунду на контексте 128K–1M против одного GPU
  5. SemiAnalysis · Vera Rubin: extreme co-design25 февраля 2026 года: восемь стеков HBM4, 288 ГБ и цель 22 ТБ/с на GPU при 50 ПФЛОПС NVFP4; поставщики поначалу могут дать около 20 ТБ/с — единственный шаг, который в 2026 году меняет байты в секунду у массового кремния
  6. Samsung · Optimizing KV Cache Offloading to CMM-D in a CXL Switch-based Memory Poolиюнь 2026 года: пул CXL 2.0 на восьми RTX PRO 6000 даёт 92,3% производительности локальной DRAM при 35–47 ГБ/с — уровень ёмкости, а не полосы

Мультимодальность и модели мира

  1. Qiu et al. · ModServe: Modality- and Stage-Aware Resource DisaggregationSoCC 2025, Microsoft: кодирование изображения занимает 25–79% TTFT в зависимости от архитектуры; раздельные пулы кодировщика и текста дают 3,3–5,5× пропускной способности против монолитного vLLM на 128 A100
  2. vLLM · EPD disaggregation trackerоткрытый трекер от 15 августа 2026 года: коннекторы кеша кодировщика через Mooncake, NIXL и LMCache, GPU-предобработка; в SGLang стадии кодировщика нет, в TensorRT-LLM тесты E/P/D нестабильны
  3. Google · Gemini API video understandingдокументация, проверенная 22 августа 2026 года: 258 токенов на кадр при одном кадре в секунду плюс 32 звуковых токена в секунду — около 300 токенов на секунду видео; контекст в миллион токенов — примерно час видео
  4. Wen et al. · DART: duplication matters more than importanceпрепринт 2025 года: отбор визуальных токенов по важности внимания «обычно хуже случайного отбора»; по дублированию можно убрать 89% токенов при 1,99× сквозного ускорения
  5. Dou, Tian · When Do Fewer Visual Tokens Accelerate Multimodal Inference?препринт от 4 августа 2026 года: «меньше визуальных токенов не гарантирует меньшую задержку» — выигрывает только маршрутизация до кодировщика, которая пропускает предобработку; пилот на 30 примерах
  6. Qwen Team · Qwen3-Omni Technical Report22 сентября 2025 года: архитектура Thinker–Talker с потоковым синтезом речи от первого кадра кодека, теоретическая задержка первого пакета 234 мс; по карточке модели 15 секунд видео требуют 78,85 ГБ, 120 секунд — 144,81 ГБ; vLLM обслуживает только Thinker
  7. Zhi et al. · LiveServeпрепринт от 22 июня 2026 года: планировщик видит прогресс воспроизведения и перебивание пользователя; на vLLM-Omni P90 задержки первого пакета ниже в 1,55 раза, число завершённых запросов выше в 1,15 раза
  8. Google DeepMind · Genie 35 августа 2025 года: 24 кадра в секунду при 720p, несколько минут взаимодействия, визуальная память около минуты; к лету 2026 года доступно как Project Genie в подписке Google AI Ultra без раскрытия стоимости часа
  9. Wang et al. · Matrix-Game 3.0препринт от 10 апреля 2026 года: дистилляция и квантование дают до 40 кадров в секунду при 720p на модели 5B с устойчивой памятью на минутных последовательностях; один пользователь, один GPU
  10. Microsoft Learn · Sora 2 video generationдокумент от 5 июня 2026 года: генерация клипа «обычно занимает от 1 до 5 минут»; в журнале примера четырёхсекундный клип 720×1280 создавался 67 секунд — примерно в 17 раз медленнее реального времени

Энергия, управление, доверие

  1. IEA · Key Questions on Energy and AI16 апреля 2026 года: 485 ТВт·ч в 2025 году (+17%), ИИ-ориентированные центры +50%; около 950 ТВт·ч к 2030 году; 15–27 ГВт газовой генерации на площадках, в основном в США
  2. Epoch AI · AI data center power capacity16 января 2026 года: около 30 ГВт мощности ИИ-центров на конец 2025 года — сопоставимо с пиком штата Нью-Йорк; оценка по поставкам чипов, а не по счётчикам
  3. Ma et al. · The Illusion of Power Capping in LLM Decodeпрепринт от 12 мая 2026 года: на H200 генерация потребляет 137–300 Вт из 700, поэтому лимит мощности не срабатывает; фиксация частоты возвращает до 32% энергии генерации; MLA и линейное внимание вдвое снижают энергию запроса против GQA
  4. Liu et al. · GreenLLM: SLO-Aware Dynamic Frequency Scalingпрепринт от 22 августа 2025 года: до 34% экономии против DVFS по умолчанию при менее 3,5% дополнительных нарушений SLO — но 27,5% при 1 QPS и лишь 6,8% при 10 QPS на трейсе Alibaba
  5. Stojkovic et al. · DynamoLLMHPCA 2025: парк делится на пулы по размеру запроса и SLO с подбором числа реплик, степени TP и частоты GPU — 53% энергии при SLO «P99 не хуже пятикратной ненагруженной задержки»; парковые числа получены в симуляции
  6. Lim et al. · Lodestar: An Online-Learning LLM Inference Routerпрепринт от 31 мая 2026 года: обучаемый онлайн маршрутизатор поверх AIBrix — TTFT ниже в 1,41 раза в среднем и до 4,4 раза на гетерогенном парке из старых A30 и V100; стенд, а не эксплуатация
  7. llm-d · v0.9.0выпуск от 17 августа 2026 года: предиктор задержки и руководство по автомасштабированию по SLO; на официальных страницах нет бенчмарка для маршрута по предсказанной задержке
  8. Wang, Waqas, Smith · Confidential GPU inference overhead (Mozilla)препринт от 20 мая 2026 года: H100 с Intel TDX при фиксированной интенсивности — TTFT +22–28%, пропускная способность −18–21%; рекомендация резервировать 15–25% мощности
  9. Apple Security Research · Expanding Private Cloud Compute8 июня 2026 года: PCC впервые работает вне кремния Apple — на Google Cloud с конфиденциальными GPU NVIDIA, Intel TDX и корнем доверия Titan при тех же гарантиях неадресуемости и проверяемости
Дальше

Связанные материалы

Этот разбор продолжает историю инференса как распределённой системы: там — что стало нормой к 2026 году, здесь — что претендует на следующую норму.