К основному содержимому
ко всем лонгридам
Лонгрид#LocalAI#MLSystems

Локальный инференс LLM в 2026 году: модели, железо, скорость и цена

Практический атлас локального запуска: от небольшой модели на существующем компьютере до 120B MoE на рабочей станции. Здесь нет универсального рейтинга. Вместо него — арифметика памяти, текущие цены, раздельные измерения обработки входа и генерации, границы лицензий и конфигурации под конкретную работу.

8 августа 2026≈ 38 минутпервичные источники ↓

Исследование, цены и состояние инструментов проверены по источникам на 8 августа 2026 года. Цены — снимок публичных US-магазинов/MSRP до налогов; наличие и цены в других странах отличаются.

Короткий ответ
24–32 ГБ

Практический оптимум: gpt-oss-20b, Qwen3.6-35B-A3B, Gemma 4 26B-A4B, плотные модели 14–27B в Q4.

64–128 ГБ

Класс 70–120B: gpt-oss-120b, Llama 4 Scout и большие Qwen. Вместимость растёт быстрее скорости — смотрите полосу памяти.

Покупка

Сначала повторите свой трейс на точном кванте и среде выполнения. «Модель загрузилась» — только проверка вместимости, не полезности системы.

01

Локальный — это место доверия и задержки, а не размер корпуса

Под в этом разборе понимается выполнение открытых или доступных весов внутри контура, который контролирует владелец: на телефоне, ноутбуке, рабочей станции или небольшом сервере в офисе. Устройство может отдавать локальный HTTP API нескольким людям — важна граница данных и эксплуатации, а не то, стоит ли компьютер буквально на столе.

Это не обязательно замена облачному API. Локальная модель полезна, когда данные нельзя отправлять наружу, связь нестабильна, требуется предсказуемая задержка без сетевого пути, нужны свои веса/адаптеры или нагрузка достаточно постоянна, чтобы окупить устройство. Облако лучше переживает пики, быстрее даёт новую фронтирную модель и не требует держать драйверы, охлаждение и обновления.

Схема 1 · контур выбора локального инференса
Контур локального инференсаЛОКАЛЬНО — ЭТО КОНТУР ОГРАНИЧЕНИЙПОЛЕЗНАЯ МОДЕЛЬкачество · возможностилицензияРАЗМЕЩЕНИЕ + КОНТЕКСТвеса · KV · запасПОЛОСА + ПРОГРАММНЫЙ СТЕКскорость генерации · поддержка ядерНАГРУЗКАдлина входа / ответапараллельностьРЕЖИМ РАБОТЫофлайн · API на столеобщий серверОдного числа параметров недостаточно, чтобы выбрать пару модель–железо

Четыре разных значения слова «эффективно»

  • Модель помещается вместе с контекстом и рабочими буферами, не уходя в постоянную выгрузку на CPU.
  • Первый токен и поток ответа достаточно быстры для сценария: фоновая обработка допускает секунды, редактор кода — нет.
  • Качество проходит заданный набор задач, включая формат, русский язык, инструменты и отказ от ответа.
  • Полная стоимость, приватность и эксплуатация выгоднее доступной альтернативы — облачной или более маленькой модели.

Локальный продукт = точные веса × точный формат × среда выполнения × контекст × параллельность × лицензия. Название семейства без остальных множителей не является конфигурацией.

Три разных локальных контура

Первый контур — модель непосредственно на пользовательском устройстве. Запрос, кеш и результат не покидают телефон или ноутбук; приложение работает без сети и может использовать локальные файлы без отдельного сервера. Здесь важны энергопотребление, размер установочного пакета, время холодного старта и совместимость с NPU, Metal или встроенной графикой. Пиковая скорость редко является единственной целью: модель должна не разряжать батарею и не вытеснять из памяти основное приложение.

Второй контур — персональная рабочая станция. Модель слушает только локальный интерфейс или домашнюю сеть, а редактор кода, RAG и агент обращаются к ней через совместимый API. Такой вариант допускает дискретную GPU, большой SSD и постоянный процесс сервера, но по-прежнему оптимизируется под одного активного человека. Запросы обычно идут рывками: несколько минут агентной работы сменяются длинным простоем. Поэтому быстрый первый токен, возможность освободить память и тихое охлаждение часто важнее максимального суммарного числа токенов в секунду по нескольким одновременным запросам.

Третий контур — сервер команды внутри офиса, филиала или частного облака. Данные остаются в контролируемой сети, но система уже не персональная: нужны очередь, аутентификация, лимиты, журналы доступа, резервирование и политика обновления весов. Один и тот же компьютер может физически стоять под столом, однако по эксплуатационной модели это полноценный сервис. Сравнивать его только с подпиской на настольное приложение неправильно — альтернативой становится облачный API с аналогичными SLO, наблюдаемостью и числом пользователей.

Наконец, «локально» не автоматически означает «приватно». Загрузчик модели может обращаться к внешнему реестру, оболочка — отправлять телеметрию, инструмент агента — вызывать поисковую систему, а резервная копия истории — уходить в облако. Для чувствительного сценария проверяют весь путь данных: разрешение имён и загрузку весов, журнал запросов, плагины, обновления, резервные копии и исходящие соединения. Граница доверия определяется самым внешним компонентом, который видит исходный запрос, а не местом исполнения матричного умножения.

02

Сначала память: веса, KV-кеш и запас

Минимум для весов можно оценить до скачивания. Для модели с P миллиардами параметров и b битами на параметр арифметический нижний предел равен P × b / 8 гигабайт. Но файл GGUF, GPTQ, AWQ или FP4 хранит шкалы, групповые коэффициенты и метаданные. В памяти также живут рабочие тензоры, графы, токенизатор, иногда кодировщик изображений/аудио и операционная система.

Q4/Q5 сокращает размер и трафик, но не является обещанием одинаковой скорости или качества. Q4_K_M в llama.cpp, AWQ W4A16, GPTQ Int4 и Blackwell MXFP4 — разные упаковки с разными ядрами. «Четыре бита» без названия артефакта и среды выполнения — неполная запись.

Mпика ≈ Mвесов + MKV + Mсреды + MОС/кодировщика
Mконфигурации ≥ Mпика × 1,15–1,25
дополнительные 15–25% покрывают колебания нагрузки, фоновые процессы и обновления среды
Схема 2 · из чего складывается бюджет памяти
Бюджет памяти локального инференсаРАЗМЕЩЕНИЕ — СУММА, А НЕ РАЗМЕР ФАЙЛАВЕСАP × биты / 8+ шкалы и метаданныеKV-КЕШслои × токены× KV-головыСРЕДА ВЫПОЛНЕНИЯграфы · буферыvision · ОС++ПРАВИЛО ПЛАНИРОВАНИЯобъём памяти ≥ расчётный пик × 1,15–1,2535B В ИСХОДНОМ Q4≈ 17,5 ГБ минимумРЕАЛЬНЫЙ ФАЙЛупаковка добавляет байтыДЛИННЫЙ КОНТЕКСТможет съесть весь запас«Загрузилось» ещё не означает «обслуживает нагрузку»

Второй большой член — . Его объём зависит от числа слоёв, KV-голов, длины контекста, размерности головы, точности кеша и числа параллельно обрабатываемых запросов: каждому диалогу или генерации нужен свой KV-кеш. Поэтому заявленные 128K, 256K или миллион токенов — возможность архитектуры, а не бесплатная настройка локального API.

Схема 3 · формула KV-кеша — переиспользована из разбора системного инференса
Формула памяти KV-кешаKV-ПАМЯТЬ РАСТЁТ С КОНТЕКСТОМ И ПАРАЛЛЕЛЬНОСТЬЮ2 (K и V)×слои×KV-головы×размер головы×байты×токеныМногоголовое внимание (MHA)KV-голова на каждую голову запросасамый большой кешВнимание с группировкой (GQA)группы запросов делят K и Vпромежуточный вариантМногозапросное внимание (MQA)один общий набор K и Vсамый маленький кешБЮДЖЕТ ПАРКАкеш на токен × активные токены × реплики + фрагментация + резервАрхитектура модели задаёт коэффициент, нагрузка — множитель

Рабочий лист памяти вместо таблицы «B → ГБ»

Начинайте с фактического размера файла, а не с числа параметров. Если Q4-артефакт занимает 19 ГБ на диске, для расчёта памяти берите 19 ГБ, а не арифметический минимум 17,5 ГБ. Затем один раз запустите именно целевую среду и снимите резидентную память до и сразу после загрузки: некоторые движки распаковывают часть тензоров, резервируют рабочее пространство для ядер или держат копии служебных данных. Показатель после загрузки уже включает резидентные веса, поэтому повторно прибавлять размер файла к нему нельзя. Файл остаётся нижней оценкой и проверкой здравого смысла, а разность между загруженным и исходным процессом показывает цену формата и среды выполнения.

После этого добавляется KV-кеш для рабочего, а не рекламного контекста. У многоголового внимания (MHA) число KV-голов совпадает с числом голов внимания; у внимания с группировкой запросов (GQA) несколько голов запросов делят одну пару ключей и значений; у многозапросного внимания (MQA) такая пара одна на слой. Поэтому две модели одинакового размера и длины окна могут требовать радикально разный кеш. Точность KV тоже отдельна от точности весов: Q4-веса не означают автоматически четырёхбитный кеш. FP16, FP8 и Q8 KV меняют память, скорость и иногда качество по-разному, а поддержка конкретного режима зависит от движка.

При оценке памяти для чата ориентируйтесь не на максимальное контекстное окно модели — например, 256K токенов, — а на объём контекста, уже занятого к началу генерации, и его распределение по запросам. У типичного запроса это может быть 4K токенов инструкций и документов, на уровне P95 — 24K, а при редком анализе репозитория — 80K. Планировать всю систему по редкому максимуму дорого; обрезать всё до среднего опасно. Практичный вариант — гарантировать P95, для длинного хвоста включить отдельный профиль или меньшую параллельность и явно показывать пользователю стоимость большого контекста.

Параллельность почти линейно размножает состояние последовательностей, но не веса. Один процесс с четырьмя чатами не хранит четыре копии модели, зато держит четыре набора KV и служебных буферов. Изображения добавляют токены и память визуального кодировщика; добавляет черновую модель или её кеш; адаптеры LoRA — свои тензоры. На объединённой памяти из номинальных 128 ГБ нельзя обещать модели все 128: ОС, приложения и видеобуферы используют тот же пул. На дискретной карте системная RAM не превращается в VRAM без выгрузки через более медленную шину.

Проверка вместимости = пиковая резидентная память целевых процессов на P95-контексте и рабочей параллельности + не попавшие в замер мультимодальные/черновые компоненты + запас ОС и приложений. В этот пик уже входят веса, накладные расходы среды и KV-кеш.

На 24-гигабайтной карте плотная 27B Q4 с арифметическим минимумом 13,5 ГБ выглядит свободно. Реальный артефакт, длинный KV, изображения и графы CUDA могут быстро превратить запас в дефицит. Для Qwen3.6-35B-A3B минимум Q4 — 17,5 ГБ, но официальный FP8-файл весов занимает около 37,5 ГБ: он предназначен уже для 48 ГБ, а Q4 сообщества в 24 ГБ требует короткого контекста и проверки качества.

Плотные модели и MoE отвечают на разные вопросы

В плотной модели почти все веса участвуют в каждом токене. В модели типа все эксперты обычно должны поместиться, но маршрутизатор активирует только часть. Поэтому 35B-A3B хранит около 35B параметров, а для каждого токена задействует около 3B. В эти 3B уже входит общий эксперт — отдельно прибавлять его не нужно. Это главный источник очень высокой скорости современных локальных MoE — и главная причина не путать число активных параметров с требованием к памяти.

Схема 4 · плотная модель и смесь экспертов
Плотные и MoE-модели на локальном железеВМЕСТИМОСТЬ — ПО ВСЕМ ВЕСАМ · СКОРОСТЬ — ПО АКТИВНЫМПЛОТНАЯ 27Bучаствуют все размещённые весаMOE 35B-A3Bвсе эксперты хранятся · часть активнаКАЖДЫЙ ТОКЕН ЧИТАЕТвсю плотную модельРОУТЕР ВЫБИРАЕТактивные эксперты токенаРАЗМЕЩЕНИЕ ≈ ВСЕ БАЙТЫНА ТОКЕН ≈ ВСЕ ВЕСАРАЗМЕЩЕНИЕ ≈ ВСЕ БАЙТЫНА ТОКЕН ≈ АКТИВНЫЕ + РОУТЕР + ВНИМАНИЕMoE ускоряет большую размещённую модель, но не делает её маленькой
03

Карта моделей на 8 августа 2026 года

Рынок открытых весов уже нельзя описать одной лестницей «больше параметров — лучше». Мультимодальность, поддержка инструментов, механизм внимания, доля активных экспертов, доступные форматы квантизации и лицензия часто важнее небольшой разницы в числе параметров. Ниже — короткий список классов, а не рейтинг качества.

Схема 5 · классы моделей и рабочие сценарии
Карта моделей для локального инференсаСНАЧАЛА КЛАСС ЗАДАЧИ, ЗАТЕМ ФАЙЛ ВЕСОВ2–8B всегоустройство / голосовой роутерклассификация · извлечениеGemma E2B/E4B · Qwen3.5≈ 4–8 ГБ НА УСТРОЙСТВЕ8–14Bприватный помощникRAG · лёгкий кодингMinistral 3 · Gemma 4≈ 12–24 ГБ20–35Bкодинг и агентыдокументы + изображенияgpt-oss · Qwen3.6≈ 24–48 ГБ100–120Bобщая рабочая станциярассуждение / оценкаgpt-oss · Llama 4≈ 80–128+ ГБНИЖЕ ЦЕНА · НИЖЕ ЗАДЕРЖКАБОЛЬШЕ ПАМЯТИ · БОЛЬШЕ ЭКСПЛУАТАЦИИСамая большая поместившаяся модель редко даёт лучший локальный продукт
Параметры / класс
2–8Bвсего параметров
Примеры
Gemma 4 E2B/E4B; Ministral 3 3B; Qwen3.5 2B/4B
Память
Gemma 4 E2B/E4B: 2,3/4,5B эффективных, но 5,1/8B хранимых параметров; Q4-веса ≈ 2,6/4 ГБ, планировать 6–8 ГБ
Подходит
Офлайн-команды, классификация, извлечение, голосовой роутер, короткие ответы
Ограничение
Высокая скорость и низкая цена, но слабее сложное рассуждение и код
Параметры / класс
8–14Bповседневный класс
Примеры
Qwen3.5 9B; Gemma 4 12B; Ministral 3 8B/14B
Память
8–14B хранимых параметров; плотные модели используют почти все на каждом токене; Q4-веса ≈ 4–7 ГБ, планировать 12–16 ГБ
Подходит
Приватный чат, RAG, документы, лёгкая работа с кодом, базовая мультимодальность
Ограничение
Лучший первый локальный класс; качество всё ещё надо проверять на своих задачах
Параметры / класс
27–31Bплотные модели
Примеры
Qwen3.6 27B; Gemma 4 31B
Память
27–31B хранимых параметров; плотные модели используют почти все на каждом токене; Q4-веса ≈ 13,5–15,5 ГБ, планировать 24–32 ГБ
Подходит
Код, анализ, RAG с длинными документами, мультимодальные агенты
Ограничение
Предсказуемое качество, но каждый токен читает почти все веса
Параметры / класс
20–35Bпрактический оптимум MoE
Примеры
gpt-oss-20b; Qwen3.6-35B-A3B; Gemma 4 26B-A4B; Nemotron 3 Nano 30B-A3B
Память
20–35B всего, 3–4B активны на токен; исходные FP4/Q4-веса занимают ≈ 11–20 ГБ, планировать 24–32 ГБ
Подходит
Локальные агенты, код, инструменты, рассуждение, быстрый интерактив
Ограничение
В памяти живут все веса, скорость ближе к числу активных; поддержка конкретной архитектуры критична
Параметры / класс
100–122Bрабочая станция
Примеры
gpt-oss-120b; Qwen3.5-122B-A10B; Llama 4 Scout 109B-A17B; Mistral Small 4 119B-A6B
Память
109–122B всего, 5–17B активны на токен; исходные FP4/Q4–Q5-веса занимают ≈ 59–76 ГБ, планировать 80–128 ГБ
Подходит
Сильное рассуждение, общий сервер малой команды, оценка меньших моделей
Ограничение
Mistral Small 4 официально требует серверный класс; его локальный малобитный путь экспериментален. Лицензии и форматы различаются
Параметры / класс
284B+граница локального
Примеры
DeepSeek V4 Flash 284B-A13B; Qwen3.5 397B-A17B; Kimi K2.7 Code 1T-A32B
Память
284B–1T всего, 13–32B активны на токен; нижняя оценка Q4 начинается с ≈ 142 ГБ, официальный INT4-файл Kimi занимает около 595 ГБ; нужны несколько устройств и сотни гигабайт памяти
Подходит
Исследование, совместимость, офлайн-кластер — не обычный персональный помощник
Ограничение
Несколько устройств, сеть и выгрузка весов часто уничтожают преимущество слова «локальный»

Что выглядит особенно практично

Для существующего ноутбука первый разумный опыт — 3–12B: Gemma 4 E4B/12B, Ministral 3 или Qwen3.5 4B/9B. Для новой 24–32 ГБ GPU-системы центр тяжести — gpt-oss-20b, Qwen3.6-27B/35B-A3B, Gemma 4 26B-A4B/31B и Nemotron 3 Nano. Они уже пригодны для кода, документов и вызовов инструментов, но ещё не требуют распределённого размещения.

Качество нельзя вывести из числа параметров

Сравнивайте модели на той форме ответа, которая попадёт в продукт. Для агента разработки недостаточно решить изолированную задачу по алгоритмам: модель должна найти нужный файл, удержать ограничения репозитория, сформировать применимый патч, корректно вызвать инструмент и остановиться после результата. Для RAG важны ссылки на переданные фрагменты и устойчивость к конфликтующим инструкциям в документе. Для русского помощника отдельно проверяются морфология, смешанный русско-английский код и локальные названия, а не только переведённый общий тест.

Оценивайте не только архитектуру модели, но и конкретную сборку весов. Результаты BF16 или официальной FP8-версии нельзя автоматически переносить на стороннюю Q4-сборку: способ квантизации и качество конвертации могут изменить поведение модели. Ошибка может концентрироваться не в среднем ответе, а в редких навыках: строгом JSON, длинном рассуждении, выборе инструмента или зрительном распознавании мелкого текста. Поэтому у строки эвала должны быть полное имя файла, хеш, шаблон чата, параметры выбора токена и версия токенизатора. Если точный артефакт не воспроизводится, его показатель нельзя использовать для покупки железа.

Режим рассуждения тоже меняет экономику. Модель может отвечать точнее, но генерировать в несколько раз больше скрытых или видимых токенов; высокая скорость в токенах в секунду тогда не гарантирует меньшего времени до принятого результата. Осмысленная здесь метрика — принятые задачи в единицу времени; эквивалентный взгляд на одну попытку: ожидаемое время до принятого результата примерно равно задержке полного цикла, делённой на долю принятых задач, с учётом повторов. В фоновом пакетном анализе результат одной задачи можно ждать несколько минут, а неудачные попытки — автоматически повторять. В расширении для IDE даже качественная модель проигрывает, если первый полезный фрагмент появляется после того, как разработчик уже переключился на другую задачу.

Лицензия — такой же жёсткий фильтр, как память

«Открытые веса» — это не одна лицензия. У каждого выпуска свои условия: например, gpt-oss и многие модели Qwen и Mistral распространяются по Apache 2.0, а у Gemma — отдельная лицензия Google. Apache 2.0 обычно разрешает коммерческое использование. Но если вы распространяете модель или производный продукт, нужно приложить текст лицензии, сохранить обязательные уведомления об авторстве и отдельно проверить лицензии токенизатора, кода и других компонентов. У Llama, Nemotron, Kimi и MiniMax свои условия, ограничения использования или пороги, после которых появляются дополнительные обязательства. Название лицензии в реестре модели надо сверять с текстом конкретного выпуска: семейство может менять условия между версиями.

Отдельно проверяются данные и результат. Возможность скачать веса не даёт прав на голоса, изображения, документы или код, переданные модели; синтез речи требует согласия владельца голоса; локальный RAG не отменяет режим коммерческой тайны и сроки хранения. Для продукта зафиксируйте версию лицензии, страницу источника, дату скачивания и набор ограничений рядом с хешем весов. Это превращает будущую замену модели из расследования в обычное обновление зависимости.

Класс 100–120B теперь реален на одном устройстве с 80–128 ГБ благодаря MoE и обученным FP4-форматам. OpenAI прямо указывает 16 ГБ для gpt-oss-20b и 80 ГБ для gpt-oss-120b. Это рекомендация вместимости, не обещание конкретного числа токенов в секунду: DGX Spark, M3 Ultra и RTX PRO 6000 читают память с очень разной скоростью.

Модели 284B–1T остаются «локальными» только в смысле собственного кластера. DeepSeek V4 Flash публикуется примерно 160-гигабайтным файлом весов смешанного формата, Kimi K2.7 Code — около 595 ГБ. Два маленьких узла могут технически запустить большую квантованную модель, но сеть и частичный перенос весов часто дают ответ медленнее хорошей 20–35B модели на одной карте.

Длинное окно — возможность, а не рекомендация

Контекст в 262K или миллион токенов полезен для редких задач, но не заменяет поиск и структуру данных. С ростом окна увеличиваются время обработки входа, KV-кеш и вероятность того, что модель потеряет важное среди второстепенного. Показатель на тесте поиска иголки не равен качеству анализа длинного договора или репозитория. Сравните как минимум три режима: короткий запрос без RAG, отобранные фрагменты с источниками и полный длинный документ. Часто средний вариант даёт лучший ответ при меньшей задержке.

Для мультимодальной модели считаются не только текстовые токены. Разрешение, число кадров, предварительное уменьшение изображения и способ разбиения страницы меняют длину визуальной последовательности. Модель, помещающаяся на текстовом тесте, может выйти за память на пачке сканов. Перед тем как выбирать конфигурацию с 24 или 32 ГБ памяти, запустите модель на реальных PDF, скриншотах и фотографиях. В тест включите максимальное число файлов или страниц, которое система должна обработать за один запрос. Если основная задача — распознавание текста в документах, компактная специализированная модель может оказаться дешевле и стабильнее универсальной модели с 30 млрд параметров.

Не вся локальная AI-работа требует генератора общего назначения

Сценарий
Малое устройство
Модели
LFM2.5-1.2B Thinking; Gemma 4 E2B; SmolVLM2 500M/2.2B
Работа
Команды, извлечение, маршрутизация, простое понимание изображения/видео
Лицензия / формат
У LFM есть порог коммерческой лицензии; Gemma/SmolVLM — Apache 2.0
Сценарий
Корпоративный RAG
Модели
Granite 4.1 3B/8B/30B; Qwen3 Embedding и Reranker 0.6B/4B/8B; Granite Embedding R2
Работа
Инструменты, код, 32K–131K; отдельные модели эмбеддингов и переранжирования
Лицензия / формат
Apache 2.0; есть официальные GGUF/ONNX/OpenVINO-артефакты
Сценарий
Код и репозитории
Модели
Devstral Small 2 24B; Qwen3.6 27B/35B-A3B; gpt-oss-20b
Работа
Изменения файлов, вызовы инструментов, длинный контекст
Лицензия / формат
Apache 2.0; Devstral FP8 официально, малобитные GGUF часто выпускает сообщество
Сценарий
Документы и интерфейсы
Модели
Granite Vision 4.1 4B; Phi-4 reasoning-vision 15B; Gemma 4 12B/26B
Работа
OCR, таблицы, ключ-значение, графики, привязка к интерфейсу
Лицензия / формат
Apache 2.0 или MIT; качество OCR проверять по вашим сканам
Сценарий
Речь локально
Модели
Qwen3-ASR 0.6B/1.7B; Whisper large-v3-turbo; Qwen3-TTS 0.6B/1.7B; Kokoro 82M
Работа
Русский: Qwen3-ASR, Whisper и Qwen3-TTS; Kokoro — лёгкий синтез без русского
Лицензия / формат
Apache 2.0/MIT; задержку аудиоконтура измерять сквозным тестом

Для RAG генератор — только один компонент. Qwen3 Embedding или Granite Embedding могут работать на CPU/малой GPU, Qwen3-Reranker применяется к короткому top-K, а большая LLM получает уже отобранные фрагменты. Такой конвейер часто быстрее и точнее, чем попытка загрузить всю базу в заявленные 256K контекста.

04

Железо: объём памяти определяет, поместится ли модель, а пропускная способность — скорость ответа

Сначала проверьте объём памяти: в ней должны одновременно поместиться веса модели, KV-кеш и служебные данные. Когда система генерирует один ответ, скорость большой плотной модели часто упирается в чтение весов из памяти. Поэтому для локального чата важнее смотреть на , а не только на рекламные TOPS — теоретическое число триллионов операций в секунду. Грубая верхняя оценка скорости проста: разделите реальную пропускную способность памяти на объём весов, который нужно прочитать для получения одного токена. Пиковая пропускная способность из спецификации даёт лишь идеальный потолок. На практике скорость ниже из-за работы механизма внимания и с контекстом, синхронизации и неполной загрузки устройства.

ток/с плотной генерации ≤ устойчивая полоса памяти / байты весов, читаемые на токен
пример по спецификации: 273 ГБ/с пиковой полосы ÷ 42 ГБ ≈ 6,5 ток/с — теоретический потолок для плотной 70B Q4, не измерение
Схема 6 · плоскость объёма и пропускной способности памяти
Объём и пропускная способность памятиОБЪЁМ — ПОМЕСТИТСЯ ЛИ МОДЕЛЬ · ПРОПУСКНАЯ СПОСОБНОСТЬ — СКОРОСТЬ ОТВЕТАОБЪЁМ ПАМЯТИ →ПРОПУСКНАЯ СПОСОБНОСТЬ →16 ГБ32 ГБ64 ГБ128 ГБ256 ГБ512 ГБMac mini M424 ГБ · 120 ГБ/сM4 Pro48 ГБ · 273 ГБ/сRTX 509032 ГБ · 1,79 ТБ/сR9700 / B7032 ГБ · 0,61–0,64 ТБ/сMac Studio M3 Ultra96 ГБ объединённой памяти · 819 ГБ/сMacBook M5 Max128 ГБ · 614 ГБ/сFramework DesktopAMD Ryzen AI Max+ 395 · 128 ГБ · 256 ГБ/сDGX Spark128 ГБ · 273 ГБ/сRTX PRO 600096 ГБ · 1,79 ТБ/сТочки показывают характеристики, а не скорость на одинаковой задаче
Железо
Существующий CPU-ПК
Память / полоса
16–64 ГБ системной RAM; полоса зависит от числа каналов
Цена US
$0 дополнительных затрат
Подходит
2–14B Q4; фоновые задачи и редкий приватный запрос
Ограничение
Самый дешёвый старт; большие плотные модели часто ниже комфортного темпа
Железо
Intel Arc B580
Память / полоса
12 ГБ GDDR6; 456 ГБ/с; 190 Вт
Цена US
$249 RCP · только GPU
Подходит
7–8B Q4/Q8; бюджетный чат, эмбеддинги и небольшой RAG
Ограничение
12 ГБ быстро становятся пределом; стек Intel охватывает меньше устройств и фреймворков, чем CUDA
Железо
RTX 5060 Ti 16 ГБ
Память / полоса
16 ГБ GDDR7; 448 ГБ/с; 180 Вт
Цена US
стартовый MSRP $429 · только GPU
Подходит
7–14B; gpt-oss-20b в родном MXFP4 с коротким проверенным контекстом; быстрый RAG
Ограничение
Плотные 20–24B требуют тесного кванта или частичной выгрузки; 5080 быстрее, но тоже 16 ГБ
Железо
Mac mini M4
Память / полоса
до 24 ГБ доступно в магазине США; 120 ГБ/с
Цена US
$1 199 · 24 ГБ / 512 ГБ
Подходит
2–14B Q4; gpt-oss-20b MXFP4 с коротким проверенным контекстом; тихий API
Ограничение
Metal/MLX удобны, но памяти мало для плотных 20–35B и длинного контекста
Железо
Mac mini M4 Pro
Память / полоса
до 48 ГБ доступно сейчас; 273 ГБ/с
Цена US
$2 199 · 48 ГБ / 512 ГБ
Подходит
9–35B Q4; разработка, приватный RAG, мультимодальность
Ограничение
Хороший баланс рабочего компьютера и инференса; память не обновляется
Железо
RTX 5090
Память / полоса
32 ГБ GDDR7; 1 792 ГБ/с; 575 Вт
Цена US
$1 999 · NVIDIA Marketplace, нет в наличии
Подходит
7–35B; очень высокая скорость при пакете 1 и широкая CUDA-совместимость
Ограничение
Нужны дорогие компьютер, блок питания и охлаждение; 70B целиком не помещается; рыночная цена иная
Железо
Radeon AI PRO R9700
Память / полоса
32 ГБ GDDR6; 640 ГБ/с; 300 Вт
Цена US
$1 299 MSRP · только GPU
Подходит
14–35B; выгодная вместимость для Linux/ROCm
Ограничение
Медленнее 5090 на одинаковом llama.cpp-тесте; покрытие ядер и ОС надо проверять
Железо
Intel Arc Pro B70
Память / полоса
32 ГБ GDDR6 ECC; 608 ГБ/с; 230 Вт у эталонной карты Intel
Цена US
рекомендовано от $949 · только GPU
Подходит
14–35B; дешёвые 32 ГБ и эксперименты с несколькими GPU
Ограничение
Стек XPU/llm-scaler более чувствителен к версиям, чем CUDA
Железо
Mac Studio M4 Max
Память / полоса
36/64 ГБ доступны сейчас; 410/546 ГБ/с
Цена US
$3 499 · 64 ГБ / 512 ГБ
Подходит
20–35B быстро; 70B Q4 на 64 ГБ с ограниченным запасом
Ограничение
Документированный максимум поколения 128 ГБ сейчас не предлагается в магазине США
Железо
MacBook Pro M5 Max
Память / полоса
до 128 ГБ доступно сейчас; до 614 ГБ/с
Цена US
$6 699 · 14″, 128 ГБ / 2 ТБ
Подходит
20–70B быстро; gpt-oss-120b помещается по официальной оценке 80 ГБ, скорость надо измерить
Ограничение
Самый ёмкий актуальный вариант Apple после сокращения конфигураций Studio; цена 128 ГБ выше базовой
Железо
Framework Desktop 128 · AMD Ryzen AI Max+ 395
Память / полоса
128 ГБ LPDDR5x; 256 ГБ/с; до 112 ГБ адресует GPU
Цена US
$3 449 · набор для сборки без SSD/ОС · предзаказ
Подходит
70B Q4 и gpt-oss-120b; тихая персональная лаборатория
Ограничение
Большая вместимость при умеренной полосе; цена выросла со стартовых $1 999
Железо
Mac Studio M3 Ultra
Память / полоса
96 ГБ доступны сейчас; 819 ГБ/с
Цена US
от $5 299 · целая система
Подходит
70B Q4/Q8 и 100–120B в исходном FP4/Q4 с запасом по профилю
Ограничение
Быстро и тихо, но высокая цена; прежние 256/512 ГБ сейчас не заказать
Железо
NVIDIA DGX Spark
Память / полоса
128 ГБ когерентной LPDDR5x; 273 ГБ/с; ConnectX-7
Цена US
$4 699 · целая система
Подходит
gpt-oss-120b, CUDA-прототипирование, два узла для экспериментов
Ограничение
Вместимость и CUDA важнее сырой скорости генерации; Arm64 создаёт пробелы совместимости
Железо
RTX PRO 6000 Blackwell
Память / полоса
96 ГБ GDDR7 ECC; 1 792 ГБ/с; 600 Вт
Цена US
$13 250 · NVIDIA Marketplace, нет в наличии
Подходит
70B быстро, 100–120B в агрессивном формате; общий сервер
Ограничение
Указана текущая цена NVIDIA Marketplace: официальной рекомендованной цены нет. Карта даёт высокую скорость и ECC, но для домашней системы слишком дорога

Почему Apple-линейка выглядит странно именно сейчас

У поколения Mac Studio документированы M4 Max до 128 ГБ и M3 Ultra до 512 ГБ, но текущий американский конфигуратор предлагает лишь 36/64 ГБ и 96 ГБ соответственно. Зато MacBook Pro M5 Max доступен с 128 ГБ и полосой до 614 ГБ/с: в августе 2026 это самый ёмкий вариант Apple, доступный к заказу сейчас. В статье разделены «умеет платформа» и «можно заказать сегодня» — иначе историческая спецификация превращается в ложную рекомендацию покупки.

Дискретная GPU или объединённая память

  • RTX 5090 даёт 1,79 ТБ/с и самый зрелый CUDA-путь, но ограничена 32 ГБ и не имеет NVLink.
  • R9700 и Arc Pro B70 дают те же 32 ГБ дешевле, но поддержку точной модели и кванта надо проверять на связке ОС–драйвер–среда выполнения.
  • Mac/Framework/DGX Spark позволяют адресовать 64–128 ГБ без выгрузки через PCIe, зато их 256–819 ГБ/с сильнее ограничивают большие плотные модели.
  • RTX PRO 6000 совмещает 96 ГБ и 1,79 ТБ/с, но цена и 600 Вт переводят решение из персонального в профессиональный класс.

CPU, NPU и несколько GPU занимают свои ниши

CPU остаётся полезным не только как запасной путь. Маленькие модели, эмбеддинги, переранжирование и фоновая пакетная обработка могут работать на уже купленной машине без отдельной карты. Скорость сильно зависит от каналов памяти и векторных инструкций: два компьютера с одинаковым объёмом RAM не эквивалентны. Для редкого запроса 5–10 ток/с могут быть экономичнее нулевой загрузки большой GPU. Кроме того, llama.cpp позволяет оставить часть слоёв на CPU, чтобы проверить модель крупнее VRAM, но такой режим следует считать экспериментом вместимости, а не обещанием интерактивной скорости.

NPU в ноутбуках и телефонах хорош для устойчивой малой модели, когда критичны батарея и отсутствие шума. Его рекламные TOPS нельзя напрямую сравнивать с полосой дискретной GPU: поддерживаемые операции, формат весов, максимальный размер тензора и инструменты компиляции ограничивают реальную модель. Готовой демонстрации поставщика недостаточно. Убедитесь, что его инструменты позволяют преобразовать и запустить модель нужной архитектуры, а затем обновлять её без выпуска новой версии приложения.

Несколько потребительских GPU складывают объём лишь после разбиения модели, а не превращаются в одну прозрачную память. RTX 5090 не имеет NVLink: слои или тензоры обмениваются через PCIe, синхронизация режет скорость, а корпус должен питать и охлаждать две 575-ваттные карты. Две более дешёвые 32 ГБ карты могут дать 64 ГБ вместимости, но не гарантируют темп одной профессиональной 96 ГБ карты. Перед такой покупкой нужен измеренный запуск точного движка с тем же способом разбиения.

Объединённая память выигрывает простотой: большой файл доступен CPU и GPU без ручного переноса, а система тише типичной многокарточной станции. Цена — общая полоса и конкуренция с приложениями. Дискретная VRAM даёт большую полосу и зрелые специализированные ядра, но создаёт жёсткую стену вместимости. Отсюда практическое правило: для 7–35B и интерактивной работы сначала смотрите на быструю дискретную карту; для 70–120B и одного пользователя — на большой единый пул; для общего сервера, где важны и вместимость, и параллельность, — на серверную GPU после отдельного расчёта.

05

Производительность: отделяем измерение от переноса результата

Токены в секунду имеют смысл только рядом с моделью, квантом, средой выполнения, версией, длиной уже занятого контекста и режимом теста. llama-bench разделяет обработку входного контекста (англ. prompt processing, pp) и пошаговую генерацию текста (англ. text generation, tg); токенизация и выбор следующего токена в эти числа не входят. Скорость чата также включает очередь, построение контекста и потоковую выдачу.

Схема 7 · опубликованные снимки генерации, не рейтинг железа
Снимки производительности локального инференсаОДНА ПАРНАЯ ПУБЛИКАЦИЯ · ЧЕТЫРЕ НЕЗАВИСИМЫХ СНИМКАПАРНАЯ ПУБЛИКАЦИЯ: ОДНИ МОДЕЛЬ / ВЕРСИЯ · РАЗНЫЕ CPU / СРЕДЫRTX 5090 · Qwen3.5 35B-A3B Q4194 ток/сR9700 · Qwen3.5 35B-A3B Q4127 ток/сНЕЗАВИСИМЫ: НЕ СРАВНИВАТЬ РАЗМЕР КАРТОЧЕК И ЧИСЛАFRAMEWORK 128gpt-oss-120b≈ 48 ток/с · поставщик16″ MBP M4 MAX64 ГБ · gpt-oss-20b118 ток/с · сообществоDGX SPARKgpt-oss-120b59 ток/с · tg32DGX SPARKgpt-oss-20b83 ток/с · tg32РАЗНЫЕ МОДЕЛЬ · КВАНТ · КОНТЕКСТ · СРЕДА · ТЕСТ ГЕНЕРАЦИИЭто ориентиры масштаба; перед покупкой повторите свою нагрузку
Железо
RTX 5090 · 32 ГБ
Нагрузка
Qwen3.5-35B-A3B UD-Q4_K_XL (Unsloth) · llama.cpp CUDA · полная выгрузка на GPU · KV Q8
Обработка входа
Вход 512 токенов: 7 026 ток/с, около 0,07 с на обработку
Генерация
TG в среднем 194 ток/с
Класс доказательства
Парная публикация: те же модель, версия кода и флаги, но Ryzen 9900X/CUDA против 7500F/Vulkan; TG сопоставимее PP. Позднее обсуждалась ошибка рецепта кванта
Железо
Radeon AI PRO R9700 · 32 ГБ
Нагрузка
Та же модель/квант · llama.cpp Vulkan · полная выгрузка на GPU · KV Q8
Обработка входа
Вход 512 токенов: 2 713 ток/с, около 0,19 с на обработку
Генерация
TG в среднем 127 ток/с
Класс доказательства
Та же парная публикация, но другой CPU и среда; полный перенос на GPU уменьшает влияние CPU на TG, однако это не контролируемый A/B
Железо
MacBook Pro 16″ M4 Max · 64 ГБ
Нагрузка
gpt-oss-20b MXFP4 · llama.cpp Metal · сборка 7030
Обработка входа
Вход 32 768 токенов: 1 094 ток/с, около 30 с на обработку
Генерация
TG128 118 ток/с
Класс доказательства
Измерение сообщества; точная конфигурация памяти/чипа важна
Железо
DGX Spark · 128 ГБ
Нагрузка
gpt-oss-20b MXFP4 · llama.cpp · FA включён
Обработка входа
Вход 2 048 токенов: 4 506 ток/с, около 0,45 с на обработку
Генерация
TG32 83; при 32K — 62 ток/с
Класс доказательства
Опубликованное измерение llama.cpp; показывает влияние уже занятого контекста
Железо
DGX Spark · 128 ГБ
Нагрузка
gpt-oss-120b MXFP4 · 59,0 ГиБ · llama.cpp
Обработка входа
Вход 2 048 токенов: 2 444 ток/с, около 0,84 с на обработку
Генерация
TG32 59; при 32K — 43 ток/с
Класс доказательства
Опубликованное измерение llama.cpp; MoE читает не все 117B на каждом токене
Железо
Framework Desktop 128 · AMD Ryzen AI Max+ 395
Нагрузка
gpt-oss-120b · LM Studio/llama.cpp · Fedora 43
Обработка входа
не опубликовано
Генерация
≈ 48 ток/с
Класс доказательства
Заявление производителя от декабря 2025; Windows указан как ≈ 40 ток/с
Железо
Intel Arc Pro B70 · 32 ГБ
Нагрузка
gpt-oss-20b · вход 2K / выход 2K · параллельность 1 · серия замеров vLLM · TP=1
Обработка входа
не опубликовано
Генерация
54,8 ток/с
Класс доказательства
Совместное заявление Intel/Lablup; перепроверить на своей версии стека

Что всё-таки можно вывести

Во-первых, 20–35B MoE на одной современной карте уже генерирует быстрее чтения человеком. Во-вторых, 128 ГБ при 256–273 ГБ/с полезны прежде всего вместимостью: gpt-oss-120b остаётся быстрым из-за 5,1B активных параметров, а плотная 70B на том же устройстве будет значительно медленнее. В-третьих, контекст имеет цену: в опубликованном тесте DGX Spark gpt-oss-120b падает с примерно 59 до 43 ток/с при переходе от пустого к 32K занятого контекста.

Наконец, программное обеспечение способно поменять результат без замены GPU. В отдельном опыте llama.cpp совместное включение объединения операций и конкурентных потоков CUDA поднимало tg128 Qwen3 30B-A3B на RTX 5090 примерно с 247 до 352 ток/с. Переменная среды называлась GGML_CUDA_GRAPH_OPT, но автор прямо уточнил: к CUDA Graphs механизм отношения не имел. Это не универсальное ускорение, а напоминание фиксировать версию кода, флаги и прогрев вместе с названием карты.

Что измерять кроме среднего темпа

Обработка входа и генерация нагружают систему по-разному. Большой PP важен для первого прохода по документу, но пользователь ощущает — туда входят токенизация, очередь, подготовка кеша и первая итерация генерации. TG описывает установившийся поток одного ответа, но скрывает паузы между отдельными токенами. Для редактора кода записывайте P50 и P95 TTFT, средний интервал токена и самый длинный разрыв. Два запуска с одинаковыми ток/с могут ощущаться совершенно по-разному.

Контекст должен быть уже занят до замера генерации. Тест на пустом кеше отвечает на вопрос о потолке железа, а не о многошаговом агенте после двадцати сообщений и результатов инструментов. Возьмите P50/P95 входной длины из реального трейса и измерьте несколько выходных длин. Короткий TG32 может не успеть показать нагрев и снижение частоты; длинный TG512 выявляет установившийся режим, но не представляет ответы, которые обычно заканчиваются через 80 токенов. Нужны оба среза.

Для общего сервера важна производительность при конкурентной генерации, а не только скорость одного ответа. Отправьте одновременно 1, 2, 4 и 8 запросов и для каждого уровня измерьте суммарную скорость генерации, P95 задержки и долю запросов, уложившихся в SLO. Непрерывная пакетная обработка увеличивает суммарное число токенов в секунду, но может ухудшить интервал между токенами для одного пользователя. Также проверьте отмену запросов. Когда агент прекращает генерацию ставшего ненужным ответа, система должна быстро освободить занятые запросом ресурсы: KV-кеш и слот планировщика. Иначе тест, в котором все ответы генерируются до конца, завысит число запросов, одновременно обслуживаемых сервером.

Наконец, измеряйте принятую работу, а не только вычисление. Для кода это применившийся патч и прошедшие тесты; для извлечения — валидная схема и правильные поля; для RAG — ответ с подтверждаемой ссылкой. Деление числа принятых задач на энергию и время даёт показатель, который можно сравнить с облаком. Сырая скорость модели, требующей вдвое больше повторов, почти всегда создаёт ложную экономию.

06

Среда выполнения — часть аппаратной конфигурации

Разные программы начинают поддерживать новую модель не одновременно и часто лишь частично. Например, программа уже распознаёт токенизатор, но обрабатывает изображения на CPU вместо GPU; загружает FP8-веса, но не умеет быстро выполнять вычисления с ними на выбранной GPU; запускает модель в llama.cpp, тогда как текущая версия vLLM её ещё не поддерживает. Перед покупкой проверяйте конкретную модель, формат весов и версию среды выполнения. Поддержка похожей модели ничего не гарантирует.

Стек
llama.cpp + GGUF
Где
CPU, Metal, CUDA, Vulkan и широкий набор устройств
Сильная сторона
Прозрачная локальная базовая линия, гибридная выгрузка CPU/GPU, llama-bench
Граница
Формат и ядра новой архитектуры могут появиться позже выпуска модели
Стек
MLX / mlx-lm
Где
Apple silicon и единая память
Сильная сторона
Нативный путь Metal, простой Python API, хорошие кванты сообщества
Граница
Только Apple; не заменяет серверный стек Linux/CUDA
Стек
Ollama / LM Studio
Где
Настольный интерфейс и локальный API, совместимый с OpenAI
Сильная сторона
Быстрый старт, управление моделями, минимум ручной сборки
Граница
Производительность и поддержка наследуются от вложенной среды выполнения
Стек
vLLM / SGLang
Где
Linux-сервер, CUDA/ROCm, несколько пользователей
Сильная сторона
Непрерывные пакеты, кеш префиксов, метрики, OpenAI API
Граница
Не лучший путь для Mac/телефона; новые мультимодальные/MoE-модели требуют точной версии
Стек
TensorRT-LLM
Где
NVIDIA CUDA, особенно промышленный GPU-сервер
Сильная сторона
Специализированные ядра и графы, форматы квантования Blackwell
Граница
Сборка движка и матрица поддерживаемых моделей повышают стоимость изменений
Стек
Стеки ROCm / Intel XPU
Где
AMD и Intel соответственно
Сильная сторона
Альтернатива CUDA, 32 ГБ дешевле, несколько GPU
Граница
Проверять ОС, драйвер, PyTorch, среду выполнения и конкретное ядро как один комплект

Для одного пользователя разумная базовая линия — llama.cpp/MLX через LM Studio, Ollama или прямой CLI: он быстро выявляет, помещается ли точный GGUF и какой темп генерации даёт пакет 1. Для общего Linux API переходите к через vLLM/SGLang/TensorRT-LLM только после проверки поддержки архитектуры: там уже важны , аутентификация, квоты, кеш префиксов и P95, а не один локальный чат.

  • Зафиксировать версию модели, токенизатор, шаблон чата и хеш весового файла.
  • Зафиксировать ОС, прошивку, драйвер, версию/контейнер среды выполнения и все флаги.
  • Прогнать холодный старт, затем устойчивый нагрев; записать пиковые RAM/VRAM и мощность из розетки.
  • Отдельно проверить текст, изображения, JSON, вызовы инструментов, длинный контекст и отмену генерации.
  • Обновлять один слой за раз и иметь откат: «новее» не гарантирует поддержку старого кванта.

Воспроизводимая сборка важнее самого удобного интерфейса

Графическая оболочка удобна для первого опыта, но производственная конфигурация должна пережить перезапуск и обновление. Сохраните команду запуска или файл настроек, источник и хеш модели, версию движка, драйвера и шаблона чата. Проверьте восстановление после перезагрузки без ручного клика и поведение при повреждённом скачивании. Если продукт зависит от единственного файла из пользовательского реестра, сохраните проверенную копию в своём контуре с соблюдением лицензии.

Совместимый с OpenAI API интерфейс упрощает замену сервера, но не делает семантику одинаковой. Различаются названия моделей, подсчёт токенов, формат вызовов инструментов, поддержка изображений, потоковые события и причины остановки. Перед переключением клиента запишите контрактные тесты на обычный ответ, JSON, отмену, тайм-аут и переполнение контекста. Тогда переход между Ollama, LM Studio, llama.cpp server и vLLM не превращается в ручную проверку всего приложения.

Для офлайн-контура заранее решите, как попадут обновления безопасности и новые веса. Полная изоляция без процесса доставки быстро оставляет уязвимый драйвер и устаревшую модель. Практичнее подписанный пакет, проверка хеша, тестовый стенд и контролируемое окно обновления. Локальность отвечает на вопрос, кто контролирует изменение, а не требует никогда ничего не обновлять.

07

Шесть конфигураций под реальную работу

Сценарий задаёт минимально полезное качество и форму нагрузки. Голосовой роутер выигрывает от 3B на устройстве, даже если 27B отвечает умнее. Агент разработчика нуждается в устойчивом диффе/JSON и низком интервале токена. Общий RAG-сервер требует параллельности и доступа, хотя демонстрация с пакетом 1 выглядит так же.

Сценарий
Офлайн-помощник и голос
Модели
Gemma 4 E2B/E4B; Ministral 3 3B; Qwen3.5 2B/4B
Железо
8–16 ГБ на устройстве; NPU/GPU/CPU
Критерий приёмки
Малый TTFT, офлайн, структурированный ответ; качество на закрытом наборе команд
Сценарий
Приватный RAG одного пользователя
Модели
Qwen3.5 9B; Gemma 4 12B; Ministral 3 8B/14B
Железо
16–32 ГБ; Mac mini или любой поддерживаемый GPU
Критерий приёмки
Проверять поиск отдельно; не выставлять 256K только потому, что модель допускает
Сценарий
Кодинг и агент разработчика
Модели
gpt-oss-20b; Qwen3.6 27B/35B-A3B; Nemotron 3 Nano
Железо
24–48 ГБ; RTX 5090/R9700/B70 или M4 Pro/Max
Критерий приёмки
Интерактивный темп, вызовы инструментов, дифф/JSON и качество на собственных репозиториях
Сценарий
Мультимодальные документы
Модели
Qwen3.6 27B/35B-A3B; Gemma 4 12B/26B; Ministral 3 14B
Железо
24–64 ГБ; запас под визуальный кодировщик и токены изображений
Критерий приёмки
OCR, таблицы, формы, скриншоты; считать изображения частью контекста
Сценарий
Общий сервер небольшой команды
Модели
Qwen3.6-35B-A3B или gpt-oss-120b; меньшая черновая модель/маршрутизатор
Железо
64–128 ГБ; M3 Ultra, DGX Spark, RTX PRO или Linux GPU-компьютер
Критерий приёмки
Измерять параллельность, P95 и аутентификацию; ток/с при пакете 1 уже недостаточно
Сценарий
Исследовательская лаборатория
Модели
122B–397B+ и несколько форматов одной модели
Железо
Несколько GPU/узлов; быстрая сеть; воспроизводимый стенд
Критерий приёмки
Цель — исследование/совместимость, а не лучшая цена ответа для пользователя

1. Уже есть компьютер — начните с нулевого CapEx

Для приватного поиска и черновиков 8–12B Q4 на 16–32 ГБ часто закрывает задачу. Сначала измерьте его на существующем устройстве. Покупка 32 ГБ GPU ради модели, которая не проходит ваш эвал, лишь делает неправильный ответ быстрее.

2. Рабочее место разработчика — 24–48 ГБ

Если главный сценарий — код и агент, выбирайте между скоростью дискретной GPU и удобством единой памяти. RTX 5090 — очень высокая интерактивная скорость и зрелый CUDA-путь; R9700/B70 — более дешёвые 32 ГБ при дополнительной работе со стеком; M4 Pro/M5 Max — тихая машина, на которой код, IDE и модель делят память. Проверяйте не HumanEval, а свои репозитории, формат патча и цикл с инструментами.

3. Большая персональная модель — 96–128 ГБ

Framework Desktop на AMD Ryzen AI Max+ 395 со 128 ГБ памяти за $3 449 — самый дешёвый в таблице новый путь к gpt-oss-120b, но его 256 ГБ/с лучше подходят MoE, чем плотной 70B. DGX Spark дороже, зато даёт CUDA, 4 ТБ SSD и ConnectX-7. MacBook Pro M5 Max и Mac Studio M3 Ultra предлагают более высокую полосу и Metal/MLX, но отличаются ценой, термикой и доступными конфигурациями.

4. Небольшая команда — это уже сервис

Один пользователь может терпеть холодную загрузку и занимать всю память. Пять пользователей создают очередь, несколько KV-кешей и требования к аутентификации. Здесь полезно вернуться к отдельному разбору инференса LLM как распределённой системы — непрерывное формирование пакетов может дать больше, чем переход на следующую модель GPU.

5. Голос, документы и периферийное устройство

Для диктовки, команд и первичного разбора документов выгоден составной конвейер: маленькая ASR или OCR-модель, маршрутизатор 2–4B и более крупный генератор только для сложных запросов. Он снижает среднюю задержку и позволяет оставить чувствительный сырой звук или изображение на устройстве. Приёмка включает сквозную задержку от сигнала до действия, качество на шуме и акцентах, потребление батареи, ошибочные срабатывания и работу без сети. Один показатель генератора эту систему не описывает.

6. Исследовательская лаборатория — покупается гибкость

Несколько GPU или узлов оправданы, когда целью является сравнение форматов, разработка ядер, исследование больших моделей или воспроизводимость собственного кластера. Здесь ценность дают ECC, быстрая сеть, достаточный SSD, удалённое управление и возможность закрепить версии. Если конечная задача — один личный чат, та же конфигурация почти наверняка проиграет одной быстрой карте или облаку по цене, сложности и времени инженера. Лабораторию оценивают по числу воспроизводимых экспериментов, а не по максимальному числу параметров, которое однажды удалось загрузить.

08

Цена устройства — только первый слой стоимости

При локальном запуске нет платы API за каждый токен, но возникают другие расходы: покупка оборудования, электричество, хранение моделей, инженерное сопровождение, а также потери из-за простоя и возможного снижения качества. Совокупная стоимость владения должна включать компьютер целиком: карта RTX 5090 за $1 999 требует материнскую плату, CPU, RAM, быстрый SSD, блок питания и охлаждение. У Mac/DGX цена уже системная, у Framework — без накопителя и ОС.

Схема 8 · слои полной стоимости и условие окупаемости
Полная стоимость локального инференсаЛОКАЛЬНАЯ СТОИМОСТЬ — НЕ ТОЛЬКО ЦЕНА УСТРОЙСТВАПОТЕРИ ИЗ-ЗА КАЧЕСТВАповторы · ручные исправления · ошибкиЭКСПЛУАТАЦИЯобновления · проверка моделей · мониторингЭНЕРГИЯ + ОХЛАЖДЕНИЕсредняя мощность · охлаждение · простойКАПИТАЛЬНЫЕ ЗАТРАТЫGPU или система · накопитель · сетьЗАДАЧ ДО ОКУПАЕМОСТИQ ≈ CapEx ÷ (C₁ − C₂)C₁ = облако · C₂ = локальноC = стоимость принятой задачиНЕ РАБОТАЕТ, ЕСЛИкачество различаетсязагрузка неизвестнатруд не учтёнПриватность и офлайн-режим могут быть важнее финансовой окупаемости
задачи до окупаемости ≈ CapEx / (переменная облачная стоимость принятой задачи − переменная локальная стоимость принятой задачи)
формула недействительна, если модели имеют разное качество или загрузка неизвестна

Энергию лучше считать по измеренной средней мощности на рабочем профиле, а не по TDP. Для примера, устройство со средними 250 Вт при 8 часах в день потребляет около 730 кВт⋅ч в год; стоимость зависит от местного тарифа. Постоянно включённый общий сервер — уже около 2 190 кВт⋅ч без охлаждения. Но при редких запросах главным расходом остаётся амортизация, а не электричество.

Три расчёта вместо одной точки окупаемости

Для редкой личной нагрузки считайте устройство по полной цене: большая часть его жизни проходит в простое, а экономия API мала. Если компьютер всё равно покупается для разработки, локальному AI можно приписать лишь добавочную стоимость памяти или GPU — но это надо честно отметить как другой сценарий. Для общего сервера добавляются резерв, администрирование, мониторинг и стоимость недоступности. Смешивать эти три базы в одной строке «окупится за N месяцев» нельзя.

Срок амортизации должен соответствовать риску стека. Корпус и блок питания могут служить пять лет, GPU — три, а полезный формат модели смениться за несколько месяцев. Посчитайте оптимистичную, рабочую и низкую загрузку, затем отдельно сценарий, где через год требуется больше памяти. Остаточная стоимость потребительской карты может уменьшить риск; распаянная память и специализированный узел хуже модернизируются, зато продаются как готовая система.

Стоимость облака тоже не постоянна: кеширование входа, пакетный режим и более дешёвая модель меняют знаменатель. С другой стороны, локальная система может экономить не токены, а время согласования данных или стоимость инцидента приватности. Финальный расчёт должен показывать денежные допущения отдельно от нефинансовых требований. Если приватность обязательна, вопрос окупаемости выбирает между локальными вариантами, а не отменяет само ограничение.

09

Покупка начинается с эвала и заканчивается повтором трейса

Надёжный выбор начинается не с обзора железа, а с нижней границы приемлемого качества для конкретного сценария. Сначала зафиксируйте этот порог и проверьте на нём модели; затем выберите точный файл весов, рассчитайте необходимый объём памяти, убедитесь в совместимости программного стека и только после этого подбирайте устройство. Модель, которая не достигает заданного порога качества, исключают. Если модель проходит проверку, но не помещается в память, выбирают другой формат весов или устройство с большим объёмом памяти. Если она помещается, но отвечает слишком медленно, сначала проверяют пропускную способность памяти и поддержку необходимых GPU-ядер — и лишь затем рассматривают другую видеокарту.

Схема 9 · дерево выбора локальной конфигурации
Дерево выбора локального инференса LLMНАГРУЗКА → МОДЕЛЬ → ПАМЯТЬ → СТЕК → ТРЕЙС1 · НАГРУЗКАпорог качествазадержка · приватность2 · МОДЕЛЬвозможностилицензия · формат3 · ПАМЯТЬвеса + KV+ 15–25%4 · СТЕКCUDA · ROCmMetal · XPU5 · ТРЕЙСP50 / P95качество / ваттОДИН ЧЕЛОВЕКноутбук / настольный ПК · пакет 1НЕБОЛЬШАЯ КОМАНДАобщий API · параллельностьИССЛЕДОВАНИЕбольшая модель · несколько устройствПОКУПАТЬ ТОЛЬКО ПОСЛЕ ПОВТОРАте же запросы · контекст · квант · среда · установившийся нагревБенчмарк завершает выбор, а не начинает его
Слой
Качество
Что измерить
Принятые ответы, код, JSON, вызовы инструментов на вашем эвал-наборе
Защита от ошибки
Не сравнивать цену моделей, которые решают разные доли задач
Слой
Вместимость
Что измерить
Объём памяти ≥ расчётный пик × 1,15–1,25
Защита от ошибки
Проверить P95 входа/выхода и мультимодальные токены
Слой
Интерактив
Что измерить
TTFT, средний и P95 интервал токена, остановка/возобновление
Защита от ошибки
Отдельно холодный и прогретый запуск
Слой
Производительность
Что измерить
PP и TG, пакет 1 и рабочая параллельность
Защита от ошибки
Одинаковые запрос, контекст, квант, выбор токена и среда выполнения
Слой
Эксплуатация
Что измерить
Версии драйвера, среды и модели, перезапуск, обновление, наблюдаемость
Защита от ошибки
Зафиксировать рабочие lock-файл/контейнер и процедуру отката
Слой
Экономика
Что измерить
CapEx, компьютер, накопитель, энергия, труд, простой
Защита от ошибки
Считать стоимость принятой задачи, а не сырого токена

Минимальный протокол перед заказом

  • Собрать 50–200 реальных запросов с P50/P95 длиной, форматами и правильными ответами.
  • Выбрать две модели разных размеров и по два точных артефакта, а не десять названий семейств.
  • Арендовать или найти близкое железо на день; зафиксировать версии и прогнать одинаковый трейс.
  • Записать качество, TTFT, PP, TG, P95, пиковую память, мощность и отказы инструментов.
  • Посчитать полный чек устройства и три сценария загрузки: редкий, рабочий и общий сервер.
  • Покупать конфигурацию с запасом для контекста, но не ради модели, которую вы не собираетесь использовать.

Условия остановки защищают бюджет

До теста запишите, при каком результате покупка отменяется: качество ниже порога, P95 выше SLO, память без 15-процентного запаса, неподходящая лицензия или отсутствие воспроизводимой сборки. Иначе после дня настройки легко принять сам факт запуска за успех. Если проверка показывает, что ни одна локальная модель не достигает заданного порога качества на целевых задачах, рациональный выбор — гибридная схема или облачный сервис. Это дешевле, чем тратить время на оптимизацию модели, которая не решает целевую задачу с необходимым качеством.

Пять ловушек, которые выглядят как быстрый выбор

Первая — покупать по максимальному размеру модели. Больший файл может отвечать медленнее, иметь неподходящую лицензию и хуже соблюдать формат, тогда как специализированная 12–24B закроет задачу. Вторая — принимать расчётный размер Q4-весов за весь объём памяти, необходимый во время инференса. Помимо весов память занимают служебные данные формата, KV-кеш, рабочие буферы и вычислительные графы, кодировщик и ОС. Поэтому модель, которая по простой арифметике «должна поместиться», на практике может не войти целиком в память ускорителя и начать использовать более медленную системную память.

Третья — напрямую сравнивать значения токенов в секунду из разных обзоров и таблиц. Если тесты выполнены на разных моделях, вариантах квантования, длинах контекста, размерах пакета или версиях движка, результаты несопоставимы. Чужие измерения можно использовать как грубый ориентир, но окончательное сравнение требует повторить один и тот же набор запросов на всех кандидатах. Четвёртая — покупать две карты только ради суммы VRAM. Без измерения разбиения, PCIe и поддержки движка это дорогой способ получить больше памяти при меньшей отзывчивости.

Пятая — строить выбор вокруг обещанного будущего. Анонс памяти, неподтверждённая поддержка новой архитектуры или ожидаемый квант не являются рабочей конфигурацией на дату выбора. В короткий список попадает только то, для чего одновременно существуют точные веса, доступное железо, совместимая среда и повторяемый тест. Будущие варианты полезно держать в наблюдении с датой следующей проверки, но нельзя закладывать в текущий SLO и бюджет.

Самый сильный антидот всем пяти ловушкам — маленький воспроизводимый стенд. Один архив запросов, один скрипт запуска и одна таблица результатов позволяют менять по одному параметру: сначала модель, затем квант, затем среду и лишь потом железо. Так покупка становится следствием наблюдаемого узкого места. Без такого стенда каждый новый обзор обнуляет решение, потому что сравнивает другую систему.

Повторяйте этот стенд после существенного обновления модели или среды, но храните предыдущий результат. Регрессия может выглядеть как рост средней скорости при ухудшении P95, памяти или качества инструментов. Версия считается лучше только тогда, когда проходит те же пороги на том же архиве. Такой журнал даёт ещё одну ценность: через несколько месяцев становится видно, ограничивает продукт сама модель, объём памяти, полоса, программный стек или уже неактуальный сценарий. Тогда модернизация отвечает на конкретный вопрос, а не на общий страх отстать от следующего выпуска железа. Решение остаётся проверяемым даже после смены команды, поставщика и владельца локального сервиса на протяжении лет.

Практический вариант по умолчанию в 2026 году выглядит скучно: существующая машина и 8–14B для проверки продукта; затем 24–32 ГБ и 20–35B MoE для личного агента; 96–128 ГБ только после доказанного выигрыша 100–120B. Несколько GPU и 284B+ — исследовательская ветка, а не обязательный следующий шаг.

Выводы

Пять выводов о локальном инференсе 2026 года

  1. 01Локальный инференс выбирают не по одному числу параметров: сначала порог качества и сценарий, затем сумма памяти, полоса и фактическая поддержка модели.
  2. 02Класс 20–35B, особенно MoE с 3–4B активных параметров, стал главным практическим оптимумом 2026 года для 24–32 ГБ: он уже полезен для кода и агентов, но ещё помещается на одной карте.
  3. 03128 ГБ объединённой памяти дают редкую вместимость для 100–120B, однако Framework Desktop и DGX Spark ограничены полосой около 256–273 ГБ/с; «помещается» не равно «самое быстрое».
  4. 04RTX 5090 остаётся сильным вариантом для пакета 1 благодаря 1,79 ТБ/с и CUDA, тогда как AMD и Intel предлагают более дешёвые 32 ГБ ценой более чувствительного программного стека.
  5. 05Цена — снимок: сравнивать надо текущую доступную конфигурацию целиком и стоимость принятой задачи; перед покупкой обязательно повторить собственный трейс.
Источники

Карточки моделей, спецификации, цены и измерения

Приоритет отдан карточкам моделей, официальным спецификациям и тредам с исходными измерениями. Производительские числа помечены как заявления поставщика; цены зафиксированы датой и не переносятся на другую страну или наличие.

Методика и память

  1. llama.cpp · llama-bench READMEопределения обработки входного контекста (pp), пошаговой генерации текста (tg) и совместного теста; токенизация и выбор токена в измерение не входят
  2. ggml-org · llama.cppбазовая реализация GGUF-инференса и поддерживаемые среды CPU/GPU; состояние быстро меняется
  3. MLX Community · mlx-lmинференс и квантование LLM на Apple silicon поверх MLX

Модели 2026 года

  1. OpenAI · Introducing gpt-oss21B всего/3,6B активны и 117B всего/5,1B активны, исходный MXFP4; официальные требования — 16 и 80 ГБ соответственно
  2. Qwen Team · Qwen3.6семейство апреля 2026, локальные пути llama.cpp/MLX и поддержка текста, изображений и видео
  3. Qwen · Qwen3.6-35B-A3B model card35B всего/3B активны, исходный контекст 262K, Apache 2.0 и мультимодальные/агентные возможности
  4. Qwen · Qwen3.5-9B model cardофициальная карточка плотной 9B-модели: параметры, контекст, мультимодальность и лицензия Apache 2.0
  5. Qwen · Qwen3.5-397B-A17B model cardофициальная карточка 397B-A17B как границы кластерного, а не персонального локального запуска
  6. Qwen · Qwen3.5-122B-A10B GPTQ-Int4официальный 4-битный файл весов большой MoE-модели; формат и GPU-ядра надо проверять вместе
  7. Google · Gemma 4 model cardмодели E2B/E4B/12B/26B-A4B/31B, контекст и мультимодальные возможности
  8. Google · Get started with Gemma modelsофициальное позиционирование размеров от мобильных устройств до крупных серверов и кластеров
  9. Mistral AI · Ministral 3 14B model cardApache 2.0, 256K, встроенная работа с изображениями и официальный FP8-файл для 24 ГБ
  10. Mistral AI · Mistral Small 4119B всего, 6B активны на токен и 8B с входным/выходным слоями; официальный минимум — 4×HGX H100, 2×HGX H200 или 1×DGX B200
  11. NVIDIA · Inside Nemotron 3каноническое имя Nano 30B-A3B округляет активную часть; карточка NVFP4 указывает около 3,5B активных. Показатели являются материалом поставщика
  12. Meta · Llama 4 Scout and Maverick109B-A17B и 400B-A17B, мультимодальность и собственная Llama Community License; заявление о размещении Scout Int4 на одном H100
  13. DeepSeek · DeepSeek-V4-Flash model card284B-A13B как нижняя граница моделей, для которых «локально» уже означает несколько устройств
  14. Moonshot AI · Kimi K2.7 Code1T всего/32B активны, исходный INT4 и файл около 595 ГБ: актуальная серверная граница для агентов написания кода

Специализированные модели

  1. Liquid AI · LFM2.5-1.2B Thinkingтелефонный/CPU-класс с 32K; коммерческая лицензия зависит от выручки юридического лица
  2. IBM · Granite 4.1 model cardApache 2.0, 131K и официальные пути GGUF/ONNX/OpenVINO для корпоративного RAG и инструментов
  3. Mistral AI · Devstral Small 2 24Bспециализированная Apache 2.0 модель для кода; официальный FP8, а малобитные GGUF обычно выпускает сообщество
  4. IBM · Granite Vision 4.1 4Bдокументная модель для таблиц, графиков, OCR и извлечения пар ключ–значение
  5. Hugging Face · SmolVLM2первичный анонс вариантов 256M/500M/2.2B для компактной обработки изображений и видео
  6. Microsoft · Phi-4 reasoning-vision 15Bофициальная карточка модели для визуального рассуждения, OCR и привязки к интерфейсам
  7. Qwen · Qwen3 Embedding0,6/4/8B многоязычные эмбеддинги для текста/кода с Apache 2.0; модель поиска выбирается отдельно от генератора
  8. IBM · Granite Embedding R2официальная карточка компактной многоязычной модели поиска с Apache 2.0
  9. Qwen · Qwen3-ASR 0.6BApache 2.0, 30 языков включая русский и варианты офлайн/потокового распознавания
  10. Qwen · Qwen3-TTS 0.6BApache 2.0, русский язык, потоковый синтез и клонирование голоса; использовать только с правами на голос
  11. OpenAI · Whisper large-v3-turboофициальная карточка зрелой многоязычной модели распознавания речи с лицензией MIT
  12. Kokoro · Kokoro-82Mпервичная карточка компактной модели синтеза речи с лицензией Apache 2.0

Текущее железо и цены

  1. Intel · Arc B-Series launch12 ГБ, 456 ГБ/с и RCP $249: бюджетная точка входа, а не 20–35B-карта
  2. Intel ARK · Arc B580 specificationsофициальные 12 ГБ, 456 ГБ/с и 190 Вт для опорной карты
  3. NVIDIA · GeForce RTX 5060 Ti launch16 ГБ, 448 ГБ/с и стартовый MSRP $429 для 16-гигабайтной версии
  4. NVIDIA · GeForce RTX 5060 family specificationsофициальные 16 ГБ, 448 ГБ/с и 180 Вт для RTX 5060 Ti
  5. Apple Store US · Buy Macснимок доступных конфигураций на 8 августа 2026; в таблице используются цены целевого объёма памяти, а не базовое «от»
  6. Apple Store US · Mac mini M4, 24 GB / 512 GBцелевая конфигурация из таблицы за $1 199 на 8 августа 2026
  7. Apple Store US · Mac mini M4 Pro, 48 GB / 512 GBцелевая конфигурация из таблицы за $2 199 на 8 августа 2026
  8. Apple · Mac mini technical specifications120 ГБ/с у M4 и 273 ГБ/с у M4 Pro; объём текущего заказа отделён от исторической поддержки поколения
  9. Apple · Mac Studio technical specifications410/546 ГБ/с у M4 Max и 819 ГБ/с у M3 Ultra; документированные пределы поколения отделены от текущего заказа
  10. Apple Store US · Mac Studio M4 Max, 64 GB / 512 GBточная целевая конфигурация из таблицы за $3 499 на 8 августа 2026
  11. Apple Store US · Mac Studio live lineupснимок текущей линейки и базового M3 Ultra 96 ГБ за $5 299 на 8 августа 2026
  12. Apple Newsroom · Mac Studio M4 Max and M3 Ultra launchисторические пределы поколения: до 128 ГБ у M4 Max и до 512 ГБ у M3 Ultra; это не текущая доступность заказа
  13. Apple · MacBook Pro M5 Max specificationsдо 128 ГБ объединённой памяти и 614 ГБ/с; текущий доступный для заказа вариант Apple с большой памятью
  14. Apple Store US · 14-inch MacBook Pro M5 Max, 128 GB / 2 TBцелевая конфигурация из таблицы за $6 699 на 8 августа 2026; не базовая цена M5 Max
  15. Framework · Desktop live US configuratorтекущий снимок $1 269/1 959/3 449 для 32/64/128 ГБ, без накопителя и ОС; все конфигурации помечены как отсутствующие на складе и заказываются предзаказом с возвратным депозитом
  16. Framework · Desktop launch announcementстартовая цена конфигурации 128 ГБ $1 999; отделена от текущей цены конфигуратора $3 449
  17. AMD · Ryzen AI Max+ PRO 495спецификация до 192 ГБ LPDDR5x-8533; заявления о GPU-памяти и вместимости приведены по отдельному анонсу
  18. AMD · Ryzen AI Max+ PRO 495 announcementзаявления поставщика: до 160 ГБ для GPU и вместимость 300B+ Q4; в проверенных US-источниках на 8 августа 2026 не найдена доступная система с публичной ценой
  19. Framework · Using a Framework Desktop for local AI256 ГБ/с, до 112 ГБ адресуемой GPU памяти и измерение поставщика gpt-oss-120b ≈40/48 ток/с на Windows/Linux
  20. NVIDIA Marketplace · GeForce RTX 5090снимок $1 999 и отсутствие в наличии на 8 августа 2026; это цена карты без системного блока
  21. NVIDIA · GeForce RTX 5090 specifications32 ГБ GDDR7, 575 Вт и поколение Blackwell; полоса памяти — ключевой параметр для генерации
  22. AMD · Radeon AI PRO R9700$1 299 MSRP, 32 ГБ, 640 ГБ/с и 300 Вт; ROCm-совместимость привязана к версии ОС/драйвера
  23. Intel · Arc Pro B70 launch and pricing32 ГБ и рекомендованная стартовая цена $949; заявления поставщика о производительности вынесены отдельно от независимых измерений
  24. Intel · Arc Pro B70 GPU datasheet32 ГБ GDDR6 ECC, 608 ГБ/с и 230 Вт для референсной карты Intel
  25. NVIDIA Marketplace · DGX Sparkтекущая цена $4 699, 128 ГБ объединённой памяти и 4 ТБ NVMe
  26. NVIDIA · DGX Spark User Guide273 ГБ/с, Arm64/GB10 и системные характеристики; обновлено в 2026 году
  27. NVIDIA Marketplace · RTX PRO 6000 Blackwell Workstation Editionснимок 8 августа 2026: $13 250 и отсутствие в наличии; это текущая цена магазина, а не объявленный MSRP
  28. NVIDIA · RTX PRO 6000 Blackwell Workstation Edition96 ГБ ECC, 1 792 ГБ/с и 600 Вт; технические характеристики отделены от снимка цены магазина

Измерения производительности

  1. llama.cpp discussion · RTX 5090 vs Radeon AI PRO R9700парная публикация Qwen3.5-35B-A3B UD-Q4_K_XL: одни версия кода и флаги, но Ryzen 9900X/CUDA против 7500F/Vulkan; TG сопоставимее PP, это не контролируемый A/B
  2. llama.cpp · DGX Spark benchmarkgpt-oss-20b/120b и другие модели при разном занятом контексте; PP и TG опубликованы раздельно
  3. llama.cpp discussion · DGX Spark results and comparison runs16″ MacBook Pro M4 Max, 64 ГБ, сборка 7030: PP32768 1 093,58 и TG128 117,83 ток/с; также контекст к тесту DGX Spark
  4. llama.cpp discussion · CUDA graph optimizationпоказывает совместный эффект объединения операций и конкурентных потоков CUDA; автор отдельно уточняет, что имя переменной GGML_CUDA_GRAPH_OPT не означает использование CUDA Graphs
  5. Intel/Lablup · Arc Pro B70 Backend.AI resultsизмерение поставщика Qwen3-8B и gpt-oss-20b; не смешивается с измерением сообщества llama-bench без повторения методики
Дальше

Связанные материалы

Поделиться
TelegramLinkedIn

Этот материал продолжает системный разбор инференса: там — планирование, KV-память и распределённый сервис; здесь — конкретная локальная конфигурация на дату исследования.