К основному содержимому
все выпуски
Research Insights Made Simple · выпуск 32· запись ожидается

vLLM и PagedAttention: виртуальная память для инференса LLM

Efficient Memory Management for Large Language Model Serving with PagedAttention

28 сентября 2026 г.
Дата выпуска наступила, запись пока готовится к публикации.

Участники выпуска

Сольный выпуск без приглашённых гостей.

Что разберём

Запланированный выпуск Research Insights Made Simple разбирает статью Kwon, Li, Zhuang и соавторов с SOSP '23 — «Efficient Memory Management for Large Language Model Serving with PagedAttention»: почему обслуживание больших языковых моделей упирается в память под KV-кеш и как существующие системы теряли от 60 до 80 % этой памяти на резерв и фрагментацию.

Разговор идёт по логике статьи: цена одного токена в KV-кеше, три вида потерь непрерывного размещения, идея страничной виртуальной памяти из операционных систем, ядро PagedAttention, таблицы блоков, копирование при записи для параллельных семплов и beam search, планировщик с вытеснением всё-или-ничего и архитектура движка vLLM.

Главный вопрос выпуска — как чужая идея шестидесятилетней давности дала 2-4× пропускной способности без единого изменения модели, сколько стоила косвенность в ядре и где, по словам самих авторов, рецепт не сработает.

Platform engineeringArchitecture governance