vLLM и PagedAttention: виртуальная память для инференса LLM
Efficient Memory Management for Large Language Model Serving with PagedAttention
Участники выпуска
Сольный выпуск без приглашённых гостей.
Что разберём
Запланированный выпуск Research Insights Made Simple разбирает статью Kwon, Li, Zhuang и соавторов с SOSP '23 — «Efficient Memory Management for Large Language Model Serving with PagedAttention»: почему обслуживание больших языковых моделей упирается в память под KV-кеш и как существующие системы теряли от 60 до 80 % этой памяти на резерв и фрагментацию.
Разговор идёт по логике статьи: цена одного токена в KV-кеше, три вида потерь непрерывного размещения, идея страничной виртуальной памяти из операционных систем, ядро PagedAttention, таблицы блоков, копирование при записи для параллельных семплов и beam search, планировщик с вытеснением всё-или-ничего и архитектура движка vLLM.
Главный вопрос выпуска — как чужая идея шестидесятилетней давности дала 2-4× пропускной способности без единого изменения модели, сколько стоила косвенность в ядре и где, по словам самих авторов, рецепт не сработает.