К основному содержимому
к странице архива
#AI

Материалы выпуска Research Insights #32: vLLM и PagedAttention (Рубрика #AI)

Собрал материалы сольного выпуска Research Insights Made Simple от 28 сентября 2026 года — про vLLM и PagedAttention. История о том, как идея страничной памяти из операционных систем помогла эффективнее обслуживать запросы к LLM. Это был разбор сентябрьской статьи 2023 года "Efficient Memory Management for Large Language Model Serving with PagedAttention"

Модель уже поместилась на GPU, но рядом с её весами нужно хранить ещё и KV-кеш — ключи и значения обработанных токенов для каждого активного запроса. Ответ растёт, кеш растёт вместе с ним, а будущая длина ответа заранее неизвестна. Если резервировать память с запасом, места для соседних запросов остаётся всё меньше. Вот тут и пригодился учебник по операционным системам.

В выпуске разобрал:

🔸 Куда уходит память Резерв под будущие токены, незаполненные участки и фрагментацию — и почему даже знание длины ответа не решает все проблемы размещения.

🔸 Как устроен PagedAttention Таблица связывает логические блоки запроса с физическими блоками GPU, а новые блоки выделяются по мере необходимости.

🔸 Как делить общий префикс Несколько вариантов ответа используют одни KV-данные, а при изменении общего блока включается копирование при записи.

🔸 Что делать, когда память всё-таки закончилась Перенести состояние в память CPU или удалить и потом вычислить заново: у каждого варианта своя цена.

🔸 Почему более медленное ядро может ускорить весь сервис Экономия памяти позволяет обрабатывать больше запросов одновременно; результат нужно измерять вместе с задержкой.

В статье 2023 года авторы получили рост пропускной способности в 2–4 раза относительно FasterTransformer и Orca при сопоставимой задержке. Это результат их экспериментов с конкретными моделями и нагрузками. Для сегодняшнего сервера выигрыш придётся измерять заново.

Материалы выпуска: 📌 Страница выпуска с таймкодами 📊 Слайды 🎬 YouTube, VK Видео 🎧 Podster, Яндекс Музыка, Apple Podcasts 📝 Текстовый конспект

Если уже настраивали vLLM под свою нагрузку, расскажите в комментариях, во что упёрлись и что дало заметный выигрыш.

#AI #LLM #Inference #Architecture #ResearchInsights #Engineering

Открыть видео на YouTube

Публичные источники