К основному содержимому
#Books

DeepSeek в действии (DeepSeek in Action) (Рубрика Books)

#Books #AI #DeepSeek #LLM #Engineering #Software #SystemDesign

Наконец-то дочитал книгу "DeepSeek в действии", с которой все вышло забавно - она 1 июля 2025 года в ДМК Пресс, переводчиком был В. Яценков, а оригинал называется "DeepSeek in Action: LLM Deployment, Fine-Tuning, and Real-World Projects" от китайской "Лаборатории искусственного интеллекта будущего". Я прочитал первую часть почти сразу - буквально за пару дней после получения, а дальше она надолго зависла в стопке. А все дело в том, что она состоит из двух неодинаковых по качеству блоков

1️⃣ Почему DeepSeek вообще стал инженерным событием В первом разбирается базовая архитектура Transformer и те доработки DeepSeek, которые полтора года назад всколыхнули индустрию: MoE, механизм внимания, оптимизация памяти и вычислений, обучение с переменной разрядностью, распределенная оптимизация. Это именно тот слой, ради которого книгу стоило открыть. 2️⃣ Как использовать API DeepSeek Здесь авторы рассказывают банальщину про то, как генерировать тексты, решать математические задачи, писать код, собирать чат-клиенты. Я понимаю, зачем такие главы нужны массовому читателю, но читать их в 2026 году скучно. Вокруг LLM API все быстро становится commodity: endpoint, ключ, запрос, ответ, немного кеширования, очередное демо.

А вот первая часть достойна краткого упоминания, так как именно там авторы рассказывают про инженерные фокусы, что сейчас уже выглядят стандартом

1️⃣ MoE (mixture of experts) вместо плтоных (dense) моделей У модели может быть очень много параметров, но для конкретного токена активируется только часть экспертов. В DeepSeek-V3, по technical report, всего 671B параметров, но активируются 37B. Масштаб растет, а вычисление остается разреженным. 2️⃣ Multi-head Latent Attention, MLA Обычный Transformer на длинном контексте упирается в KV-cache: нужно хранить ключи и значения прошлых токенов, и это быстро становится дорогим по памяти. MLA сжимает Key-Value cache в latent vector. Это дает сильное сокращение KV-cache и рост throughput. 3️⃣ Auxiliary-loss-free load balancing Авторы уходят от вспомогательного loss для балансировки экспертов, чтобы не портить качество основной задачи 4️⃣ Multi-token prediction Это когда модель на обучении предсказывает не только следующий токен, а несколько следующих. Это попытка выжать больше качества и скорости из самой training objective. 5️⃣ Инженерные моменты Авторы использовали FP8/mixed precision, распределенное обучение, параллелизм и коммуникация между GPU. По отчету DeepSeek-V3, модель предобучали на 14.8T токенов, а полный training обошелся в 2.788M H800 GPU hours. Эти цифры стоит читать как утверждение из технического отчета авторов, но именно они объясняют, почему DeepSeek так громко прозвучал: индустрия увидела не только качество модели, а заявку на другую экономику обучения.

На фоне такой первой части книги оставшиеся 250 страниц про использование API выглядят просто как текстовый заполнитель, который не ясно зачем читать:) особенно сейчас. И это показывает, что AI-книги устаревают не просто быстро, а еще и неравномерно. Даже сейчас архитектурная часть этой книги выглядит полезной, а остальное уже нет.

P.S. Забыл упомянуть, что теперь ребята из ДМК Пресс переводят много китайских технических книг напрямую - у меня целая пачка сейчас в todo листе лежит, а пару я взял с собой в отпуск, так что может дальше напишу про рекомендательные системы на основе LLM:)

#Books #AI #DeepSeek #LLM #Engineering #Software #SystemDesign