[2/2] История появления Google TPU и их эволюции (Рубрика Engineering)
Продолжу рассказ про TPU от Google с 2021 года, а точнее с TPU v4. 4. TPU v4 (2021) - Optical Circuit Switching TPU v4 представил оптическое переключение цепей для ускорения связи между чипами, что критически важно для работы со всё более сложными ИИ-моделями. Производительность составила 275 TFLOPS на чип, с улучшенными оптическими межсоединениями. 5. TPU v5 и v5e (2023) - Оптимизация затрат TPU v5e и v5p сфокусированы на экономически эффективном обучении на масштабе, с улучшенной энергоэффективностью, динамическим масштабированием и поддержкой разреженности. 6. TPU v6 Trillium (2024) - Оптимизация производительности Trillium, шестое поколение TPU, предлагает впечатляющий скачок в 4.7 раза по вычислительной производительности на чип по сравнению с TPU v5e. А также обладает следующими характеристиками
- Удвоенная ёмкость и пропускная способность High Bandwidth Memory (HBM)
- Удвоенная пропускная способность межчиповых соединений
- На 67% более энергоэффективен, чем TPU v5e
- Масштабируется до 256 TPU в одном поде с низкой задержкой 7. TPU v7 Ironwood (2025) - опять инференс Ironwood, представленный в апреле 2025 года, стал заново TPU, специально разработанным для инференса (как TPU v1). Революционные характеристики Ironwood:
- Масштабирование до 9,216 чипов с жидкостным охлаждением
- 42.5 экзафлопс вычислительной мощности (в 24 раза больше самого мощного суперкомпьютера El Capitan)
- 4,614 TFLOPS на чип с 192 ГБ HBM памяти (в 6 раз больше, чем у Trillium)
- 2-кратная энергоэффективность по сравнению с Trillium
Если суммировать то видно, что процессоры Google прошли большой путь. Правда, остается вопроса, а как они чувствуют себя в сравнении с NVidia? И ниже есть ответ на этот вопрос
- NVIDIA H100: 3,958 TFLOPS (FP8), 80 ГБ HBM3, пропускная способность памяти 3.35 ТБ/с
- NVIDIA H200: 3,958 TFLOPS (FP8), 141 ГБ HBM3e, пропускная способность памяти 4.8 ТБ/с
- TPU v6 Trillium: ~2 PFLOPS FP16 для тензорных операций
- TPU v7 Ironwood: 4,614 TFLOPS на чип, 192 ГБ HBM, 7.37 ТБ/с пропускной способности
Как видим по FLOPS все норм. А если смотреть на эффективность по независимым исследованиям, то TPU v5e показывает в 50-70% более низкую стоимость на миллиард токенов для обучения крупных моделей по сравнению с кластерами NVIDIA H100. TPU v5e также потребляет значительно меньше энергии, чем H100 для аналогичной рабочей нагрузки (H100 может потреблять в ~5 раз больше энергии, чем чип TPU v5e под нагрузкой). В реальных задачах показатели примерно такие
- Для обучения GPT-масштабных моделей: TPU более экономически эффективны в 4-10 раз по сравнению с GPU
- Для инференса: TPU v5e обеспечивает в 3 раза больше пропускной способности на доллар
- TPU v4 показал производительность 1.2-1.7 раза быстрее и использует 1.3-1.9 раза меньше энергии, чем NVIDIA A100
В итоге, у TPU есть как преимущества, так и недостатки (+) Специализация для тензорных операций и глубокого обучения (+) Высокая энергоэффективность и экономическая эффективность (+) Интеграция с Google Cloud и оптимизация для TensorFlow/JAX (+) Масштабируемость в экосистеме Google Cloud (-) Доступность только через Google Cloud (-) Меньшая гибкость по сравнению с GPU для различных типов вычислений (-) Ограниченная экосистема разработки по сравнению с CUDA (-) Меньший объём памяти на чип по сравнению с новейшими GPU (до недавнего времени)
Если подводить итоги, то кажется, что у Google все хорошо со своей линейкой процессоров для Gen AI / ML задач и они дальше продолжат отстраивать эту инфру, которая дает им значимое конкурентное преимущество в эпоху лета Gen AI приложений. А вот для остальных эти процессоры означают vendor lock при прямом использовании или ориентир, куда стоит стремиться, если смотреть в будущее.
#AI #ML #Software #Engineering #Architecture #Infrastructure #Data