К основному содержимому
#Engineering

[2/2] История появления Google TPU и их эволюции (Рубрика Engineering)

#Engineering #AI #ML #Software #Architecture #Infrastructure #Data

Продолжу рассказ про TPU от Google с 2021 года, а точнее с TPU v4. 4. TPU v4 (2021) - Optical Circuit Switching TPU v4 представил оптическое переключение цепей для ускорения связи между чипами, что критически важно для работы со всё более сложными ИИ-моделями. Производительность составила 275 TFLOPS на чип, с улучшенными оптическими межсоединениями. 5. TPU v5 и v5e (2023) - Оптимизация затрат TPU v5e и v5p сфокусированы на экономически эффективном обучении на масштабе, с улучшенной энергоэффективностью, динамическим масштабированием и поддержкой разреженности. 6. TPU v6 Trillium (2024) - Оптимизация производительности Trillium, шестое поколение TPU, предлагает впечатляющий скачок в 4.7 раза по вычислительной производительности на чип по сравнению с TPU v5e. А также обладает следующими характеристиками

  • Удвоенная ёмкость и пропускная способность High Bandwidth Memory (HBM)
  • Удвоенная пропускная способность межчиповых соединений
  • На 67% более энергоэффективен, чем TPU v5e
  • Масштабируется до 256 TPU в одном поде с низкой задержкой 7. TPU v7 Ironwood (2025) - опять инференс Ironwood, представленный в апреле 2025 года, стал заново TPU, специально разработанным для инференса (как TPU v1). Революционные характеристики Ironwood:
  • Масштабирование до 9,216 чипов с жидкостным охлаждением
  • 42.5 экзафлопс вычислительной мощности (в 24 раза больше самого мощного суперкомпьютера El Capitan)
  • 4,614 TFLOPS на чип с 192 ГБ HBM памяти (в 6 раз больше, чем у Trillium)
  • 2-кратная энергоэффективность по сравнению с Trillium

Если суммировать то видно, что процессоры Google прошли большой путь. Правда, остается вопроса, а как они чувствуют себя в сравнении с NVidia? И ниже есть ответ на этот вопрос

  • NVIDIA H100: 3,958 TFLOPS (FP8), 80 ГБ HBM3, пропускная способность памяти 3.35 ТБ/с
  • NVIDIA H200: 3,958 TFLOPS (FP8), 141 ГБ HBM3e, пропускная способность памяти 4.8 ТБ/с
  • TPU v6 Trillium: ~2 PFLOPS FP16 для тензорных операций
  • TPU v7 Ironwood: 4,614 TFLOPS на чип, 192 ГБ HBM, 7.37 ТБ/с пропускной способности

Как видим по FLOPS все норм. А если смотреть на эффективность по независимым исследованиям, то TPU v5e показывает в 50-70% более низкую стоимость на миллиард токенов для обучения крупных моделей по сравнению с кластерами NVIDIA H100. TPU v5e также потребляет значительно меньше энергии, чем H100 для аналогичной рабочей нагрузки (H100 может потреблять в ~5 раз больше энергии, чем чип TPU v5e под нагрузкой). В реальных задачах показатели примерно такие

  • Для обучения GPT-масштабных моделей: TPU более экономически эффективны в 4-10 раз по сравнению с GPU
  • Для инференса: TPU v5e обеспечивает в 3 раза больше пропускной способности на доллар
  • TPU v4 показал производительность 1.2-1.7 раза быстрее и использует 1.3-1.9 раза меньше энергии, чем NVIDIA A100

В итоге, у TPU есть как преимущества, так и недостатки (+) Специализация для тензорных операций и глубокого обучения (+) Высокая энергоэффективность и экономическая эффективность (+) Интеграция с Google Cloud и оптимизация для TensorFlow/JAX (+) Масштабируемость в экосистеме Google Cloud (-) Доступность только через Google Cloud (-) Меньшая гибкость по сравнению с GPU для различных типов вычислений (-) Ограниченная экосистема разработки по сравнению с CUDA (-) Меньший объём памяти на чип по сравнению с новейшими GPU (до недавнего времени)

Если подводить итоги, то кажется, что у Google все хорошо со своей линейкой процессоров для Gen AI / ML задач и они дальше продолжат отстраивать эту инфру, которая дает им значимое конкурентное преимущество в эпоху лета Gen AI приложений. А вот для остальных эти процессоры означают vendor lock при прямом использовании или ориентир, куда стоит стремиться, если смотреть в будущее.

#AI #ML #Software #Engineering #Architecture #Infrastructure #Data