CodeFest Russia: Куда катится железо для нейронок? (Рубрика AI)
Интересное выступление Валентина Мамедов из Сбера, где он провел анализ рынка железа для AI. Начал он с рассказа про рыночные реалии, которые таковы
- ChatGPT - это сейчас 5-й по популярности сайт в мире
- NVIDIA контролирует 92% рынка GPU для дата-центров
- H100 стоит $30,000, а стек из 8 таких карт - $250,000
Если сравнивать карты потребительского и серверного сегментов, то
- RTX 4090 стоит 2к$, а H100 порядка 30к - разница в 15 раз при схожей пиковой производительности
- Пропускная способность памяти RTX 4090 1 ТБ/с, а у H100 уже 3 ТБ/с
- H100 оптимизирована для вычислений с точностью BF16 - специального типа для нейросетей
Но основная проблема даже не в железе, а в экосистеме для разработки
- NVIDIA работала над этим последние 20 лет и у них отличные фреймворки, пофикшены баги и вот это все
- Flash Attention на AMD появился только через год после NVIDIA
- Переход на альтернативы = риски и потеря времени разработки
Если говорить про бюджетные альтернативы, то
- Ноутбук Apple M4 Pro сравним с RTX 4090 для многих ML-задач
- Apple M-кластер за $20,000 может запускать DeepSeek v3 со скоростью 20 токенов/сек
- Но потребительские GPU нельзя эффективно объединить в кластер для обучения (эта опция есть только в промышленных картах от NVidia)
Основные выводы доклада следующие
- Монополия NVIDIA держится на софте, не на железе - экосистема CUDA критически важна
- Но конкуренты растут - им не дает покоя маржа NVidia с промышленных карт, которая по оценкам достигает 57% ||(воистину во время золотой лихорадки выигрывает продавец лопат)||
- Среди конкурентов есть Cerebras ($2.5M за чип), AWS Trainium и Google TPU v7 ||(по оценке автора чипы TPU для Google стоят в два раза дешевле, чем использование NVidia карт)||
- Для персонального инференса или даже для малого бизнеса достаточно RTX 4090
- Для инференса побольше подойдет кластер из Apple M
#AI #Engineering #Software #ML #Hardware #Future #DevEx