К основному содержимому
к странице архива
#AI

PyTorch как слой переносимости: зачем туда пришли Cambricon и Ant Group (Рубрика #AI)

В этой новости легко зацепиться за геополитику: Alibaba Cloud, Ant Group, Cambricon и Huawei вместе выступили на PyTorch Conference China в Шанхае. Но мне здесь интереснее другой вопрос. Зачем производителю собственных AI-ускорителей платить $350 тысяч в год за Platinum-членство в PyTorch Foundation, если код PyTorch и так открыт?

Сначала поправлю новостную оптику. Не все четыре компании «только что вошли в PyTorch». Cambricon объявили Platinum-участником 7 сентября 2026 года, Ant Group — Gold-участником 8 сентября. Alibaba Cloud состоит в Foundation с 26 мая 2026 года, Huawei — с 17 октября 2023-го. Свежая часть истории — Cambricon и Ant, а общий шанхайский анонс собрал китайский AI-стек на одной сцене: модели Qwen, облачную инфраструктуру, чипы MLU и Ascend, а также runtime для агентов.

Моя интерпретация: китайские компании покупают не контроль над PyTorch, а место за столом, где снижают стоимость ухода от CUDA.

За $350 тысяч Platinum-участник получает по голосующему месту в Governing Board и Technical Advisory Council. Gold-членство стоит $150 тысяч, но отдельного кресла Ant не гарантирует: Gold-компании выбирают одного представителя на троих. Это влияние на бюджет, рабочие группы, CI и общие приоритеты экосистемы. Но не право нажимать Merge: техническое управление PyTorch закреплено за конкретными maintainers на основе вклада, а не за компаниями по уровню взноса.

И вот здесь начинается действительно важная часть. Проблема альтернативного AI-чипа — не только в FLOPS. Нужны операторы, compiler, distributed collectives, профилировщик, интеграции с библиотеками и синхронизация с каждым новым релизом PyTorch. Именно этот длинный программный хвост превратил CUDA в moat, который нельзя догнать одной красивой таблицей производительности.

PyTorch постепенно строит общий слой подключения ускорителей через PrivateUse1, эталонный backend OpenReg и Accelerator Integration Working Group. Идея в том, чтобы модель и большая часть прикладного кода видели единый PyTorch API, а CUDA, ROCm, CANN или Neuware оставались ниже. Тогда производители конкурируют уже качеством backend: покрытием операторов, поддержкой torch.compile, стабильностью distributed training и скоростью выпуска обновлений.

Но до взаимозаменяемости ещё далеко. Cambricon сейчас требует отдельный пакет torch_mlu и vendor-компоненты CNToolkit, CNNL и CNCL. Huawei продвинулась дальше: Ascend уже есть в публичной CI рабочей группы, но torch_npu всё равно устанавливается отдельно и зависит от CANN. Иными словами, общий фасад появляется, а под ним пока остаются разные лестницы, ключи и инструкции по эвакуации :)

Ant Group здесь про соседний слой. Компания показала runtime для AI-агентов на базе Kubernetes Agent Sandbox и Kata Containers. Это не вклад в PyTorch core и не ускоритель; скорее признак того, что вокруг Foundation начинают собирать более широкий open-source AI stack — от tensor runtime до изолированного выполнения агентов. Общей технической архитектуры четыре компании пока не объявили.

Поэтому смотреть я бы стал не на число китайских логотипов в Foundation, а на три скучных инженерных сигнала:

1️⃣ Появится ли Cambricon MLU в общей публичной CI рядом с Ascend; 2️⃣ Смогут ли torch_mlu и torch_npu поддерживать актуальный стабильный PyTorch без специальных сборок и долгого отставания; 3️⃣ Будут ли приниматься upstream-изменения в Inductor, distributed stack и domain libraries, а не только расти внешние vendor-репозитории.

Если это произойдёт, PyTorch станет для AI-железа настоящим слоем переносимости и немного уменьшит программный lock-in NVIDIA. Не отменит CUDA, её зрелые kernels, NCCL и инструменты — именно уменьшит цену первого шага в сторону другого ускорителя. Если нет, членство останется дорогим логотипом на сайте.

#AI #OpenSource #PlatformEngineering #Infrastructure #Architecture #Bigtech

Публичные источники