搜索
当前所在位置: 首页>算力百科

国产卡是如何兼容CUDA的?

发布时间:2026-05-28 10:44:08 作者:超级管理员 点击:264 【 字体:

都在说CUDA是英伟达最强的护城河,CUDA到底是什么?CUDA是英伟达在2006年推出的并行计算平台,简单说就是一套让程序员把计算任务扔给GPU跑的"语言+工具+规则"。听起来没什么特别,但问题在于,过去二十年,全球AI和深度学习的生态,几乎全部建立在CUDA之上。PyTorch、TensorFlow、各种大模型训练框架,底层都在调用CUDA。全球数百万AI工程师,写的代码默认就是CUDA代码。这套生态的护城河,不是技术本身,而是习惯和惯性。

CUDA

当前时间节点买了一张国产GPU,性能可能不差,但跑不了CUDA代码,对大多数AI工程师来说,等于买了一台没有软件的电脑。

这是国产GPU厂商必须面对的问题:用户的代码是为CUDA写的,不是为你写的。你让一个工程师把几十万行代码全部重写来适配你的新平台?不现实。所以,怎么让为CUDA写的代码在我的卡上也能跑,成了每家国产GPU厂商都必须回答的问题。

业界大致摸索出了几条路。

第一条,是直接翻译源代码。工具扫描你的CUDA代码,把里面的API调用自动替换成国产平台的对应接口,就像把一本英文书逐字翻译成中文书,然后交给中文读者。华为昇腾的CANN平台提供了这类迁移工具。好处是转换后的代码原生跑在国产卡上,性能损耗小;坏处是翻译不可能百分之百完美,总有些翻不过来,需要工程师手动修改。

第二条,是运行时拦截。不改源代码,而是在程序运行的时候,悄悄拦截所有对CUDA的调用,实时转发给国产GPU的驱动。程序以为自己在调英伟达的库,背后已经被偷梁换柱了。这就像同声传译——你说英文,翻译官在旁边同步翻成中文,对方听到的是中文,整个过程你毫无感知。摩尔线程的MUSA、沐曦的MXMACA走的都是这条路,用户体验好,改动极少甚至零改动,但翻译层本身有性能开销,复杂的CUDA特性也可能翻译不了。

第三条,是干脆重建生态。不翻译,直接重新写一遍。华为的MindSpore框架是这条路的代表,思路最彻底,但现实很骨感——MindSpore的用户量和PyTorch相比差距悬殊,工程师们不愿意学一套新框架,除非被迫。所以这条路更多是长期战略,短期内解决不了兼容问题。

在这几条路之外,有一家公司走了一条完全不同的路,值得单独说说,那就是海光。

海光的DCU系列,底层架构脱胎于AMD,AMD有一套开源的GPU计算平台叫ROCm,其中有个接口叫HIP,HIP的API设计和CUDA高度相似,官方还提供了hipify工具,可以自动把CUDA代码转成HIP代码,转换率相当高。

海光DCU正是基于这套体系,推出了自己的软件栈DTK(DCU Toolkit)。不过在极致性能调优上也不如完全自研的架构灵活。但在短期内,这是国产卡里CUDA兼容性最好的方案之一。

兼容CUDA这个说法,其实是个程度问题,不是非黑即白。

CUDA经过二十年发展,API数量庞大,功能极其复杂。国产厂商的兼容层,通常能覆盖最常用的那20%接口,而这20%能跑通80%的主流模型。但如果你的代码深度依赖NVIDIA特有的硬件特性,比如Tensor Core的特定指令集,兼容层就可能翻车。更准确的说法是:国产卡在主流AI训练和推理场景下,已经能做到较好的CUDA兼容;但在边缘场景和极致性能优化上,仍有差距。

这件事之所以难,根本原因在于CUDA和国产GPU的底层架构存在根本性差异。NVIDIA GPU有自己独特的线程层级模型,国产GPU的硬件架构各不相同,有的更像DSP,有的更像向量处理器,CUDA的很多优化技巧在国产GPU上可能根本没有对应的硬件支持,细腻的表达,注定会丢失。

CUDA的护城河,本质是二十年的生态积累。国产GPU厂商正在做的事,是先用"翻译"让用户能用起来,再慢慢建立自己的生态。这条路很难,但没有捷径。






阅读全文
相关推荐

重磅发布!AI 芯片安可测评结果:华为海思、阿里平头哥、海光、沐曦、摩尔线程、壁仞、天数智芯

重磅发布!AI 芯片安可测评结果:华为海思、阿里平头哥、海光、沐曦、摩尔线程、壁仞、天数智芯
2026 年 5 月 26 日,中国信息安全测评中心、国家保密科技测评中心发布《安全可靠测评结果公告(2026 年第 2 号)》根据《安全可靠测评工作指南 V3.0》要求,现将安全可靠测评结果予以公布,自发布之日起有效期三年。特此公告。排序方式:同一等级按产品名称首字笔画为序排列附表一:人工智能训练推理芯片人工智能训练推理芯...

国产卡是如何兼容CUDA的?

国产卡是如何兼容CUDA的?
都在说CUDA是英伟达最强的护城河,CUDA到底是什么?CUDA是英伟达在2006年推出的并行计算平台,简单说就是一套让程序员把计算任务扔给GPU跑的"语言+工具+规则"。听起来没什么特别,但问题在于,过去二十年,全球AI和深度学习的生态,几乎全部建立在CUDA之上。PyTorch、TensorFlow、各种大模型训练框架,底层都在调...

5月智算动态:信创GPU目录发布/tokens中转站被罚/B300回落/H2oo靴子落地/HBM3e需求爆发

5月智算动态:信创GPU目录发布/tokens中转站被罚/B300回落/H2oo靴子落地/HBM3e需求爆发
国产算力1.信创目录发布:第一批9颗信创算力芯片基于国产工艺(含封装),目录发布对各地方项目影响巨大地方态度:各地方政企“吹风”优先支持本地进目录的产品运营商态度:运营商自采项目“吹风”只能采购目录产品测试条件:前提条件,国产工艺(含代工),很多产品都送测了,第一批没进入,关键是代工(含封装)低点的问题...

英伟达全线产品又又又涨价!

英伟达全线产品又又又涨价!
《英伟达官宣DGX Station for Windows工作站,可运行1万亿参数模型》 这篇文章中有小伙伴提到可选配的RTX PRO 6000 Blackwell显卡价格就要10万元人民币。其实现在英伟达全系列产品都上涨了,本文盘点下相关产品的价格。英伟达全系列产品包括数据中心GPU、企业级(专业级)GPU、消费者GPU,消费者GPU包括RTX Geforce系列,企...

孙正义重登亚洲首富

孙正义重登亚洲首富
6月2日,福布斯实时富豪榜单显示,软银集团创始人兼CEO孙正义身家攀升至1007亿美元,一举超越印度安巴尼、阿达尼等富豪,时隔十余年再度登顶亚洲首富宝座。软银股价昨日一度大涨14.71%,市值达48万亿日元(约合3060亿美元),超过丰田的约46万亿日元,正式终结丰田连续二十余年霸占日本上市企业市值榜首的纪录。截至今日东京...

国内GPU卡全线飙涨原因分析

国内GPU卡全线飙涨原因分析
紧张升级5 月份,非常非常多的人寄希望于两个大佬谈判之后的的 GPU管制放松,特别是上一代 hopper架构的顶配算力卡松绑,弥补内部的算力不足,但是结果事与愿违,双方在 GPU 算力领域抓紧了卡脖子竞赛,彼此相互掐。(不要抱幻想了,干就完了)咱发布“韬定律”,引领未来半导体产业自主可控发展;对面发布史上最严 BIS 禁令...

总投资24亿!中国银联黄山数据中心园区项目正式通电

总投资24亿!中国银联黄山数据中心园区项目正式通电
2026年5月23日消息,银联黄山园区项目10KV开关站A/B双回路于近日成功完成高压送电。据悉,银联黄山园区项目位于安徽省黄山市高新技术产业开发区丹霞路与银蝶湖北路交口东北侧部分地块(烟草公司和中科创新广场用地东侧,百川路南侧),是国家关键金融基础设施重要组成部分,也是安徽省重点项目和黄山市头号工程。该项目总投...

AI算力缺货从GPU烧到了一整条产业链?

AI算力缺货从GPU烧到了一整条产业链?
2026年,一场覆盖芯片、云、服务器与数据中心零部件的全产业链算力短缺正席卷全球。从GPU、CPU、HBM,到光模块、铜缆模块、高速交换机、电力与液冷设备,乃至云计算和Token资源,几乎全线供不应求。算力稀缺与全线涨价,已成为贯穿整个AI产业的核心叙事。这并非简单的供需错配,而是AI算力架构升级带来的系统性重构。01 需求...

GPU服务器前端网络组网概述

GPU服务器前端网络组网概述
根据H100-GPU服务器确认各网络平面针对H100-GPU服务器的配置清单,可进行网络平面划分:single-400GE 8x (支持IB NDR/Ethernet OSFP),用于后端网络GPU分布式集群梯度同步single-200GE 1x (支持IB HDR/Ethernet QSFP56),用于对接存储网络dual-25GE 1x(SFP+),用于对接前端网络注:single指Single Port (单口网卡),...

极智算算力平台|硬核算力底座,赋能 AI 全域高效落地

极智算算力平台|硬核算力底座,赋能 AI 全域高效落地
随着人工智能技术飞速普及,大模型训练、模型微调、AI 推理、高性能计算、数字孪生等场景迎来爆发式增长,稳定、合规、高性价比的算力资源,已成为企业、科研机构与开发者发展的核心刚需。极智算算力平台深耕 GPU 算力服务赛道,聚焦合规算力供给、整机租赁、服务器托管、大模型一站式部署,以顶尖硬件配置、灵活服务模式、...
返回顶部