电科技9月2日消息,NVIDIA的CUDA公认护城河能力极高,AMD的显卡跑实际应用往往要比NVIDIA吃亏很多,然而AMD最近说CUDA不足为虑也是真的,A卡在优化上也做到神速提升。
SemiAnalysis日前发布了一份AMD与NVIDIA显卡在Qwen3.5 397B及MiniMax M3两款开源大模型上的性能及成本对比,出战的是两边当前最强的MI355X显卡与B300显卡。
AMD这边对比了两个时间点,一个是8月12日,一个是最新的8月31日,因为NVIDIA的显卡性能一如既往保持水准,AMD则是在快速优化提升。
在Qwen3.5大模型上,AMD在短短两周时间内就大幅提升了MI355X显卡的表现,8月12日时90 TTFT(首字时间)大多在2.0秒至5.5秒之间; 8月31日时大部分工况的时延压缩到了0.9秒至3.5秒区间,响应速度提升近一倍。
此前MI355X的吞吐性价比天花板在50M tok/$左右;优化后在低时延段(如1.5s -2.5s)就突破了80M-110M tok/$,并在TP2工况下最高达到了~140M tok/$,差不多三倍水平。
这个性能也非常接近NVIDIA当前的旗舰AI卡B300了,不过后者在低时延下的性能依然领先。
在MiniMax M3大模型上也有类似的结果,8月12日时MI3550X跟B300差距很大,但到了8月31日,优化后的MI355X交互速度从之前大约55tok/s/user提升到了230tok/s/user,也是三倍左右的提升。
整体来说,AMD在过去两周时间内就大幅优化了MI355X的性能,两个开源大模型中各种工况下速度提升2倍到3倍是不成问题的,部分情况下提升超过3倍,尽管还不能说超越B300,但性能水平也是天差地别了。
别忘了,AMD的显卡在性价比上依然有优势的,MI355X的每小时Tco成本是1.5美元,B300是2.26美元,差距在1/3左右,折算下来MI355X的整体效益也很可观了。
AMD的这些提升基本上符合他们发布ROCm 10时的宣传,在硬件不变的情况下各种优化就能把大模型的推理性能提升3倍以上。
有了这些基础,AMD真的可以不用仰视CUDA的生态优势了,今年还会有性能更强大的MI455X新一代AI平台上市,继续优化的话说不定可以赶超NVIDIA一次。





