电科技9月6日消息,OpenAI发布的GPT-6 Astra大模型这两天还在刷屏,它是该公司首个使用10万卡训练的大模型,光这些显卡的费用就要60亿美元了,这也是国产大模型很难追赶的领域。
国内大模型发展最大的限制就是缺少足够的算力芯片,国内当然也在高强度发展自己的AI芯片,不论是华为、寒武纪、壁仞、摩尔线程还是百度、阿里、字节、腾讯等公司都在研发各种AI芯片。
但是大家也要面对现实,国产AI芯片在性能上跟美国的AI芯片差距还是不小的,下图汇总的国内外AI芯片算力性能对比可见一斑。
这张图对比了AI芯片的内存带宽及FP16算力性能2个指标,这都是AI大模型训练、推理的核心指标,国产中做得最好的还是华为的昇腾,性能追到了780TFLOPS,带宽能到780GB/s,带宽性能超过了H100,算力性能还差距比较大。
说得更直白一点,国产AI芯片现在连3年前的NVIDIA H200显卡的性能都很难追上,后者1700TFLOPS的性能、900GB/s的带宽放到现在都不弱。
当然,这张图里面的对比数据不算新了,华为已经有比昇腾910C更强的昇腾950了,用了自研的高性能内存,带宽也做到4TB/s了,整体性能虽然还是比H200差一些,但差距没有现在这样的代差了。
其他公司如寒武纪、摩尔线程、沐曦、壁仞等自研的AI芯片新一代产品的性能也大幅提升,前途还是很光明的。
国产AI现在被卡脖子的地方也就是上面2个关键指标——算力意味着先进工艺,带宽意味着内存,尤其是HBM内存,工艺及内存的产能不能大规模释放出来,国产AI芯片追赶NVIDIA的速度就会被拖累,不仅没法缩小差距,可能还会被现在的B200、B300及Rubin Ultra显卡甩开,生态就更难建立起来了。
往好的方面来看,这两个难题的解决速度比大家想象中的更快,先进工艺有了华为韬定律给出了新的方向,密度及性能大幅提升,明年的鲲鹏960 CPU、昇腾960 AI性能会有一波强力拉升,这个领域的突破值得关注。



