AMD ROCm 10正式發佈:大模型 推理性能暴漲3.3倍

NVIDIA的CUDA公認護城河能力極高,AMD的顯示卡跑實際應用往往要比NVIDIA吃虧很多,然而AMD最近說CUDA不足為慮也是真的,A卡在最佳化上也做到神速提升。

SemiAnalysis日前發佈了一份AMD與NVIDIA顯示卡在Qwen3.5 397B及MiniMax M3兩款開源大模型上的性能及成本對比,出戰的是兩邊當前最強的MI355X顯示卡與B300顯示卡。

AMD這邊對比了兩個時間點,一個是8月12日,一個是最新的8月31日,因為NVIDIA的顯示卡性能一如既往保持水準,AMD則是在快速最佳化提升。

AMD ROCm 10正式發佈:大模型 推理性能暴漲3.3倍

在Qwen3.5大模型上,AMD在短短兩週時間內就大幅提升了MI355X顯示卡的表現,8月12日時90 TTFT(首字時間)大多在2.0秒至5.5秒之間; 8月31日時大部分工況的時延壓縮到了0.9秒至3.5秒區間,響應速度提升近一倍。

此前MI355X的吞吐性價比天花板在50M tok/$左右;最佳化後在低時延段(如1.5s -2.5s)就突破了80M-110M tok/$,並在TP2工況下最高達到了~140M tok/$,差不多三倍水平。

這個性能也非常接近NVIDIA當前的旗艦AI卡B300了,不過後者在低時延下的性能依然領先。


AMD ROCm 10正式發佈:大模型 推理性能暴漲3.3倍

在MiniMax M3大模型上也有類似的結果,8月12日時MI3550X跟B300差距很大,但到了8月31日,最佳化後的MI355X互動速度從之前大約55tok/s/user提升到了230tok/s/user,也是三倍左右的提升。

AMD ROCm 10正式發佈:大模型 推理性能暴漲3.3倍

整體來說,AMD在過去兩週時間內就大幅最佳化了MI355X的性能,兩個開源大模型中各種工況下速度提升2倍到3倍是不成問題的,部分情況下提升超過3倍,儘管還不能說超越B300,但性能水平也是天差地別了。

別忘了,AMD的顯示卡在性價比上依然有優勢的,MI355X的每小時Tco成本是1.5美元,B300是2.26美元,差距在1/3左右,折算下來MI355X的整體效益也很可觀了。

AMD ROCm 10正式發佈:大模型 推理性能暴漲3.3倍

AMD的這些提升基本上符合他們發佈ROCm 10時的宣傳,在硬體不變的情況下各種最佳化就能把大模型的推理性能提升3倍以上。

有了這些基礎,AMD真的可以不用仰視CUDA的生態優勢了,今年還會有性能更強大的MI455X新一代AI平台上市,繼續最佳化的話說不定可以趕超NVIDIA一次。
2026-09-03 2:24 發佈
NVDA 是早買早享受,AMD是晚買不後悔..........多年經驗,大多數人是.......................不能等的,哪怕是一下下
在崇尚鋒芒的世界裡,溫柔是我最深邃的抵抗。
內文搜尋
X
評分
評分
複製連結
Mobile01提醒您
您目前瀏覽的是行動版網頁
是否切換到電腦版網頁呢?