
Arm 在這次的 Mali GPU 架構中透過 AI 原生設計提供更多顯示效能。
在看完對整個 Arm CSS for Mobile 2 平台的架構解說之後(請見:Arm 推出 CSS for Mobile 2 平台 在 AI 時代提供行動裝置更強顯示效能與 AI 代理運算能力),Arm 在這次的說明會中也針對其中的 CPU 與 GPU 部分做了更詳細的說明,所以接下來我們就來看這個部分的內容。

這部分的說明由 Arm 負責 GPU 的產品經理 Deyan Lazarov 進行解說,不過同樣的因為現場螢幕的翻拍因素,所以下面就用 Arm 官方提供的簡報畫面來進行說明。

首先談到新世代行動處理器中 GPU 的需求,從 2024 年的桌面級顯示效果(就是要跟桌上型電腦一樣,支援 Unreal 虛幻引擎、具備 Lumen 全域光照、Nanite 虛擬幾何、Megalights 即時光線追蹤等),到 2025 年的複雜光線追蹤效果(提供 12 倍的光線追蹤負載,支援 3A 遊戲大作),到今年的跨平台遊戲支援,行動 GPU 所提供的效能跟支援能力可說是有飛躍性的成長。

不過在行動裝置的功耗與散熱條件限制下,要持續提升行動處理器內 GPU 的效能,就需要透過 AI 來幫助,畢竟行動裝置沒辦法做到如桌上型電腦般的散熱跟供電(就連桌上型電腦現在也加入 AI 模型來輔助提升效能了),Arm 在這邊列出了運用傳統 GPU 渲染(最左邊)、以及透過 AI 進行像素擴增(中間+右邊)的顯示畫素來源比較。最左邊的傳統 GPU 渲染就是利用 GPU 的渲染單元進行全部顯示畫素的產生,但是這樣一來就很難達成行動裝置的 1-2W 功耗限制,也無法提供持續的高顯示幀率,影響遊戲體驗。
而導入 AI 生成後(中間+右邊),傳統 GPU 的渲染引擎就僅要輸出原有 1/8 的畫素,降低了 GPU 的負載與功耗,也減輕了整體系統的運算壓力,在行動裝置上更可以確保長效的電池續航力,而剩下的 7/8 畫素則是由 AI 重新建構而成,透過較低的系統負載,讓遊戲設計團隊可以將系統效能發揮在遊戲其他部分或是增加遊戲畫面的精細度,有更大的創作自由度,另外玩家也可以體驗到桌上型 PC 等級的遊戲體驗。

而 Arm 在這次 CSS for Mobile 2 中,憑藉著過去的經驗,為行動裝置打造出了全新 AI 原生顯示引擎,不僅提供了系統等級的效能與能源效率表現,另外透過開放的軟體架構以及整體生態系的支援,提供客戶更完整的 AI 原生 GPU 設計。

而這個 AI 原生顯示引擎的設計目標,就是重新定義了行動裝置在顯示效能與功耗上的平衡點,除了硬體設計外,Arm 這次也提供給開發者全新的神經顯示開發套件(Nerual graphics dev kit),讓開發者可以在自己的設計中更容易去推出具效能、電池續航力以及高擬真視覺體驗的產品。

而這次 Arm 推出的 GPU 產品就是 Mali G2-Ultra NX,加入了與顯示運算緊密連接的神經運算單元、新的運算引擎以及第三代光線追蹤單元等設計。
直接先來看 Arm 所提供,與 Sumo Digital 共同開發渲染出的示範影片《光影新生》(Neural Dawn)
這個示範影片主要透過 Unreal Engine 5.5 所運算,具備全域光追設計,最高提供 1400 條動態光線運算,是提供給遊戲開發者,來看看在 Mali G2-Ultra NX 到底能做出那些效果,Arm 也表示,透過 AI 原生影像引擎,利用更小的團隊人力就能推出比以前複雜兩倍的遊戲作品。

另外在效能表現上,跟上一代 CSS G1-Ultra 相比,G2-Ultra NX 提供了大幅度的效能提升,在光影新生示範中由原本的幾乎不可玩的 15 fps 提升到穩定的 60 fps,在 FPS 效能上最高提升 4 倍,而在能源效率上最高也是提升 4 倍,而在記憶體傳輸量上則是減少了 70%,連帶降低了延遲跟提高電池續航力。

而會有這樣的效能輸出表現,是因為這次 Arm 在 Mali G2-Ultra NX 導入了 NSSD 跟 NFRU 兩項 AI 技術,NSSD 為類神經超取樣與雜訊消除(Neural Super Sampling and Denoising),在原本的 NSS 功能中加入了降低雜訊的設計,可以在啟用光線追蹤繪圖技術時,利用 AI 演算法,利用少量光線與參考相鄰畫素/前一畫格的資料進行推論,並且降低雜訊,在簡報中則是展示了將 540p 低解析度的畫面提升到 1080p 解析度並且經過降噪處理的輸出結果。

沒有 NSSD(左)跟有 NSSD(右)的比較。

NFRU 則是類神經幀率升頻(Neural Frame Rate Upscaling),透過參考前後連續畫格以及遊戲引擎運動向量(Motion Vectors)等資訊,產生成中間畫格,將原本 30 fps 的遊戲畫面提升為 60 fps。

在 Mali G2-Ultra NX 開啟 NFRU 後,可以將 60 fps 的畫面提升到 120 fps,並且降低 33% 的記憶體存取量。

而 Mali G2-Ultra NX 透過上述兩個技術,就可以讓 GPU 僅渲染出原本 1 幀畫面的 1/4 畫素量,就能生成 2 幀的畫面,等於是僅渲染出原有的 1/8 畫素量。

而顯示效果未來將會出現在運用 Mali G2-Ultra NX GPU IP 的處理器產品上。

另外在軟體架構與遊戲軟體的支援配合部分,Arm 也將 NSS/NFRU 的模型在 Hugging Face 上公開,提供給需要微調的開發者使用,並且針對遊戲引擎提供了 Plug-in 整合以及整合開發套件,另外針對遊戲開發生態提供了開發套件以及示範文件與工具,讓現有已經推出的遊戲可以在 3 到 6 個月內導入,而新遊戲的開發可以在 18 個月內完成導入。

Arm 也在簡報中提到了目前已經開始合作的遊戲/遊戲引擎開發商,包括 Unity 引擎、Unreal 引擎、騰訊、網易等。

另外在較早推出的 NSS 類神經超取樣(Neural Super Sampling)技術部分,Mali G2-Ultra NX 則是利用其在行動裝置等級的效能上提供桌上型主機等級的顯示效能表現,將低解析度等級畫面的顏色、運動向量、深度以及前後幀資訊,透過神經網路引擎重新建構以及填充細節,並且維持時序的穩定,接著進行反鋸齒處理,提供在行動裝置上最佳化的顯示效果。

Arm 表示利用 NSS 技術可以將原本 540p 的畫面提升到 1080p 解析度,並且細節表現跟桌上型主機等級不會差太多。

而在顯示效能跟功耗的表現上,在開啟 NSS 後,在同樣的功耗限制下可以將 FPS 提升至 2 倍,並且減少 50% 的記憶體存取需求。

為了將上述的 AI 功能整合到 GPU 內,這次 Mali G2-Ultra NX 在硬體架構上也有所更動,直接將神經加速器整合到渲染核心中,跟運算引擎共用控制架構與記憶體系統,可以更有效的運用 GPU 記憶體,並且對整體運算流程進行最佳化。另外在規格部分, Mali G2-Ultra NX 也提高了 GPU 運算時脈,並且提供 INT8 與 INT16 以及張量運算支援。

而 Arm 表示從 Mali G2-Ultra NX 開始,將會持續跟遊戲以及 AI 平台(簡報裡是指騰訊),在 GPU 以及 AI 原生技術的開發部分進行合作。

至於在傳統遊戲效能部分,Mali G2-Ultra NX 這次透過時脈的提升,在遊戲執行效能上也有 9% 到 14% 不等的增進,而在跑分校能部分,非光線追蹤的部分有 17% 到 20% 的效能提升,光線追蹤的部分則是有 18% 到 24% 的效能提升幅度。

而在一開始提到過的新式運算引擎部分,Mali G2-Ultra NX 這次則是針對目標桌面等級顯示運算的複雜度,重新設計了渲染引擎,加大了渲染引擎,並且對內部的暫存器做了更細小的切割,讓每個執行單元的暫存器數量增加為兩倍,並且透過動態執行器寬度設計來提供更靈活的運作。

另外在光線追蹤效能部分,Mali G2-Ultra NX 導入了第三代光線追蹤單元,透過消除全域光線中共用的三角形邊來節省系統運算資源,進而提供更多的輸出以及更小的記憶體需求,Arm 表示在 Mali G2-Ultra NX 在最高的光線追蹤效能下,可以節省 13% 的記憶體存取量。

另外透過硬體的不透明微貼圖(Opacity Micromaps)處理,讓可以 Mali G2-Ultra NX 可以提供桌上型 GPU 等級的場景細節表現,並且同時保留行動裝置必須要有的電源效率。

最後總結來說,Mali G2-Ultra NX GPU 這次透過 AI 原生設計,提供了最高 4 倍的 FPS 顯示幀率輸出、4 倍的最大電源效率以及 70% 記憶體頻寬節省,並且透過新的運算單元以及第三代光線追蹤單元,提供桌上型 PC 等級的顯示效果。
感謝分享&介紹,現在ai效能越來越重要 


























































































