
Arm 宣布推出 CSS for Mobile 2 平台,針對行動裝置的 AI 原生顯示以及 AI 代理處理所打造。
Arm 在每年下半年 9 月初都會推出新的行動處理器平台(呼應手機/行動裝置的更新週期),而在今年則是提前在 8 月底在北京提前對媒體舉辦新一代平台的說明會,由負責客戶端運算的副總裁 James McNiven,講解這次新推出的 CSS for Mobile 2 行動裝置平台 IP,主要針對 AI 運算時代的來臨,在手機等行動裝置上提供以 AI 為基礎的加速顯示效能以及 AI 代理執行能力。

Arm 負責客戶端運算的副總裁 James McNiven。

這次主要是以簡報的形式來講解這次 Arm CSS for Mobile 2 平台的主要特色,不過因為現場翻拍螢幕會有一點色差,所以下面就用 Arm 官方提供的簡報來進行說明。

不用說也知道,現在 AI 已經滲透到各個科技領域中,從雲端基礎架構、實體 AI(就是機器人跟自動駕駛車輛)、邊緣裝置的 AI(如手機、筆電等),已經成為目前科技產業中不可或缺的要素,而 Arm 在這部分就是提供了最主要的處理器 IP 設計,提供現在到未來更為前瞻的 AI 技術。

而聚焦在邊緣運算部分,Arm 在這邊更是提供了邊緣 AI 運算裝置重要的處理器架構基礎,從簡報中可以看到,從個人 AI 運算部分,Arm 提供了包括高階的 NVIDIA DGX Spark、蘋果 MacBook、聯想 AI PC、Chromebook、行動裝置的手機、智慧周邊包括智慧眼鏡、智慧音箱到個人家庭中心等裝置的核心運算 IP。

而 AI 發展到現在已經來到了一個轉折點(inflection point),從過去需要靠提示詞反應、單次互動、智慧反應、雲端為主,接下來則是來到了 AI 參與/動作、持續協助、更深入的個人體驗以及更多本地 AI 執行等特性,讓 AI 更加深入每個人的日常生活。

過去在使用 AI 時,主要是針對個別功能,例如即時翻譯、總結郵件內容、生成影像等進行處理,而處理器架構也針對個別功能提供不同的 AI 效能強化。

在 AI 代理的加入後,則是透過(一個或是多個)AI 代理理解命令後,自行規劃並且運作這些 AI 模型來達到最終整合的效果。

以手機來說,就是從過去的單純影像增強、智慧回覆,到現在加入生成式 AI 提供更多個人化功能,未來就是透過裝置端的 AI 代理,直接理解使用者的命令、行為進行對應的自動動作處理。
而 AI 代理也帶給行動裝置革命性的操作體驗,過去透過生成式 AI 提供了簡單的一問一答回應(例如:幫我找附近的餐廳),現在則是透過 AI 代理可以達成從認知、記憶、理解到動作等系統性的回覆(例如:幫我計畫一下周年慶活動並且訂位,系統就會依照使用者先前在手機裡面的瀏覽紀錄、電子郵件、行事曆,找到適合的時間,搜尋喜好的餐廳並且進行訂位)。
而 CPU 在這邊扮演的角色就是 AI 代理的心臟。

除此之外 AI 也對顯示運算的基礎產生改變,過去由傳統顯示渲染所產出的畫面,現在可以透過神經網路 AI 加速來提供更好的顯示效能。

行動顯示運算在這時也來到了轉折點,透過更強的 AI 技術,在手機的散熱設計/電力限制下,提供桌上型 PC 等級的顯示體驗,包括渲染出更多的像素(提供更高解析度與顯示幀率)、更多複雜內容以及更快速逼真的光線追蹤顯示效果。

這也讓 AI 擴展到整體運算架構中的各個層面。

而 Arm 也是目前市面上數量最大的 GPU 平台(想想有多少手機就知道了),目前已經有超過 140 億的 Mali GPU(Arm CSS 平台中的 GPU)出貨裝在各種裝置上。

而 Arm 準備了一整個生態系來應對 AI 運算時代的到來,包括在 CPU 部分加入 SME2 引擎,並且在 GPU 部分加入了神經運算單元,並且從設計/開發工具到軟體/生態系,Arm 都提供了完整的解決方案。

這也是 Arm 從 2021 年來投入 AI 運算架構更新的成果。

接著就談到這次發表會的主角:CSS for Mobile 2 平台,跟去年的 Lumex CSS 平台(請見:手機平板免聯網就能算 AI!Arm 推出新一代 Lumex CSS 平台打造更好用的隨身 AI 裝置!)相比,這次的 CSS for Mobile 2 平台算是針對 AI 代理進行最佳化的改進版本,在 CPU 的架構上大致跟 Lumex CSS 接近(畢竟上次算是大改了),仍然可以硬體廠商依照自己的需求來以不同核心的組合進行搭配。

而 Arm 在簡報中也表示,這次的 CSS for Mobile 2 平台更是針對 AI 原生運算邊緣裝置所設計,提供更穩定、安全、有效率的 AI 持續執行效能。在 GPU 部分推出了新一代的 Mali G2(最高為 G2-Ultra NX),具備次世代的神經加速顯示設計。CPU 部分則是推出了具備 SME2 引擎的 C2 CPU 叢集,提供了裝置端的 AI 代理執行體驗。

除了 C2 CPU 叢集以及 Mali G2-Ultra NX GPU 外,這次 Arm 也持續採用大型的 SI L2 interconnect 架構提供更高速低延遲的快取效能。

對於採用目標導向、需要持續協作的 AI 代理來說,畢竟就是持續進行認知、記憶、理解、動作等不同階段的協作,對於記憶體速度與容量要求相當高,如果要達成好的體驗,高速低延遲的大型快取設計是絕對必要的。

接著來看這次 CSS for Mobile 2 平台的 C2 CPU 叢集,以 Arm 推出的參考設計來說,以 2 顆 C2-Ultra 核心、6 顆 C2-Pro 核心,搭配 SME2 引擎以及 DSU 組成,這個配置跟上一代 Lumex CSS 的配置是相同的(當然核心是新一代的)。

而透過核心的更新以及 AI 代理的加速,即便採用同樣的 SME2 引擎,CSS for Mobile 2 平台也比上一代在 AI 模型的執行效率上最高有 1.7 倍的提升。

而 SME2 從去年推出到現在,在生態系部分已經有相當多的合作夥伴加入。

包括 vivo、OPPO 與三星等,都導入了 SME2 在自家的解決方案中,提供包括即時轉譯、影像辨識、語音辨識、背景虛化、物件偵測等功能。

也跟包括 Gemma、騰訊、Stability.ai、Qwen 等模型進行合作,而 Arm 旗下的 KleidiAI 架構也持續擴展更多資源,包括與更多第三方 App、AI 框架整合,並且與 200 款以上的微核心進行最佳化設計。

在 SME2 引擎的加持下,裝置端現在能提供真實的多執行緒 AI 運算能力、並且提供更正確、高品質的生成回覆。現場也 Demo 了一段利用 SME2 進行本地端運算提供即時翻譯回覆的功能,來看一下影片吧:

而在單純處理器的運算效能部分,這次 CSS for Mobile 2 平台的 C2 CPU 叢集在單執行緒效能上提升了 15%、多執行緒效能提升了 12%、在網頁瀏覽效能部分提升了 12%,在 App 啟動速度上提升了 12%。

接著講到 GPU 的部分,就如先前所提到的,在行動裝置散熱與功耗的限制下,透過傳統渲染方式繼續提升顯示畫面的細緻度與效能相當困難,而 AI 加速提供了解決的辦法,透過減少傳統渲染產出的畫素,再利用 AI 神經網路重新建構細節、畫面幀率以及光線的做法,已經成為在行動裝置上要提高畫質不可或缺的技術。

而這次 Arm 在 CSS for Mobile 2 平台上則是推出了 Mali G2-Ultra NX GPU,是首款針對 AI 原生設計推出的 Mali GPU,導入了 NX 神經加速引擎、新的執行引擎、第三代光線追蹤單元等,搭配開放的軟體架構以及生態系,可說是對行動裝置的顯示效能賦予了新的 AI 加速能力。

而在顯示加速的 AI 軟體功能部分,除了先前就已經推出的 NSS 神經超採樣功能外,這次 Mali G2-Ultra NX GPU 則是支援了進階的 NFRU 神經幀率提升以及 NSSD 神經超採樣降噪功能,前者是透過生成幀的方式,在每個渲染幀間插入畫面來提高幀率,後者則是在超採樣放大後,透過神經網路進行降噪以及光線追蹤的處理,在這次 Arm 則是提供了 Neural Dawn 這個展示片段來讓使用者先參考 NFRU+NSSD 處理的效果:

而在效能的提升幅度部分,從簡報中可以看出利用 NSS 就能提供比起原生渲染最高 2.1X 的幀率輸出,而在新的 NFRU 跟 NSSD 加入後,比起原生渲染最高可以有 4x 的顯示幀率。

而在 Mali G2-Ultra NX GPU 的顯示效能部分,比起前一代有著 20% 的效能提升,在遊戲表現上則是有 14% 的提升、並且在 DRAM 頻寬的需求部分降低了 13%。

而在整體系統 IP 的設計上,應對 AI 代理對於記憶體高頻寬/低延遲的要求,CSS for Mobile 2 平台則是透過加大的 SI L2 快取設計來進行加速,包括 C2 CPU 叢集與 Mali G2-Ultra NX GPU 的資料,都先透過 SI L2 快取設計來進行資料的緩衝,減少直接存取統一記憶體所造成的負擔。

而 SI L2 設計也提供了更新的 LPDDR6 記憶體支援、比起 SI L1 更低的延遲、導入更高效的 MTE 安全執行設計,也讓晶片設計面積更加縮小等優勢。

跟 SI L1 相比,SI L2 降低了 45% 的記憶體延遲。

除了硬體之外,Arm 也提供了完整的軟體開發/應用架構平台,提供給開發者完整的解決方案。

這次推出了一個名為『AI Portal』的平台,上面提供了預先最佳化後的模型,可以直接佈署的範例應用以及透過 AI 代理執行的 AI 最佳化工具。

整體 AI Portal 的架構是這樣的,可以讓開發者以模型選擇或是以應用層面來尋找最適合的切入角度,選擇適合的模型或是對自有模型進行最佳化處理。

目前這個 AI Portal 已經上線提供給開發者使用,支援包括 Hugging Face 等平台。
接著 Arm 還針對這次 CSS for Mobile 2 平台的 C2 CPU 叢集以及 Mali G2-Ultra NX GPU 進行更詳細的介紹,陳拔會陸續為大家補上,敬請期待。
感謝分享&介紹,大家都在比AI算力呀 


























































































