Arm CSS for Mobile 2:為代理式 AI 與 AI 原生圖像打造的平台

作者:Arm 邊緣 AI 產品負責人 Stefan Rosinger
一個整合 Arm C2 CPU 叢集、Mali G2-Ultra NX 神經圖像技術與系統層級最佳化的平台,為次世代行動體驗奠定基礎。
代理式 AI (Agentic AI) 正在重塑行動體驗。AI 的能力已從早期的問答互動,演進到能夠理解使用者意圖並自主執行任務。有鑑於裝置端 AI 與生成式 AI 的發展,這類系統能夠感知相關上下文資訊、規劃任務流程,並代表使用者協調各類應用程式與服務。
同時,代理式的工作流程以及日益複雜的 AI 原生圖像技術,也為行動運算帶來新的需求。隨著工作負載的複雜度持續提升,行動裝置的效能表現將取決於三個核心項目:各任務階段的執行速度、資料在不同運算引擎間的傳輸效率,以及系統對全任務流程的協同調度能力。
為滿足這些需求,就需要一個從整體系統層面進行設計和最佳化的運算平台。Arm 第二代行動裝置運算子系統 (CSS for Mobile 2) 正是基於這項理念打造的 AI 原生行動運算平台,透過將架構設計、實體實作與軟體生態系的深度整合,實現對複雜 AI 和圖像工作負載的系統級最佳化,全面提升效能與回應能力。
為完整代理式 AI 工作流程打造的平台
由於代理式 AI 在單次互動過程中會同時調用行動系統的多個元件,因此當裝置理解使用者意圖並推動任務逐步完成時,資料處理、模型執行、記憶體存取以及應用控制等環節,都必須保持緊密協同。

這種系統級設計理念貫穿了 Arm CSS for Mobile 2 的建構與提供方式。它將 CPU、GPU、系統 IP、軟體及開發者工具整合為一個完整的平台,並從整體工作負載出發,統籌最佳化效能、能源效率和資料傳輸效率。同時,CSS for Mobile 2 還將系統最佳化延伸至實體實作階段,使合作夥伴在開展系統單晶片 (SoC) 整合之前,便能夠將功耗、效能和面積 (PPA) 與架構設計同步考量。
這種異質運算能夠支援越來越多跨多個運算資源運行的工作負載,其中, CPU 做為可程式設計運算與系統調度中心,負責協調整個系統中的運算活動。憑藉著持續穩定的效能輸出與能效表現,即使面對反覆且同時進行的 AI 互動,整套系統也能在行動裝置功耗、散熱約束條件下,維持快速且即時回應。
該平台在實現高度整合的同時,也保留了高度的彈性。合作夥伴既可以單獨選用各個元件,也可以將其與自研 IP 或協力廠商 IP 結合,在更廣泛的運算子系統 (CSS) 配置中靈活整合,進而根據產品定位、效能目標和市場需求打造差異化的系統設計。
以 Arm C2 CPU 叢集協調代理式 AI
在 CSS for Mobile 2 平台中,Arm C2 CPU 叢集提供支撐代理式 AI 從「意圖」到「行動」所需的可程式運算力與編排能力。透過融合 C2-Ultra CPU、C2-Pro CPU 以及第二代 Arm 可擴展矩陣延伸指令集 (SME2) 技術,該叢集不僅提升了行動應用中的日常運算效能,還進一步強化裝置端的 AI 能力,為語音處理、資訊檢索和模型執行等工作負載提供更強支援。

Arm C2 CPU 叢集效能亮點:
- 最新 AI 模型效能最高提升達 1.7 倍
- 單執行緒效能最高提升 15%
- 網頁瀏覽速度提升 15%
- 應用程式啟動速度提升 12%
- 叢集級多執行緒效能提升 12%,支援知識檢索、模型準備和應用執行等任務並行處理
這些效能提升貫穿代理式 AI 工作流程的各個環節。更強的單執行緒效能能夠降低單次決策和系統回應的延遲,而更高的多執行緒效能則讓資訊檢索、模型處理和應用執行等任務能夠並行推進。同時,更快的網頁瀏覽和應用程式啟動速度,進一步縮短了服務存取和任務執行所需的時間。

該工作流程的核心為編排層 (Orchestration Layer)。它負責維護任務狀態、整合相關上下文資訊,並決定工作流程中每個階段應由哪個運算資源來執行。根據具體工作負載的不同,執行過程可能涉及本機應用、裝置端模型、其他運算資源或雲端服務,而 CPU 則負責統一協調許可權管理、任務決策以及整個任務的執行進程。
SME2:拓展裝置端 AI 能力
新一代 Arm C2 CPU 叢集整合雙 SME2 引擎,較上一代配置SME2 能力翻倍,可為各類對延遲敏感的裝置端 AI 工作負載,提供更充足的 AI 算力空間。
在運行最新的 Moonshine 和 Parakeet 語音轉文本模型時,搭載 SME2 的 Arm C2-Ultra 相較於 C1-Ultra,延遲降低 40%。更快的語音處理能力有助於縮短代理式 AI 互動的起始延遲,因為裝置需要先理解使用者的語音指令,才能啟動後續工作流程。
在記憶階段,搭載 SME2 的 C2-Ultra 的記憶體資訊檢索與搜索效能較上一代提升 41%,可協助AI 代理更快速地存取在裝置端儲存的上下文資訊。在推論階段,小語言模型(SLM)能夠將使用者請求與檢索到的上下文結合起來,生成結構化指令並調用相應工具,以執行下一步操作。在測試的各類模型中,C2-Ultra 完成此一過程的平均速度較上一代提升 25%。
在涵蓋語音處理、記憶檢索、推論、應用程式執行和網頁瀏覽等環節的端到端代理式 AI 工作流程測試中,搭載 SME2 的 C2-Ultra 配置相比上一代配置,實現了 24% 的整體效能提升,能夠更快完成整個工作流程。
神經網路加速器:提升行動圖像效能與視覺體驗
神經網路技術為提升視覺體驗開闢新的路徑,使行動裝置能夠在既定功耗和散熱預算下,展現超越傳統渲染技術所能提供的畫質表現。這些技術能夠基於低解析度輸入重建更高品質的圖像,對光線追蹤場景進行降噪處理,並透過生成中間幀來更高效率地提升遊戲流暢度。
Arm Mali G2-Ultra NX將神經加速能力直接導入 GPU,透過將專用神經網路加速器緊密整合至著色器核心,並結合全新的執行引擎和第三代光線追蹤單元(Ray Tracing Unit v3, RTUv3),為行動圖像帶來 AI 原生能力。在 CSS for Mobile 2 平台中,它為日益複雜的神經圖像工作負載,提供堅實的 AI 原生圖像基礎。
它支援神經超取樣(Neural Super Sampling, NSS),能夠基於低解析度渲染畫面重建更高解析度的圖像;支援神經幀率升頻(Neural Frame Rate Upscaling, NFRU)技術,透過生成中間幀提升畫面流暢度;同時支援神經超取樣與雜訊消除 (Neural Super Sampling and Denoising, NSSD) ,將神經超取樣與降噪技術相結合,在複雜光線追蹤場景中進一步提升圖像品質。
上述能力可與 Arm C2 CPU 叢集的代理式 AI 能力形成互補,透過專用 GPU 加速支援日益複雜的神經圖像工作負載。
系統 IP :強化異質運算協同效率
代理式 AI 和日益複雜的圖像工作負載,對行動系統內運算資源協同及資料傳輸效率帶來更高要求。為此,CSS for Mobile 2 採用 SI L2 系統互連,基於針對行動裝置最佳化的架構設計,為各類異質工作負載提供服務品質 (QoS) 支援。
再強大的運算引擎,也只有在資料能夠高效傳輸的前提下才能充分發揮價值。SI L2 可為整個平台提供更低的資料存取延遲和更高頻寬,同時具備一致性和 QoS 能力,幫助管理和最佳化多個運算資源之間的任務調度與優先順序分配。這些能力在 CPU、GPU 及其他系統資源並行運行,在共用資料及記憶體存取權限時尤其重要。
透過提升工作負載在整個系統中的通訊效率,SI L2 能夠充分發揮各個運算引擎的效能優勢,並使AI 與圖像工作負載持續保持高執行回應能力。
立即就緒的軟體生態系:加速開發者創新
Arm CSS for Mobile 2 擁有完善的軟體生態系支援。憑藉 Arm 數十年來對軟體的投入及全球超過 2,200 萬的 Arm 開發者社群,開發者可透過熟悉的框架和開發環境輕鬆調用其平台能力。KleidiAI 與主流 AI 框架的深度整合,為 Arm CPU 提供最佳化的軟體執行路徑,包括能夠充分利用 SME2 特性的 AI 工作負載。這代表開發者無需改變現有開發流程,即可透過正在使用的軟體堆疊充分釋放 Arm CPU 的底層能力。
Arm AI Portal 將這種支援進一步擴展到 AI 應用開發領域,在統一平台上彙聚經過最佳化和驗證的模型、效能與準確性資料、程式碼範例以及部署資源。同時,Arm MCP 伺服器進一步將這些能力導入代理式 AI 開發環境。這將協助開發者為特定工作負載選擇合適的模型,瞭解其在 Arm 平台上的效能表現,並加快從評估到部署的整個開發流程。對於自有專用模型的開發者,Arm 還提供早期存取版模型最佳化工具,協助其針對目標裝置進行最佳化。
對於針對 CSS for Mobile 2 平台進行開發的開發者,Arm AI Portal 提供了一條可直接運用 Arm 平台能力的路徑,説明開發者充分調動 CPU 端 SME2、GPU 端神經網路加速器等能力,將經過最佳化的 AI 模型與高階行動裝置所提供的效能優勢緊密結合。
KleidiAI、主流 AI 框架組成以及 Arm AI Portal ,合力貫通了從硬體到軟體的開發,將 Arm CSS for Mobile 2 的平台能力與開發者所使用的 AI 模型和軟體工具緊密連接,協助開發者打造更強大、更智慧的裝置端 AI 體驗。
將代理式 AI 帶到裝置端的完整平台
行動 AI 的下一個時代,將不再由單一跑分成績或單一加速器決定,而是取決於整個系統將使用者意圖轉化為實際行動的綜合能力。隨著代理式 AI 持續演進,並逐步融入日常互動,底層平台將成為決定這些體驗能否有效率地、大規模落地的關鍵因素。
CSS for Mobile 2 正是為這項轉變而打造。該平台針對回應速度、能源效率與持續執行能力,對運算資源、系統 IP、實體實作和軟體生態進行一體化協同最佳化,既為晶片合作夥伴提供了可靈活配置的基礎平台,協助其打造差異化產品,也為開發者搭建了從平台能力到應用落地的更直接路徑。
隨著裝置端智慧持續發展,這類系統級基礎能力的重要性愈發凸顯。CSS for Mobile 2致力於將這些架構創新真正落實到終端裝置,為次世代更快速、更高效率、更智慧的行動 AI 體驗奠定堅實基礎。
關於 Arm
Arm 是 AI 時代的基礎平台,其兼具卓越效能與節能優勢的運算能力,觸及全球所有連網使用者。為因應對運算永無止境的需求,Arm 平台橫跨核心 IP、先進運算子系統及專用晶片,使國際頂尖的科技公司能靈活設計、打造並大規模部署 AI 應用。透過與規模最大的運算生態系及業界超過 2,200 萬名開發者的共同努力,我們正於 Arm 平台上建構 AI 的未來。
所有資訊都「依目前情況」提供,且並不帶保證或代表性。此文件可以自由分享,但不得修改且必須註明出處。Arm 是 Arm Limited(或其子公司與附屬機構)的註冊商標。所有品牌或產品名稱均為所屬公司之財產。© 1995-2026 Arm Limited.