從 Token 到任務:代理式 AI 如何改變基礎設施的關注焦點

July 29, 2026

隨著 AI 從回應提示詞邁向完成任務,基礎設施的最佳化重點也從模型本身擴展到整個工作流程,涵蓋規劃、工具調用、結果驗證與任務執行。

Agentic AI

早上 8:42,一名開發者打開筆電,映入眼簾的是環境建構失敗、測試報錯,還有一條等待發佈程式碼分支。過去,她可能需要花費大量時間逐一排查日誌、比對程式碼提交記錄、追溯倉庫歷史;如今,她只需要向 AI 編碼代理下達一句簡單指令: 「修復失敗的測試。找出 bug、提交補丁、重跑測試並匯總改動內容。」

敲幾下鍵盤,只需喝口茶的時間,AI 代理就回覆了已通過測試的補丁,並附上簡潔的說明。對使用者而言,效果如同瞬間魔法:輸入需求,輸出結果。但在系統內部,實現這個結果的過程一點也不簡單。

僅一條提示詞就可以觸發請求解析、任務創建、策略檢查、程式碼函式庫檢索、上下文拼接、Token(詞元)編碼、模型調用、工具驗證、沙盒路徑、檔案編輯、測試運行、遙測採集與最終結果核驗。模型調用固然關鍵,但它只是工作負載的一環,真正展現工程能力的是對任務圖的協調與編排。

代理式 AI 會進行規劃、檢索、執行、校驗、重試和回饋。隨著 AI 從孤立的「提示—回應」互動模式轉向持續工作流程模式,效能的衡量方向也從 Token 轉向完整的任務執行。


模型調用已不再等同於全部工作負載

長期以來,AI 基礎設施主要是以模型執行為衡量標準:預填充 (prefill)、解碼 (decode)、每秒生成 Token 數、產出第一個 Token 延遲、輸送量、批次處理效率、記憶體佔用以及加速器利用率。這些指標依然重要,但隨著代理式 AI 的興起,系統的關鍵路徑已不再侷限於模型執行本身。

傳統的推論請求有其明確的邊界:從提示詞到結果輸出。而 AI 代理的工作流程可能涉及任務規劃、上下文檢索、狀態管理、工具與 API 調用、沙盒運行、結果驗證、遙測採集以及重試。最終輸出可能是一個答案、一段程式碼變更、一條資料庫查詢、一次工具調用,或是一個搜集更多資訊的決策。

簡而言之,代理式 AI 讓推論演變為一個分散式系統問題。GPU 對於高強度模型執行仍然不可或缺,但針對 GPU 展開的工作正日益成為系統效能的決定性因素:哪些任務在運行、在哪裡運行、伴隨哪些上下文、允許使用哪些工具,結果是否滿足使用者需求。

這個週邊的技術堆疊為模型增加了多個層級,其中大量協調工作都由 CPU 承擔,包括編排、記憶體與檢索、工具調用、運行時與沙盒、策略系統以及可觀測性等。模型則提供智慧、推論和生成能力,而週邊系統能將這些能力轉化為可執行的行動。


為什麼傳統推論基準已無法全面衡量系統效能

對於聊天機器人,Token 輸送量可以展現出模型回應速度與生成效率,以及系統能服務多少使用者。但對於代理式 AI,這個評判視角則不夠全面。

開發者並不會以每秒多少原始 Token 來感知系統效能。他們真正關注的是:bug 是否定位準確、補丁修復是否正確、測試是否全部通過、許可權是否合規、結果是否可信且可驗證。對於企業、科學研究、安全、營運以及實體世界的各類 AI 代理而言,同樣如此,使用者關心的是最終成果。

這代表著代理式 AI 時代需要採用工作流程級別的效能指標,包括:單項任務完成成本、工具調用延遲、檢索延遲、沙盒啟動時間以及單節點 AI 代理數量。核心評判標準從「模型生成得有多快?」轉變為「系統完成任務的效率有多高?」


CPU 發揮決定性的作用

CPU 在代理式 AI 中的價值,展現在針對模型調用的各個環節中。模型運行前,系統解析請求、初始化運行環境、載入策略、讀取工程檔、查詢檢索系統、排序上下文、統計 Token 數量並準備請求。模型調用期間,CPU 負責處理路徑、Token 化、批次處理、資料流和 Schema 配置。調用完成後,CPU 驗證輸出、路徑工具調用、管理沙盒與子進程、採集日誌、歸類故障、更新狀態並整合遙測資料。

在編碼 AI 代理的例子中,一些最耗費 CPU 資源的工作往往發生在模型生成修復方案之後:運行測試、調用編譯器、啟動子進程、歸類故障、自主選擇重試邏輯。這些操作會對 CPU 核心、快取、記憶體、儲存和編排軟體形成壓力。

這正是代理式 AI 看似「瞬間完成任務」背後隱藏的關鍵運算工作。


主節點正演變為整個系統的控制中樞

隨著代理式 AI 系統規模化,主節點 (head node) 的角色變得具有策略意義。AI 主節點不只是加速器旁邊的一顆 CPU。它是核心控制中樞,負責讓異質 AI 系統以統一、可靠的方式協同運作:路徑請求、管理狀態、準備上下文、協調加速器、調用管理 API 與工具、執行策略、採集遙測,並保持工作流程的可觀測性。

編排的本質,在於決定執行什麼任務、在哪裡執行、攜帶哪些上下文、允許調用哪些工具,以及如何判斷任務已經完成。而主節點則是支撐此能力的基礎設施控制中樞,負責在 CPU、GPU、加速器、記憶體、儲存、網路、執行環境、資料庫、規則管理系統以及可觀測性工具之間協調資源,並將這些編排決策貫穿整個系統。

隨著 AI 基礎設施日益異質化,模型、工具、記憶體、加速器、API、沙盒、規則管理、追蹤和評估迴路都必須保持同步協作。而主節點正是這一協調能力得以統一執行和運轉的控制中樞。


Arm 的機會:最佳化完整的代理式 AI 工作流程

對 Arm 而言,代理式 AI 代表著一次平台級的機會。其對基礎設施的要求,正對應了雲端基礎設施建設者最關心的關鍵能力:效能、能效、擴展性、軟體成熟度以及選擇自由度。產業評判標準不再侷限於 Token 生成速度,而是平台能否在延遲、功耗、成本、資源利用率、穩定性、開發反覆運算效率等現實約束下,高效率地完成更多工作流程。

Arm 提供了一個為異質基礎設施打造的運算平台。在代理式 AI 時代,AI 系統由 CPU、GPU、加速器、記憶體、儲存、網路、執行環境、API、工具、可觀測系統和規則控制協同組成。Arm 的核心價值,在於説明整個系統實現更高效率、更強的擴展能力,並使系統級最佳化更加容易。

此一價值始於 Arm 深厚的技術基礎:基於靈活的 Arm Neoverse IP 與運算子系統 (CSS) 打造的運算平台、軟體支援體系以及合作夥伴生態系,為 AI 基礎設施建設者提供了針對特定工作負載設計和部署基礎設施的多元路徑。代理式 AI 讓這種選擇靈活性變得更加重要,因為沒有任何單一運算配置能夠高效率地承擔工作流程中的每一個環節。

這也就是為什麼 Arm 的價值應當從工作流程層面來衡量。更優秀的代理式 AI 基礎設施應當展現在這些成果上:更低的單項任務成本、更低的延遲、更高的資源利用率、更可預測的執行效果。這些關鍵指標能夠直接展現 CPU 和主節點的價值,並將其與業務成果緊密相連。

Arm 將這一理念繼續延伸,推出針對代理式 AI 基礎設施的自研晶片 Arm AGI CPU,提供另一種部署 Arm 架構算力的選擇。在這套方案中,CPU 協調針對模型展開的工作:控制、記憶體、檢索、工具、API、執行環境、沙盒以及可觀測性。

其目標並非削弱 GPU 或其他加速器的作用,而是讓整個異質系統更好地協同運作。代理式 AI 時代,真正擁有優勢的將是那些能夠最佳化整個任務圖 (Task Graph),而非僅僅最佳化 Token 流程的基礎設施。


次世代的基準:以任務完成為核心

回到前文那位等待修復結果的開發者,她需要的不是 Token,而是修復 bug。這就是代理式 AI 帶來的基礎設施架構轉變。在提示詞驅動的傳統問答時代,模型效能是顯而易見的重心。在代理式 AI 時代,系統必須就全流程的迴路進行最佳化:模型智慧、記憶體、工具、狀態、規則管理、執行、驗證與可觀測性。

次世代 AI 基礎設施的評判標準,將是它能否快速、準確、安全、可觀測且高效率地完成任務。在此背景下,Arm AGI CPU 為 AI 基礎設施建設者提供了部署 Arm 架構算力的新選擇,用於擔負編排與任務執行等關鍵工作負載,説明將模型輸出轉化為真正有價值的行動。

關於 Arm

Arm 是 AI 時代的基礎平台,其兼具卓越效能與節能優勢的運算能力,觸及全球所有連網使用者。為因應對運算永無止境的需求,Arm 平台橫跨核心 IP、先進運算子系統及專用晶片,使國際頂尖的科技公司能靈活設計、打造並大規模部署 AI 應用。透過與規模最大的運算生態系及業界超過 2,200 萬名開發者的共同努力,我們正於 Arm 平台上建構 AI 的未來。


所有資訊都「依目前情況」提供,且並不帶保證或代表性。此文件可以自由分享,但不得修改且必須註明出處。Arm 是 Arm Limited(或其子公司與附屬機構)的註冊商標。所有品牌或產品名稱均為所屬公司之財產。© 1995-2026 Arm Limited.