AI重點
文章重點整理:
- 重點一:Hexagon NPU新增Element Accelerator並增50%共享記憶體。
- 重點二:新架構強化32K長上下文、KV-Cache與30B MoE推論。
- 重點三:晶片整合Sensing Hub、Oryon CPU與GPU形成代理AI迴圈。
繼日前陸續揭曉新一代Snapdragon 旗艦運算平台採用的客製化Oryon CPU,以及換上全新神經融合 (Neural Fusion)加速架構的Adreno GPU細節後,Qualcomm 在即將於9月下旬在夏威夷登場的2026年度Snapdragon技術大會 (Snapdragon Summit 2026)之前,再次對外釋出關鍵核心技術細節,針對負責裝置端AI運算的Hexagon NPU架構進行全面升級。
本次Hexagon NPU最核心的變革,在於既有的張量 (Tensor)、向量 (Vector)與純量 (Scalar)運算單元之外,首度加入全新的「Element Accelerator」(元件加速器),並且大幅增加50%的大容量共享記憶體 (Large Shared Memory)。
導入Element Accelerator與50%共享記憶體,專為長上下文與代理式AI設計
這項全新加入的Element Accelerator,主要鎖定「快速動作迴圈」 (Fast Action Loops)、「支援高達32K的長上下文長度」 (Long Context Length up to 32K),以及針對Transformer架構至關重要的「KV-Cache (鍵值快取)加速」。
在傳統裝置端大型語言模型 (LLM)推論過程中,資料的預填充 (pre-fill)階段與生成第一個詞元 (Time to First Token, TTFT),往往是決定使用者互動體驗是否流暢的關鍵瓶頸。透過Element Accelerator與增加50%的共享記憶體頻寬配合,新架構在執行INT4量化模型時:
• 資料預填充 (pre-fill)運算效率:相比前一代設計提升最高達50%。
• 首個詞元產出速度 (Time to First Token):最快可縮短至1.5秒內。
• 模型規模支援度:在裝置端最高可支援參數量達300億 (30B)規模的混合專家模型 (MoE, Mixture of Experts)。
藉由這項設計,裝置端能以極低延遲消化長篇文檔、多輪複雜對話,或是即時音訊輸入,大幅提升多步驟推理任務的反應敏捷度。
晶片內建完整「Agentic Loop」,實現端到端全裝置端AI協同運算
除了單一NPU算力拉升,Qualcomm也進一步公開晶粒層級 (on the die)的「代理型迴圈」 (The agentic loop)協同運作流程:
• 環境感知接收:透過全時運作 (Always-on)的Qualcomm Sensing Hub感知環境聲音訊號 (Ambient Voice In)。
• 任務編排與決策:語音訊號送往最高運作時脈突破5GHz的Oryon CPU,由CPU擔任中樞協調者 (Orchestration),依序進行詞元化 (Tokenize)、規劃 (Plan)、路徑分流 (Route)、工具調用 (Tool Calls)、反思 (Reflect)與回應生成 (Responds)。
• 異質推論分工:涉及複雜推理與生成任務時,CPU會動態將推論工作調度 (Dispatched)至Hexagon NPU與Adreno GPU分工並行加速。
• 低延遲即時回應:最終以超低延遲直接在裝置端輸出語音回應 (Voice Response Out),全程無須將敏感對話或音訊上傳至雲端伺服器。
搭配先前曝光的Oryon CPU「FlexCache」架構,以及具備神經融合加速的Adreno GPU,整顆晶片正轉型為一套能夠自主觀察、決策,並且調用多方工具的「裝置端AI代理」硬體引擎。
此外,從晶片架構圖中亦可見整合新一代X105 5G數據晶片與FastConnect 8800無線通訊模組,確保裝置在連網環境下的資料吞吐表現。
從規格佈局推估:新一代Snapdragon走向與雙平台設計策略
從Qualcomm接連揭曉CPU突破5GHz大關、GPU架構重組,到如今NPU針對30B MoE模型與KV-Cache硬體加速的佈局來看,新一代Snapdragon旗艦平台顯然不再單純追求基準跑分,而是全面圍繞在「系統級代理AI」與「全天候感知」的日常能效體驗。
至於市場關注的產品規劃走向,Qualcomm在此世代極可能採取更明確的「雙平台」或「雙晶片版本」策略佈局:
一方面,面對智慧型手機在功耗與散熱架構上的極限限制,Qualcomm可能提供標準旗艦版本,著重於在既定功耗預算內實現極高能效比,讓多數主流旗艦手機能流暢運行7B至14B級別的常駐型個人助理;另一方面,針對散熱裕度較高的頂級遊戲旗艦手機、平板,乃至於進一步延伸至Windows on Snapdragon的輕薄運算裝置,則可能推向解鎖更高時脈、釋放完整30B MoE邊緣推論潛能的高效能運算版本。
這種將同一核心微架構 (Oryon CPU + 具備Element Accelerator的Hexagon NPU)依據熱設計功耗 (TDP)進行分層調配的作法,不僅能更好地滿足不同品牌客戶在散熱模組與電池容量上的差異化設計,更有助於Qualcomm進一步擴大Snapdragon在跨智慧型手機與次世代AI PC兩大市場的生態主導權。
更多確切規格與正式命名,預期將在9月下旬的夏威夷Snapdragon技術大會上全面揭曉。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》
精華 FAQ
-
核心是Hexagon NPU新增Element Accelerator,並把大容量共享記憶體提升50%。這讓裝置端在處理長上下文、KV-Cache與生成式AI任務時,能以更低延遲完成推論。
-
它可提升pre-fill效率、縮短TTFT到1.5秒內,並支援最高30B規模的MoE模型。對長文閱讀、多輪對話與即時語音互動都有明顯幫助。
-
流程從Sensing Hub接收環境聲音,再由5GHz以上的Oryon CPU負責tokenize、plan、route與tool calls,必要時調度NPU和GPU分工,加速後直接在裝置端輸出語音回應。

討論區