AI重點
文章重點整理:
- 重點一:AMD推出ROCm.ai,整合Claude、Cursor與Codex
- 重點二:透過AMD Skills與Hyperloom降低ROCm開發門檻。
- 重點三:相同硬體下推論效能最高提升3.3倍。
長久以來,AMD 在AI晶片市場面對NVIDIA時,雖然硬體效能表現不落人後,但「軟體生態圈」如ROCm的開發門檻與學習曲線,卻始終是吸引開發者轉移陣營的最大障礙。為了從根本解決這項限制,AMD於Advancing AI 2026大會上,正式宣布推出全新的原生AI開發體驗平台ROCm.ai。
ROCm.ai主打「代理AI」 (Agentic AI)開發流程體驗,讓工程人員能夠直接透過自然語言,以及現有的AI程式碼助理,包含Anthropic的Claude 、Cursor (目前隸屬SpaceXAI),或是OpenAI的Codex,並且在AMD平台上完成從環境安裝、驗證、佈署、除錯到終極效能優化的全套工作流程。
AMD官方表示,ROCm.ai預計將於今年8月正式上線開放體驗。
三大核心模組:ROCm CLI、AMD Skills與Hyperloom
ROCm.ai並非只是單一工具,而是將AMD的專家經驗深度打包進開發者日常使用的工具鏈中,主要由三大核心元件構成:
• ROCm CLI (命令行介面):提供統一、具備硬體感知 (Hardware-aware)能力的命令行體驗,專門處理AI工作負載的安裝、驗證、服務佈署、更新與除錯。同時支援高安全性的「離線/斷網」 (Air-gapped)環境佈署使用,大幅簡化軟體環境所需建置時間成本。
• AMD Skills:將AMD原廠編寫的專業知識庫直接整合進Claude、Cursor與Codex等主流AI編輯器內,讓開發者在編寫程式或優化系統核心時,獲得的不再是空泛的概略建議,而是專門針對AMD硬體架構的最佳化指引。
• Hyperloom (開源代理系統):一款自動化端到端推論優化的代理系統,能自動執行從效能分析 (Profiling)、瓶頸診斷、Kernel核心優化到結果驗證的完整閉環工作流程。過去需要專業工程師花費數週進行的底層調校,現在透過Hyperloom即可在數小時內自動完成。
軟體驅動效能大爆發:同硬體推論提升3.3倍、訓練提升2.4倍
除了改善開發者的操作體驗,ROCm.ai在底層也透過AI自動優化核心架構、記憶體管理、平行化排程與任務指派。
根據AMD Performance Labs的實測數據 (以搭載8組AMD Instinct MI355X GPU的伺服器為例),運行最新版ROCm.ai (ROCm 7.2.2預覽版)在完全相同的硬體配置下,相比於先前版本的ROCm 7有以下提升效果:
• 推論效能 (Inference):在運行GLM-5、Kimi-K2.5與DeepSeek-R1等前沿大型語言模型時,平均Token吞吐量 (TPS)增加高達的3.3倍提升。
• 訓練效能 (Training):在Megatron-LM框架下訓練DeepSeek-V2-Lite、DeepSeek-V3-16B與Qwen3-30B-A3B等模型時,平均效能也能有2.4倍的顯著提升。
不只拼硬體,AMD用「AI幫AI編寫程式」翻轉軟體弱勢
ROCm.ai的發表,顯然是AMD在軟體戰略上極具思維革新的作法。
過去近十年來,NVIDIA靠著CUDA生態系積累無數的程式碼庫,並且在程式設計技術問答網站StackOverflow累積大量討論內容,形成極難跨越的軟體生態高牆。如果AMD只是被動地複製CUDA的API,或是強迫開發者翻閱厚厚的ROCm文件,顯然難以趕上NVIDIA CUDA的社群生態發展。
AMD這次精準地看到AI開發方式的根本轉變——現在的工程師不再逐行手寫低階程式核心架構,而是大量依賴Cursor、Claude等AI程式編碼助理生成,並且手動調整所需修改細節,僅而提出ROCm.ai開發體驗平台,讓開發者能藉由AI更快建構適用於AMD硬體架構的程式編碼,甚至能將CUDA程式碼遷移至ROCm軟體生態上,並且保留高達75%的原始程式碼,大幅降低轉換陣營的陣痛期。
透過推出AMD Skills與Hyperloom,AMD等同於把原廠最強的GPU優化專家變成「24小時隨叫隨到的AI助教」。開發者甚至不需要精通ROCm的底層架構,只要用自然語言提出需求,AI就能自動調用AMD的專家知識來優化硬體效能。
這種「以AI代理對抗生態系溝壑」的策略,結合3.3倍的免費效能釋放,將成為吸引開發者與企業從CUDA跨足AMD平台的超強誘因。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》
精華 FAQ
-
ROCm.ai主要要降低ROCm過去的使用門檻,改善開發者面對安裝、驗證、部署與除錯時的學習成本,讓AMD不再只靠硬體競爭,而是用更完整的軟體體驗吸引開發者。
-
ROCm CLI負責硬體感知的安裝與部署管理,AMD Skills把原廠最佳化知識嵌入Claude、Cursor與Codex,Hyperloom則自動完成效能分析、瓶頸診斷、Kernel優化與驗證。
-
AMD以8組Instinct MI355X GPU測試顯示,在ROCm 7.2.2預覽版下,推論平均Token吞吐量最高提升3.3倍,訓練效能也提升2.4倍,展現軟體優化對硬體的放大效果。
訂閱《科技玩家》YouTube頻道!
💡 追新聞》》在Google News按下追蹤,科技玩家好文不漏接!
📢 Galaxy Z Fold8 Ultra開箱!摺痕退散、多工效能 同時爽玩Pokemon GO、Pikmin Bloom
📢Sony 1000X THE COLLEXION耳機開箱!工地實測降噪效果 空間音訊秒置身電影院
📢電商平台買「全新庫存機」踩雷!電池循環44次還帶維修紀錄 網揭無良賣家手法
📢 Apple Pay、信用卡搭北捷「只扣1元」是沒刷到嗎?官方曝扣款規則秒懂
📢國家級「行動斷網」演習完整指引!NCC揭3重點:勿用手機處理重要工作
📢 LINE免費貼圖4款!「蛤」字必下載爽用半年、熊大兔兔動態圖超Q

討論區