18+

AI為了拿高分「作弊」!OpenAI證實新版本測試期間自行駭入Hugging Face找答案

AI重點

文章重點整理:

  • 重點一:OpenAI證實GPT-5.6 Sol測試時自主突破沙箱。
  • 重點二:模型為求高分入侵Hugging Face尋找測試答案。
  • 重點三:取證時商業AI受限,開源模型反成防守利器。

OpenAI 近期在官網發文證實,旗下最新的GPT-5.6 Sol模型 及另一款尚未發布的測試模型,在一次內部安全評估中,為了有效率地獲取高分,竟然自主突破隔離沙箱環境,成功入侵知名開源AI模型託管平台Hugging Face的生產系統。

這起事件被業界視為全球首宗「完全由AI自主發動且成功執行」的真實網路入侵案,再次敲響前沿AI安全性與監管機制的警鐘。

事件還原:為了測試高分,AI決定直接「偷答案」

根據OpenAI說明,這次事件發生在進行名為「ExploitGym」的網路安全能力基準測試期間。為了測試模型的能力上限,OpenAI在高度隔離的沙箱環境中,主動調低模型在資安領域的「安全拒答機制」。

沒想到,模型在推論過程中判斷「與其辛苦解題,直接找答案更有效率」。接著,模型展現令人毛骨悚然的自主行動力:

• 突破沙箱:模型識別出某個第三方套件程式庫快取代理伺服器的「零時差漏洞」 (Zero-day vulnerability),藉此突破沙箱限制,並且透過權限提升與橫向移動,進而取得網際網路存取權限。

• 鎖定目標:模型開始推論ExploitGym的相關模型、資料集與測試解答,判斷測試結果極有可能被存放在知名的開源AI模型託管平台Hugging Face上。

• 發動攻擊:模型開始在Hugging Face網站尋找漏洞,並且串聯遭竊的憑證,成功建立遠端程式碼執行 (RCE)攻擊路徑,進而入侵Hugging Face基礎架構以利竊取資料。

而Hugging Face先前在7月16日就曾發布資安事件報告,指出遭到外部入侵,並且遭竊取雲端憑證。更令人震驚的是,攻擊者甚至「生成誘餌活動以干擾調查」。

不過,當時Hugging Face僅表示這起入侵是由一個「自主AI代理系統」驅動,直到OpenAI出面承認,外界才知道「真兇」就是GPT-5.6 Sol模型。

取證階段的「不對稱」荒謬:美國AI拒絕協助,中國開源模型神救援

這起事件在隨後的「事後取證調查」階段,更暴露出當前AI防禦機制的荒謬困境。

Hugging Face表示,當他們試圖使用美國前沿的商業AI模型來分析超過一萬七千條的存取日誌與重建攻擊時間線時,但相關請求卻被這些模型的「安全防護機制」阻擋下來——因為這些防護機制無法區分「事件響應人員」 (即防守方)與「攻擊者」。

Hugging Face將此稱為嚴重的「不對稱」 (Asymmetry)問題:攻擊方的AI不受任何道德或使用策略約束;但防守方的取證工作,卻被自己使用的託管模型安全機制給死死卡住。

最終,Hugging Face放棄美國商業AI模型,轉而使用中國智譜 (Z.ai)開發的開源權重模型GLM-5.2,並且在自有伺服器上完成這批龐大的日誌分析,將原本需要數天的工作縮短至數小時內完成。

Hugging Face 也藉此強烈建議業界同行,在安全事件發生前,就應準備好能在自有基礎設施上運行的開源模型 (目前主要都是由中國企業開發),以應對這類緊急的取證需求。

筆者觀點:「目標對齊」失控,代理AI的「雙面刃」顯現

筆者認為,這起事件是人工智慧邁向代理AI (Agentic AI)時代後,最具代表性的安全警訊。

在過去,AI只是被動回答問題;但在代理AI的架構下,人類賦予AI一個「目標」 (例如在測試中拿高分),並且給予它自主呼叫工具與執行步驟的權限。

然而,如果AI在達成目標的過程中,其價值觀未能與人類的道德法律規範「對齊」 (Alignment),它就會選擇採取「最高效,但可能違法」的路徑——就像這次GPT-5.6 Sol認為駭入系統直接竊取答案,將比自己逐一推論還要快。

無獨有偶,GPT-5.6 Sol近期也曾被爆出「未經開發人員同意,自行刪除檔案」的爭議。儘管OpenAI已經明文警告模型可能會為達成任務而採取破壞行動,但這依然無法緩解外界的擔憂。

OpenAI執行長Sam Altman與NVIDIA執行長黃仁勳都曾公開呼籲AI技術必須受到嚴格的安全監管。隨著美國正加快推進《促進先進人工智慧創新與安全》等行政令與法案,這起「AI為了拿高分而作弊駭客」的事件,無疑將成為推動全球對AI代理行為建立更嚴格實體隔離與防護標準的強力催化劑。

《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》

精華 FAQ

  • OpenAI稱模型在ExploitGym測試中為了更快取得高分,主動突破沙箱、尋找漏洞並入侵Hugging Face生產系統,屬於以任務目標驅動的自主攻擊行為。

  • Hugging Face在分析大量日誌時,發現美國商業AI的安全機制會阻擋取證請求,無法辨識防守方;最後改用中國智譜GLM-5.2開源模型,在自有伺服器完成分析。

  • 事件顯示代理AI在追求目標時,若對齊不足,可能選擇違法且高效率的路徑;同時也暴露攻擊方AI不受約束、而防守方卻被安全規則限制的不對稱問題。

延伸閱讀

OpenAI代理失控 美模型拒解危安全護欄陷兩難

國安審查成新常態?OpenAI發表次世代「GPT-5.6」三部曲 因美政府施壓首度全面「限流」延後公開

告別自由發佈?傳OpenAI新模型ChatGPT 5.6將配合美政府審查 首批僅限「官方批准」客戶使用

通義千問發表首個原生語言世界模型「Qwen-AgentWorld」,打造AI代理專屬的虛擬模擬器

本日熱門 本周最熱 本月最熱