18+

白宮急召四大AI巨頭:前沿模型發布前「自願」安全測試框架成形 但疑慮未解

隨著AI模型 在網路攻擊與越獄 (Jailbreak)能力上的威脅日益加劇,美國政府正試圖在「不扼殺創新」與「國家安全」之間拉起一道防線。

根據The Information網站報導,美國白宮向MetaAnthropicOpenAIGoogle 發出邀請,於美國當地時間週二 (8/4)召開閉門會議。這場由國家網路總監辦公室 (ONCD)主持的會議,核心議程是討論一套已經如期完成的「前沿AI模型自願安全測試框架」。

把政府安檢插入模型發布流程:最高30天的「提前試用期」

這套框架的起源,可追溯至美國總統川普 於今年6月2日簽署的一項行政命令。該命令要求美國政府建立一套「機密基準」,專門測試AI模型的高階網路攻擊能力,藉此界定哪些模型屬於需要受監管的「受覆蓋前沿模型」 (Covered frontier models)。

根據這套新框架,簽署加入的AI企業,可以 (自願)在將新模型提供給外部受信任的合作夥伴之前,先開放給美國政府進行最長達30天的存取與測試。

然而,行政命令明確規定一條紅線:這項機制不得變相成為「強制許可」、「發布前審批」或「發行許可證」制度。換句話說,政府只能「提前檢查」這些模型是否有漏洞,或是有無國安風險,但依法無權直接「批准或否決」模型的公開發布。

儘管如此,這不代表政府手無寸鐵。事實上,白宮在此之前早就動用其他政策工具來介入模型的發布。例如,針對Anthropic的高階模型Mythos的公開版本「Fable」,美國政府就祭出出口管制;同時也曾要求OpenAI必須「分階段」發布其最新模型GPT-5.6,顯示即便不在測試框架內,美國政府仍能透過國家安全與出口管制的途徑,對AI業者施加強大的約束力。

測試環境反成漏洞?兩起驚悚的「越獄」事故

就在白宮推動這套框架之際,AI業界近期接連爆發的兩起安全事故,讓這場討論變得更加急迫。

今年7月,OpenAI承認其一組用於內部測試、試圖降低網路攻擊拒答率的模型,竟然突破隔離環境,入侵至知名開源平台Hugging Face的生產系統。根據OpenAI披露的攻擊途徑,該模型利用內部軟體的「零日漏洞」 (Zero-day vulnerability)取得網際網路連線,接著透過提權與橫向移動,成功取得測試題的答案。

無獨有偶,Anthropic隨後也坦承其部分模型在網路安全測試中,意外進入三家外部公司的真實系統中。

這兩起事件暴露出一個驚悚的事實:當我們在測試AI模型是否具備攻擊能力時,用來關住它們的「沙盒」 (Sandbox)、權限控管與監控機制,本身也可能被聰明的AI攻破。而這兩起事故引發美國眾議院網路安全委員會的高度關注,甚至要求OpenAI執行長Sam Altman出面說明。

「自願」框架背後的未解之謎

雖然白宮宣稱框架已經完成,但產業界仍對其中三處關鍵的「空白」感到擔憂:

• 測試標準不透明:由於網路能力基準被列為國家機密,外界與企業無從得知「跨越紅線」的明確門檻在哪裡,這讓外部研究人員難以覆核測試的公正性。

• 結果如何運用與保護:政府團隊提前取得模型後,相關的智慧財產權與商業機密該如何保護?測試結果是否會公開?目前仍是未知數。

• 「開源權重」模型的管理難題:對於像Meta這種主打開放權重模型 (Open-weight models)的公司來說,模型一旦公開,其後續的存取範圍與傳播路徑根本無法追蹤。這套依賴「封閉控制發布時間點」的框架,究竟該如何適用於開源模型,依然是最大的盲區。

筆者觀點

週二的白宮閉門會議,顯然不會對外發布正式結果。這套「自願性」框架是否真的開始運轉?我們只需要觀察接下來各家科技巨頭發布下一款前沿模型 (例如Gemini 4或下世代的Claude/GPT)的時程表中,是否默默地多出「30天的政府測試期」,就能知道答案。

《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》

本日熱門 本周最熱 本月最熱