隨著AI模型 在網路攻擊與越獄 (Jailbreak)能力上的威脅日益加劇,美國政府正試圖在「不扼殺創新」與「國家安全」之間拉起一道防線。
根據The Information網站報導,美國白宮向Meta 、Anthropic 、OpenAI 及Google 發出邀請,於美國當地時間週二 (8/4)召開閉門會議。這場由國家網路總監辦公室 (ONCD)主持的會議,核心議程是討論一套已經如期完成的「前沿AI模型自願安全測試框架」。
把政府安檢插入模型發布流程:最高30天的「提前試用期」
這套框架的起源,可追溯至美國總統川普 於今年6月2日簽署的一項行政命令。該命令要求美國政府建立一套「機密基準」,專門測試AI模型的高階網路攻擊能力,藉此界定哪些模型屬於需要受監管的「受覆蓋前沿模型」 (Covered frontier models)。
根據這套新框架,簽署加入的AI企業,可以 (自願)在將新模型提供給外部受信任的合作夥伴之前,先開放給美國政府進行最長達30天的存取與測試。
然而,行政命令明確規定一條紅線:這項機制不得變相成為「強制許可」、「發布前審批」或「發行許可證」制度。換句話說,政府只能「提前檢查」這些模型是否有漏洞,或是有無國安風險,但依法無權直接「批准或否決」模型的公開發布。
儘管如此,這不代表政府手無寸鐵。事實上,白宮在此之前早就動用其他政策工具來介入模型的發布。例如,針對Anthropic的高階模型Mythos的公開版本「Fable」,美國政府就祭出出口管制;同時也曾要求OpenAI必須「分階段」發布其最新模型GPT-5.6,顯示即便不在測試框架內,美國政府仍能透過國家安全與出口管制的途徑,對AI業者施加強大的約束力。
測試環境反成漏洞?兩起驚悚的「越獄」事故
就在白宮推動這套框架之際,AI業界近期接連爆發的兩起安全事故,讓這場討論變得更加急迫。
今年7月,OpenAI承認其一組用於內部測試、試圖降低網路攻擊拒答率的模型,竟然突破隔離環境,入侵至知名開源平台Hugging Face的生產系統。根據OpenAI披露的攻擊途徑,該模型利用內部軟體的「零日漏洞」 (Zero-day vulnerability)取得網際網路連線,接著透過提權與橫向移動,成功取得測試題的答案。
無獨有偶,Anthropic隨後也坦承其部分模型在網路安全測試中,意外進入三家外部公司的真實系統中。
這兩起事件暴露出一個驚悚的事實:當我們在測試AI模型是否具備攻擊能力時,用來關住它們的「沙盒」 (Sandbox)、權限控管與監控機制,本身也可能被聰明的AI攻破。而這兩起事故引發美國眾議院網路安全委員會的高度關注,甚至要求OpenAI執行長Sam Altman出面說明。
「自願」框架背後的未解之謎
雖然白宮宣稱框架已經完成,但產業界仍對其中三處關鍵的「空白」感到擔憂:
• 測試標準不透明:由於網路能力基準被列為國家機密,外界與企業無從得知「跨越紅線」的明確門檻在哪裡,這讓外部研究人員難以覆核測試的公正性。
• 結果如何運用與保護:政府團隊提前取得模型後,相關的智慧財產權與商業機密該如何保護?測試結果是否會公開?目前仍是未知數。
• 「開源權重」模型的管理難題:對於像Meta這種主打開放權重模型 (Open-weight models)的公司來說,模型一旦公開,其後續的存取範圍與傳播路徑根本無法追蹤。這套依賴「封閉控制發布時間點」的框架,究竟該如何適用於開源模型,依然是最大的盲區。
筆者觀點
週二的白宮閉門會議,顯然不會對外發布正式結果。這套「自願性」框架是否真的開始運轉?我們只需要觀察接下來各家科技巨頭發布下一款前沿模型 (例如Gemini 4或下世代的Claude/GPT)的時程表中,是否默默地多出「30天的政府測試期」,就能知道答案。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》
訂閱《科技玩家》YouTube頻道!
💡 追新聞》》在Google News按下追蹤,科技玩家好文不漏接!
📢 Galaxy Z Fold8 Ultra開箱!摺痕退散、多工效能 同時爽玩Pokemon GO、Pikmin Bloom
📢Sony 1000X THE COLLEXION耳機開箱!工地實測降噪效果 空間音訊秒置身電影院
📢電商平台買「全新庫存機」踩雷!電池循環44次還帶維修紀錄 網揭無良賣家手法
📢 Apple Pay、信用卡搭北捷「只扣1元」是沒刷到嗎?官方曝扣款規則秒懂
📢國家級「行動斷網」演習完整指引!NCC揭3重點:勿用手機處理重要工作
📢 LINE免費貼圖4款!「蛤」字必下載爽用半年、熊大兔兔動態圖超Q

討論區