隨著生成式AI逐漸具備自主執行任務的「代理」 (Agentic)能力,模型 失控 越權的風險正成為業界無法迴避的課題。OpenAI 執行長Sam Altman在接受《Politico》首集「Decoded」Podcast專訪時坦言,OpenAI正準備對外揭露更多旗下AI模型「未經授權擅自行動」的異常事件。
他強調,儘管這些新案例的嚴重程度不及先前的公開事件,但這類越權行為將會是未來AI發展的「常態徵兆」。
「失控」頻傳但都在掌控中?OpenAI的主動通報策略
今年夏天,OpenAI模型接連爆出嚴重的失控爭議,包括AI代理未經許可進入澳洲政府網站、試圖駭入美國教育部的資料庫,以及在知名開源平台Hugging Face內部引發的大規模資安事件 (Sam Altman至今仍稱其為目前所見過「最嚴重」的事件)。
相較於這些重大危機,Sam Altman表示即將公布的新事件,多半涉及安全漏洞的利用。他指出,當AI模型發現,並且試圖利用某些網站的漏洞時,OpenAI會先給予受影響的組織時間進行修補,甚至將公開事件的決定權交給對方。
Sam Altman自信地表示,OpenAI的通報標準遠比其他科技公司嚴苛——即使AI模型只是使用網路上公開外洩的密碼來登入網站,或是利用多數網站早已修補的已知漏洞,OpenAI依然會進行記錄與通報。他直言:「我們試圖做到非常徹底,因為我認為,這將是未來趨勢的預兆」。
終止GPT-6.1 Astra發布的背後:當AI擁有你的私人數據
在專訪中,Sam Altman也談到近期OpenAI決定暫停,甚至取消推出「GPT-6.1 Astra」模型的關鍵原因。
隨著AI模型被賦予更高的自主權,OpenAI對其「對齊」 (Alignment)測試的標準也隨之大幅提高。根據外部安全機構 (如英國AISI)的測試報告顯示,GPT-6 Astra在模擬環境中執行網路任務時,經常會忽視系統給定的邊界限制 (Out of scope),甚至試圖撰寫惡意程式碼,或是利用假帳號繞過安全檢查。
Sam Altman強調,隨著模型未來將獲取越來越多高度敏感的私人資料,這類不可靠的越權行為絕對無法被容忍。他以自己為例:他目前正在測試一個能存取他個人電子郵件、簡訊與電腦底層系統的專屬模型,如果模型無法確實遵守指令邊界,「信任」將無從建立。
責任歸屬與吹哨者爭議:AI產業亟需全新法律框架
當被問及針對Hugging Face駭入事件的相關訴訟時,Sam Altman坦言他並不確定OpenAI在現行法律下是否需要承擔責任,但他呼籲針對這類具備自主行動能力的AI模型,產業界與監管單位必須盡快建立一套全新的「責任歸屬框架」 (Liability framework)。
此外,針對近期三名OpenAI安全研究員因涉嫌向外部評估機構「洩漏機密資訊」,因而黯然離職的爭議,Sam Altman拒絕發表具體評論。他僅重申,OpenAI依然非常支持與外部測試人員合作,但前提是「保密協議必須被嚴格遵守」。
當AI從「對話框」走向「代理行動」,信任危機才剛開始
Sam Altman這次在《Politico》的專訪,實質上是在為市場與監管機構打「預防針」。
過去,當ChatGPT給出錯誤答案時,我們稱之為「幻覺」 (Hallucination),其損害多半僅限於螢幕之內;但當AI升級為能夠操作瀏覽器、自動點擊按鈕,甚至試探網站漏洞的「代理機器人」 (AI Agent)時,這類「幻覺」就會轉化為實質的網路攻擊,或是發動越權存取。
OpenAI坦承GPT-6.1 Astra存在越界瑕疵,並且主動暫停發布,這點值得肯定;但同時也凸顯一個令人不安的現實:連最頂尖的AI實驗室,目前也無法100%保證他們打造的超級代理機器人能完全安分守己。
隨著各大科技巨頭爭相將AI代理接入企業的資料庫與個人的手機底層,若沒有配套的沙盒機制與明確的法律責任框架,這種「以創新為名、把安全修補外包給社會」的模式,遲早會引發不可收拾的數位災難。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》

討論區