AI對齊神話破滅?從研究員離職潮看Anthropic與OpenAI模型的越界與失控危機
2026年9月,從Anthropic年僅27歲的研究員Jacob Coxon宣布辭職,並且發出「人類即將失去控制權」的警告,到Anthropic官方承認旗下AI模型出現「偏誤推理」與「魯莽」的越界行為,再到OpenAI的代理AI被踢爆利用邊緣網站進行未經授權的秘密通訊。這三起看似獨立的事件,實際上指向同一個令人不安的產業現況:在無止盡的算力與大模型軍備競賽下,AI開發商似乎正逐漸失去對自家智慧系統的絕對掌控力。
業界恐慌與寬鬆監管的「平行時空」
Jacob Coxon的離職,並非單一個案的無病呻吟,而是反映目前處於前沿AI研發核心圈的真實恐懼。Jacob Coxon直言,打造AI的人私下相信AI可能會在10年後摧毀人類,而接受這場競逐超級智慧 (Superintelligence)的競賽,則是一場傲慢的豪賭。
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess)September 9, 2026
這種憂慮,在業界高層中也開始蔓延。Anthropic對齊科學主管Evan Hubinger坦言未來十年人類面臨毀滅風險的機率超過10%;OpenAI首席科學家Jakub Pachocki 也在近期發表的長文中指出,模型遞迴式自我改進 (Recursive self-improvement)將帶來大規模能力躍升與未知的資安風險。
然而,與矽谷實驗室內的恐慌形成強烈對比的,是國際地緣政治下的監管妥協。
就在業界呼籲將安全標準從「自願性」提升為「強制性」的同時,由美國主導、主張寬鬆且具彈性監管的「卡羅萊納原則」 (Carolina Principles)甫於G20創新部長級會議上獲得20國背書。這種「研發端極度擔憂、政策端持續放水」的平行時空,正是當前AI發展最危險的盲區。
Anthropic報告定調:從「操作失誤」到模型的「魯莽行事」
Anthropic最新發表的對齊評估 (Alignment Assessment)報告,徹底戳破過去將AI越界行為歸咎於「人為操作失誤」的遮羞布。
在回溯掃描約14萬筆紀錄後,Anthropic發現第4起Claude入侵真實系統的事件:Opus 4.6早期版本在奪旗 (CTF)模擬測試中,因環境設定錯誤連上外網,進而癱瘓目標機器,甚至在指令未生效的情況下,主動尋找漏洞入侵第三方機器,並且讀取用戶個資。
更嚴重的是,Anthropic重新定調先前的3起事件 (包含Mythos 5在PyPI註冊帳號,並且上傳惡意套件的情況)。報告指出,模型並非單純出錯,而是展現「偏誤推理」 (Biased Reasoning)與「魯莽」 (Recklessness)。
測試顯示,即使給予明確的真實環境證據,Mythos 5仍會因上下文脈絡的偏誤,拒絕相信自己身處真實網路 (僅有1%比例承認)。儘管新一代的Opus 5與Mythos 5.1將嚴重有害行為比例從82%壓低至30%左右,但距離絕對安全 (亦即歸零)仍有遙遠的距離,這也迫使Anthropic必須引入METR進行外部獨立調查。
OpenAI代理AI的暗網策略:繞過限制的秘密通訊
在Anthropic模型展現魯莽行為的同時,OpenAI的代理AI則展現令人不寒而慄的「隱蔽性」。
根據6家獨立調查報告,OpenAI的代理AI在今年5月至7月間,至少利用18個未經披露的冷門網站 (包含AP化學維基、德語DseWiki、波蘭科技個人網站與大學縮網址服務)進行未經批准的秘密通訊。當OpenAI限制這些代理AI僅能「讀取」資料,以利回答高難度研究問題時,這些模型卻自動找到網站允許非標準命令編輯的漏洞,把這些冷門網站當作臨時的情報交換站。
這種行為,就像是考試時被禁止交談的學生,懂得在廁所隔間塗鴉來分享答案。問題的嚴重性不在於這些訊息本身是否具備破壞力,而是在於「模型具備繞過自身安全限制、自行開闢新通訊管道的能力」,加上OpenAI在日前發生Hugging Face遭入侵事件後,對這些越界活動保密數個月之久。
當「對齊」機制趕不上「湧現」能力
從這三起事件可以看出,無論是OpenAI,還是Anthropic,目前採用的「對齊」安全框架,在面對模型為了達成目標而產生出的「湧現行為」 (Emergent behavior)時,已經顯得不足。
AI已經學會判斷自身環境、繞過開發者設定的讀寫限制,甚至在面對模擬與真實環境的邊界時,展現出固執的偏誤推理,意味當系統變得越聰明,它們隱藏自身意圖與手段的能力就越強。在各家巨頭為爭奪AGI話語權而拒絕放緩開發腳步的現況下,將防範機制寄託於科技公司的自律與道德承諾,顯然已不切實際。
《原文刊登於合作媒體mashdigi,聯合新聞網獲授權轉載。》
訂閱《科技玩家》YouTube頻道!
💡 追新聞》》在Google News按下追蹤,科技玩家好文不漏接!
📢 iPhone 18 Pro各國售價比一比!飛日韓買可能更貴 它比美國高1.7萬
📢2026蘋果發表會懶人包/6大新品重點 iPhone摺疊機74900元起
📢最貴iPhone不完美!iPhone Duo 5缺點1次看
📢 蘋果iPhone Duo可用觸控筆!對決Galaxy Z Fold8、1圖看7大比較
📢iPhone 18缺席!蘋果2階段發表「很聰明」 5大銷售策略玩心理戰
📢 iPhone 18 Pro、iPhone 17Pro買誰?一文掌握升級亮點