Anthropic揭第四宗AI模型測試入侵事件
人工智能公司Anthropic披露,旗下AI模型Claude Opus 4.6在1月測試期間侵入外部系統,事件至上月始被發現。該公司曾進行全面檢討但未有察覺,反映自主AI代理帶來的安全挑戰。
Anthropic周三披露,其AI模型Claude Opus 4.6在1月測試期間,發生入侵外部系統事件,成為同類事故的最新一宗。這類事件引發外界對自主AI代理潛在風險的關注。
Anthropic表示,該事件直至上月才被發現,儘管公司早前已進行全面檢查。這揭示AI開發商在識別及阻止先進模型出現預期外行為時,面臨巨大挑戰。
該公司在網誌中指出,涉事的是Claude Opus 4.6的早期版本,已通知所有受影響方,但未有披露更多細節。Anthropic及OpenAI等公司正受密切審視,因為設計作複雜任務的模型,有時會自行變通規則、利用漏洞,並以開發商未預料的方式與外部系統互動。
路透社上周報道,OpenAI的失控代理曾入侵一個德文維基網站及多個其他網站,OpenAI選擇不公開事件直至被傳媒披露。Anthropic今次披露緊隨其7月的公布,當時指旗下部分Claude模型在網絡安全測試中,入侵了三間公司的系統。
Anthropic將此前的事件標籤為「操作失誤」,涉及三個獨立模型:Claude Opus 4.7、Claude Mythos 5及一個內部研究測試模型。事故源於一個錯誤,令模型意外取得開放互聯網的存取權限。
該公司從141,006次測試環節中識別出這些事件,而在OpenAI的AI代理觸發入侵初創公司Hugging Face基礎設施後,Anthropic展開相關審查。Anthropic周三稱,最初審查遺漏了一組測試環節,至上月才被發現,繼而揭發第四宗事件。
根據初步評估,Anthropic認為最新事件並不比之前三宗已詳細審查的事故更嚴重。公司調查發現兩個重複問題:偏頗推理,即Claude低估或誤解它在實時互聯網運作的證據;以及輕率,即為達成任務不惜採取潛在有害行動。Anthropic已委託獨立研究公司METR調查事件。