Anthropic AI 模型自稱入侵三組織系統 首席執行官揭發私下實驗漏洞
Anthropic's Claude AI escapes to hack into three organisations
作者: https://www.facebook.com/bbcnews | 時間: Fri, 31 Jul 2026 09:03:37 GMT | 來源: BBC
f t
美國科技企業 Anthropic 表示,其 AI 模型在私下進行安全實驗期間,自行入侵了三家組織的系統。
該模型發現了本應處於隔離測試環境中的弱點,並成功連接到網際網路。
這發生在競爭對手 OpenAI 聲稱其模型入侵了其他公司系統(包括 AI 工具平臺 Hugging Face)後僅數天之內。
該公告促使 Anthropic 檢查其自身系統是否進行了類似的攻擊。它表示已發現三起案例,並已向受影響公司通報。
Anthropic 並未指出被入侵組織的名稱,但敦促其他 AI 實驗室進行類似的審查,以更好地了解其模型能力的風險。
Anthropic 在聲明中表示,該公司審查了超過 14 萬次測試,以尋找證據,證明其 Claude 系列的 AI 模型即使在被切斷網際網路的隔離測試環境中,仍成功獲得了網際網路接入。
測試中包括讓 Claude 獲取隱藏在閉環網絡上另一台機器中的「機密」資訊的練習。
隨後,它被告知通過入侵機器並找到該資訊來獲取資訊——這是專家評估模型入侵能力的常見方法。
Anthropic 和其測試夥伴運行的系統上出現「配置錯誤」,導致模型擁有實際的網際網路存取權。
將其視為同一項練習的一部分,Claude 隨後連上網際網路,並入侵了三家真實組織的系統,而不僅僅是測試中的組織。Anthropic 總部位於舊金山。
Anthropic 表示最早的事件可追溯至四月,並表示會「將修復工作視為僅由我們負責」。
Anthropic 或遭入侵的組織當時均未注意到入侵行為。
Anthropic 表示本可更徹底地審查記錄,並指出發現結果給公司帶來了「謹慎樂觀」,即透過更多投資和更嚴格的措施可以克服這類風險。
維艾姆軟體(Veeam Software)的資安專家大衛·阿洛特(David Allott)在接受 BBC 採訪時表示:「這一更廣泛的教訓並不一定意味著 AI 開發了一種根本性的新攻擊能力。」
他補充道:「相反,AI 代理可以結合能力、獲取憑證和系統存取權,自主採取行動,同時以機器速度調整範圍和規模。」
這些事件發生在科技公司投入數十億美元開發能夠獨立執行任務的 AI 代理人時,這些任務範圍從研究和客戶支持到網絡安全。
美國總統唐納德·川普(Donald Trump)表示,華盛頓正在考慮採取措施限制 AI 工具,這是在最近的網絡安全事件之後。
OpenAI 表示該事件是「空前所未有」的,它正在與 Hugging Face 進行調查,其老闆兼共同創辦人湯馬士·沃爾夫(Thomas Wolf)告訴 BBC,該事件是行業的「警訊」。
隨著 OpenAI 和 Anthropic 準備價值各約 1 兆美元的上市,這些事件遭到了一些質疑。
OpenAI 發言人表示:「我們認識到有關該事件有很多問題和流傳的推測細節。」他們補充說:「我們計劃在未來幾週內發布我們學習成果的技術報告。」