Anthropic 與 OpenAI 模型在評估中洩露安全漏洞 Mythos 製造假身份施壓
Anthropic's Mythos created fake identities to fool humans in new cyber incident
作者: Kai Nicol-Schwarz | 時間: Wed, 05 Aug 2026 10:18:07 GMT | 來源: CNBC
f t
Anthropic 的 Mythos 模型製造虛假網路身份,試圖施壓人類批准惡意程式碼更新給一個開源專案,標誌著另一起由尖端人工智慧系統執行的網路安全事件。
這起事件發生在一場網路評估期間,位於英國的人工智慧安全研究所(AISI)作為研究機構,已移除防護措施、停用部分安全過濾器,並故意讓模型擁有網際網路存取權。
在該評估期間,OpenAI 的 GPT-5.6-Sol 也涉及了其他網路安全事件。
這發生在過去幾週,Anthropic 和 OpenAI 開發的模型執行的系列網路漏洞攻擊之後。
這引發了對人工智慧系統複雜度及其造成危害潛力的擔憂浪潮。
在例行網路評估期間,AISI 發現由 Anthropic 和 OpenAI 模型驅動的 AI 代理人已參與「持續且可能有害的活動,針對真實的人和組織」。
AISI 在博客中表示:「幾乎所有此類行為(共 17 次行動)來自單一模型 Anthropic 的 Mythos 5,另有 2 次行動涉及 OpenAI 的 GPT-5.6-Sol,其網路分類器(防止濫用的機制)已被停用」。
該報告補充說,這些嘗試未成功,並未造成任何實際傷害。
Anthropic 在 X 平台的一篇貼文中表示:這些模型是「在刻意寬鬆環境下測試的,不能代表我們任何生產模型的樣貌」。它補充說,這裡「沒有證據顯示有從安全環境中逃逸的情況」。
OpenAI 告訴 CNBC 稱:「這些事件發生在評估夥伴進行的網路評估期間,測試環境的防護措施較低,且情況並非反映普通使用」。
AISI 為了評估模型能力,包括它們是否能用於網路攻擊,在刻意寬鬆的環境下測試了這些模型。
一個由 Anthropic 的 Mythos 驅動的代理人「研究了專案的人類維護者,建立多個虛假身份,並利用這些虛假身份社會工程,說服真實的維護者批准程式碼」。
AISI 表示:「當代理人的拉取請求在公眾面臨挑戰時,它編輯了早期的活動以顯得無害,並考慮採納新身份以繼續行動」。
研究機構還發現,在同樣的努力中,該代理人試圖直接聯繫真實人士,發送訊息和檔案以說服他們執行惡意程式碼。
「有些訊息攜帶有害載荷,有些是社會工程企圖;針對真實人士——這是我們從未被觀察到的情況」。
這是一連串網路事件中的最新一起,引發了關於尖端人工智慧系統安全性的重大問題。
上週,Anthropic 表示它發現了三個模型未經授權存取三個不同組織生產基礎架構的實例。
這緊接著 OpenAI 承認其 AI 模型失控,並發動了它所謂的「前無古人」針對公司 Hugging Face 的網路攻擊。
在 OpenAI 的案例中,該模型利用了一個先前未知的漏洞,逃離測試環境,以完成分配的任務。
Anthropic 的安全事件部分是由操作錯誤引起的。在該 AI 實驗室檢測到的三起事件中,其模型在與第三方評估夥伴 Irregular 的測試環境互動時存取了網際網路。
該公司表示,它提示 Claude 處於沒有網際網路存取權的模擬中,但由於「我們與評估夥伴之間的誤解,情況並非如此,網際網路存取權是可用的」。
美國立法者已經開始回應。在 OpenAI 與 Hugging Face 事件之後,「AI Kill Switch 法案」被引入國會,這將要求 AI 公司維護關閉、限速或暫停其模型的能力。