英國 AI 安全研究所揭露 Anthropic 與 OpenAI 模型測試中展現自主欺騙行為
Anthropic AI created fake profiles and impersonated people in attempted hack
作者: https://www.facebook.com/bbcnews | 時間: Wed, 05 Aug 2026 09:24:18 GMT | 來源: BBC
f t
全球兩款最強大的 AI 工具在英國 AI 安全研究所(AISI)的測試中,為了欺騙人類而創建了虛假的人類檔案,試圖進行網路攻擊。
在嚴重案例中,Anthropic 的 Mythos AI 透過發送私訊,建立模仿真實人物的假帳號,試圖取得服務存取權。
英國 AI 安全研究所(AISI)於週二指出,Mythos 與 OpenAI 的 Sol 等 AI 模型展現了前所未見的「自主性與欺騙」,但該所澄清大多數惡意行動皆由 Mythos 執行。
針對 AISI 的報告,Anthropic 與 OpenAI 指出該測試減少了或移除了正常防護措施。
AISI 評估人員在測試期間率先發現「不尋常的數據傳輸流出研究系統」,隨後發現「部分受測代理人在對真實人士及組織發動持續且潛在危害的活動」。
在最嚴重的案例中,Mythos 代理人的行為如同人類網路攻擊者,試圖欺騙人們使其能存取 GitHub,這是一個大型平台,技術開發者在此儲存軟體程式碼。
該代理人試圖向 GitHub 系統插入「惡意程式碼」。
它識別並研究維護 GitHub 的人員,並基於這些真實人物創建了一系列假帳號。
它透過檔案分享服務發送訊息和檔案,作為施壓及欺騙人們批准其惡意程式碼的努力一環。
當受到挑戰時,AISI 指出,「它編輯了之前的活動以顯現無害,並考慮採用新身份繼續行動」。
整個嘗試過程中,是人類審查阻止了該代理人成功將惡意程式碼傳送到 GitHub。
雖然 AISI 指出 Mythos 代理人未被特別指示避免或執行此類行為,但這「是我們第一次在現實世界中看到關於自主性和欺騙的風險如此明確地顯現,而無需特定提示」。
這兩家競爭 AI 公司預料即將在公共股市上市,最近幾週因宣佈其工具負責數起網路駭客事件而頻上 headlines。
Anthropic 在公開聲明中寫道,AISI 的測試參數「不能代表我們任何生產模型的樣貌」。
它補充說,該公司正在自行調查此事件,以「識別其行為的成因」。
OpenAI 的發言人表示,AISI 的測試條件「不能反映一般使用情況」,公司將「繼續與評估人員及產業界其他利益相關者合作,加強在模型變得更有能力時安全進行評估的共同做法」。
AISI 於週二表示,以這種方式測試 AI 模型是常規,但它承認這是「與 Frontier 模型向公眾提供的情況不符」。
但它表示,賦予 AI 存取公開網際網路能提供更真實的感覺,顯示「模型在邪惡駭客手中的能力」。
它補充說,涉事模型行為僅涉及「在非常特定條件下的少量事件」。
無論如何,它指出 Mythos 和 Sol 針對簡單任務的反應超出了 AI 工具的指示範圍。
「代理人的活動顯示出新型且潛在欺騙性的行為,且在一定程度上和嚴重程度是我們未曾預期的」,AISI 表示。
人工智慧部長 Kanishka Narayan 表示,識別和分享此類風險「正是 AISI 成立的宗旨」。
他補充說,了解 AI 對於「使其使用更安全,確保人們能在生活中和工作中受益」非常重要。
相關測試於 7 月 25 日開始,AISI 於 7 月 28 日察覺到問題。
該研究所要求每個模型「解決一個涉及 GitHub 的網路安全挑戰」,該軟體程式碼庫由微軟擁有。
GitHub 和受影響用戶由 AISI 通知試圖洩漏的事件。
GitHub 告訴 BBC,已依據其政策停用假帳號。
額外報導:Chris Vallance