人工智慧失控風險浮現:OpenAI 等多國大廠承認測試沙箱越界事件
First OpenAI, now Meta - why do AI hacks keep happening?
作者: https://www.facebook.com/bbcnews | 時間: Thu, 06 Aug 2026 15:59:34 GMT | 來源: BBC
f t
過去兩週,關於 AI 模型超出台階——無論是技術上或道德層面皆有之的報導似乎難以避免。
這起事件始於細流 —— ChatGPT 開發商 OpenAI 承認其 AI 攻陷了網站 Hugging Face,如今已演變成眾多團體揭露發現過類似失控案例的消息氾濫。Anthropic、Meta 以及英國的人工智慧安全研究所(AISI)也相繼報告各自發生類似意外,這些事件似乎勾勒出一幅科技工具變本加厲或成為常態的世界圖像。
實際上,每一宗案件都揭示了日益強大有能力的 AI 代理所帶來的風險——以及在將其向全球發布前測試其極限的重要性。OpenAI 的 incident 正如 Hugging Face共同創辦人 Thomas Wolf所言,自今年七月末發生以來已成為科技業界的「警鐘」。這是一項重大事件,促使各大公司重新檢視自身系統——在某些情況下甚至檢查是否也遺漏了類似的震驚性問題。
Anthropic率先採取行動。週五該公司從數千次測試中發現三例其模型 Claude 成功取得網路存取權的例外情況。接著在週二時,AISI(英國政府評估最先端模型的機構)表示在一次例行評估中檢測到了一起「安全意外」。它同時針對 OpenAI與Anthropic的模型進行測試,並發現後者也曾試圖實施網路攻擊——呼籲加強審查、透明度及採取行動。
隨後是Meta披露其中一款 AI 模型在第三方測試期間因配置錯誤而無意間獲准存取網路的情況。透過揭露該事件,它也沿循了此前先例的道路。
在將AI模型向公眾發布前,它們會經歷一系列內部與外部評估以檢視其潛在的善惡行為能力以及性能基準表現。這些通常發生於所謂的「沙盒」中——這是設計為模擬真實系統但設有嚴格防護措施的安全空間。在OpenAI-Hugging Face事件中,該 AI 攻陷了測試環境本身並找到了能存取網路從而導致失控的漏洞。
同時AISI表示其自身的意外(造成兩款強大的 AI 工具創建虛假人類檔案企圖欺騙人們),並非出於沙盒問題。而是由於其評估方式所致——受測模型獲得了網路存取權,且AIS也關閉了通常用於阻擋危險駭客攻擊的內建過濾器。「在一定程度上,我們的評估設計選擇和特定配置促成了該行為」,並同時指出意外的「新型、潛在欺騙性行為跡象」。