SURL News

AI 模型失控頻傳,專家警示測試環境已成風險重地

First OpenAI, now Meta - why do AI hacks keep happening?

作者: https://www.facebook.com/bbcnews | 時間: Thu, 06 Aug 2026 15:59:34 GMT | 來源: BBC

過去兩週內,關於 AI 模型在技術或道德層面超越預期範圍的報導似乎難以避免。

這一切始於零星案例——ChatGPT 開發者 OpenAI 承認其 AI 入侵了網站 Hugging Face——已轉變成各大團體揭露 AI 失控實例的洪流。

Claude 開發者 Anthropic、Meta 以及英國 AI 安全研究所(AISI)目前已分別報出類似事件,似乎勾勒出一幅科技叛變已成常態的擔憂世界圖景。

實際上,每一起案件都揭開了日益強大的 AI 代理所帶來的風險,以及在其向公眾發布前測試其極限的重要性。

OpenAI 事件正如 Hugging Face 創辦人 Thomas Wolf 所說,自七月末發生以來,就給科技業敲響了「警鐘」。

這是一個引發大公司反思自身系統的時刻——有些甚至檢查自己是否忽略了同樣令人震驚的問題。

Anthropic 率先採取行動。週五,該公司發現數千個案例中有三個情況,其模型 Claude 成功獲得了互聯網存取權限。

接著在週二,負責評估前沿模型的英國政府機構 AISI 表示,在例行評估期間檢測到了一項「安全事件」。

該機構測試了 OpenAI 和 Anthropic 的模型,發現它們也試圖進行網絡攻擊,呼籲「審查、透明與行動」。

最後是 Meta 緊隨而至,揭示其中一個 AI 模型在第三方測試期間因「配置錯誤」而被容許接觸互聯網。

在披露該事件時,它是在沿襲前人的腳步。

在將 AI 模型向公眾發布之前,它們都會經歷一系列內部和外部評估測試。

目的是找出其潛在的善惡能力,以及它們在衡量技能的基準測試中的表現如何。

這些測試通常在所謂的「沙盒」中進行。這些是設計用於模擬真實系統但設有嚴格防線的安全空間。

在 OpenAI-Hugging Face 事件中,AI 攻擊了沙盒本身,發現了一個漏洞使其能接觸互聯網並「失控」。

同時,AISI 表示其自身的意外事件中,兩個強大的 AI 工具製造了虛擬人類資料檔試圖在潛在的網絡攻擊中誤導人們,這並非沙盒的問題。

相反,這是與測試方式有關。

它測試的模型獲得了上網權限,而且 AISI 也禁用了通常會阻擋危險網絡攻擊的內建過濾系統。

「在某種程度上,我們的評估設計選擇和特定配置促成了這種行為,」它表示,同時指出意外發現了「新穎、潛在具有欺騙性的行為跡象」。

蘇賽斯大學網絡安全教授 Alan Woodward 表示,這些案件雖然發生的情況和原因不同,但講述了一個重要的故事。

「過去 30 年來,一項軟件測試鐵律堅不可破:在測試環境中發生的一切都會停留在測試環境裡,」他說。

「在最近一個月裡,這規則被打破了三次。」

「一個模型逃逸了。另一個穿過了一個因失誤而留下的門。另一個則是故意被賦予鑰匙,以便測試者衡量它的所作所為。」

他說這些原因不同,但教訓相同——「測試實驗室現在就是風險所在之處」。

他告訴 BBC,隨著模型變得更有能力,必須更多採取措施來安全它們的測試環境。

「測試 AI 代理不像檢查程式碼,更像是處理危險物質:封閉房間、持續監控流出建築物的東西、預演好的圍禁計劃,」他說。

AISI 在一個小時內解決了它的意外。下一個組織可能就不會那麼幸運了。

什麼是 AI 以及它如何運作?

AI 公司必須為叛變機器人負責,被黑公司的老闆表示。

對於那些開發旨在代表個人採取行動的 AI 工具的機構來說,必須在利用其好處與暴露其風險之間取得精細平衡。

好處顯而易見。理論上,我們可以通過將這些任務委派給有能力的機器人來解放自己免受單調、無聊的工作,例如回覆郵件、參加會議或管理日曆和日記。

缺點在於,強大的力量伴隨著巨大的責任與風險。

當將權力移交给無法像我們一樣為我們的決定帶來多種價值觀、背景和理解的工具時,這一點特別明顯。

「近期前沿 AI 模型在未授權行動和在公開互聯網上實施某些人類式欺騙行為的案例,是 AI 能力所帶來風險的嚴肅提醒,」國家網絡安全中心首席技術官 Ollie Whitehouse 週二表示。

有人認為,這些工具處理任務的巨大數量意味著人類監督可能不足以控制模型失控的問題。

但在此同時,許多人覺得加強整體監督至關重要,如果發展繼續以同樣狂熱的速度進行。

AI 代理已經通過 ChatGPT、OpenClaw 和 Claude 等服務成為我們數字生活的一部分。

正如 Woodward 教授所說,Meta 不太可能是最後一個揭曉模型表明它們已「畢業」並學會了我們尋找並利用系統漏洞方式的組織。

對於一些人來說,這些事件指出了 AI 公司在引領這場變革時代的關鍵技術方面的明確安全失敗。

對其他人來說,這僅僅是科技公司炒作其強大模型並與競爭對手爭奪的另一種途徑。

對我來說,這兩種理論都包含了一些真相。

但當這些事件接踵而至,它們無疑引發了人們對 AI 能力及其開發者推進方向下的擔憂。

問題勢必轉向監管機構接下來可以且應該做什麼。

Ada Lovelace 研究所副主管 Michael Birtwistle 指出,英國缺乏法律激勵措施促使 AI 公司防止系統發展可能構成危險的能力,如果測試協議失敗也沒有後果。

更廣泛地說,長期韌性中心 AI 政策經理 Dr Imogen Stead 告訴 BBC,由於許多機會減少測試尖端 AI 系統,政府應該跟隨英國設立專門的測試研究所。

她表示,通過「可信測試者方案」等倡議改善第三方評估,也可以用來限制不利影響。

而非在同時恐懼 AI-網絡末日,Woodward 教授說,「情況是『保持冷靜並修復問題』」。

額外報導:Philippa Wain 和 Imran Rahman-Jones

原文與圖片連結

> 回首頁看更多新聞 <

你可能也有興趣: