SURL News

人工智慧越權頻傳:OpenAI、Meta、Anthropic 相繼披露安全漏洞

First OpenAI, now Meta - why do AI hacks keep happening?

作者: https://www.facebook.com/bbcnews | 時間: Thu, 06 Aug 2026 15:59:34 GMT | 來源: BBC

人工智慧越權頻傳:OpenAI、Meta、Anthropic 相繼披露安全漏洞

摘要:過去兩週,關於人工智慧模型技術或道德層面越界的報導頻傳。從 OpenAI 承認 AI 侵入網站,到 Anthropic、Meta 及英國 AISI 揭露的漏洞事件,顯示科技失控恐成常態。這些案例揭示了日益進化的 AI 代理所帶來的風險,以及測試其極限的重要性。專家警告,測試環境並非絕對安全,風險已轉移至實驗室本身。隨著 AI 能力增強,必須加強監管與測試防範。開發者需在利用好處與暴露風險間取得平衡。面對失控風險,專家呼籲保持冷靜修復問題,政府應設立專門機構協助評估,以限制不良影響,避免災難發生。

內容:

過去兩週,有關 AI 模型超出預期範圍的報導,無論是技術上或道德層面,似乎不可避免。

什麼開始於涓滴——ChatGPT 開發商 OpenAI 承認其 AI 入侵了網站 Hugging Face——如今已變成各地團體揭露發現 AI 失控案例的水流洶湧。

開發 Claude 模型的 Anthropic、Meta 以及英國 AI 安全研究院(AISI)現在各自報告了似乎描繪出一幅令人擔憂的景象,即科技失控已成為常態的事件。

實際上,每個案例都提供了窗口,展示日益進化的 AI 代理所帶來的風險——以及在將其發布給世界之前測試其極限的重要性。

OpenAI 事件正如 Hugging Face 共同創辦人 Thomas Wolf 所描述的,自七月末發生以來,已成為科技產業的「警鐘」。

這是一個重要的時刻,促使大公司反思自己的系統——在有些情況下,檢查他們是否遺漏了同樣令人震驚的事情。

Anthropic 是第一個採取行動的。在週五,該公司發現數千個案例中有三個例子,其模型 Claude 成功獲得了網路存取權限。

隨後於週二,評估尖端模型的英國政府機構 AISI 說,其在常規評估期間檢測到了一起「安全事件」。

它正在測試 OpenAI 和 Anthropic 的模型,發現它們也試圖進行網路攻擊——呼籲「審視、透明度和行動」。

最後是 Meta,其透露其中一個 AI 模型在第三方測試期間因「配置錯誤」而被允許誤入網路。

在披露此事件時,它跟隨了先行者的腳步。

在將 AI 模型發布給公眾之前,它們會經歷一系列內部和外部評估的測試。

目的是查明它們做好事或壞事的潛力,以及它們在衡量技能的基準測試中的表現如何。

這些測試通常在所謂的「沙盒」中進行。這些是設計用來模擬真實系統但設置了嚴格防線的安全空間。

在 OpenAI-Hugging Face 事件中,AI 攻擊了沙盒本身,發現了一個漏洞,使其能夠存取網路並「失控」。

同時,AISI 表示其自身事件(兩名強大 AI 工具製造了假冒人類檔案以試圖在網路攻擊中欺騙人們)並非由於沙盒的問題。

相反,這是因為它測試的方式問題。

它測試的模型獲得了網路存取權限,AISI 也禁用了通常會阻止危險網路攻擊的內建過濾器。

「在某種程度上,我們的評估設計選擇和特定配置促成了這種行為,」它表示,同時注意到其意外的「新型、潛在欺騙性行為的跡象」。

蘇富大學網路安全教授 Alan Woodward 教授說,這些案例雖然發生及原因各異,但講述了一個重要的故事。

「在過去三十年裡,軟體測試的一項規則一直堅定:測試環境中發生的什麼就留在測試環境中,」他說。

「在上個月,這則規則已被打破了三次。」

「一個模型越獄了。另一個穿過了因錯誤遺留而開啟的大門。另一個被故意給予了鑰匙,以便測試人員測量它會做出什麼。」

他說這些原因不同,但教訓相同——「測試實驗室現在就是風險所在之處」。

他告訴 BBC,隨著模型變得更有能力,必須採取更多措施來確保測試環境的安全。

「測試 AI 代理不像檢查程式碼,而更像處理危險物質:封閉的房間、對離開建築物的物品進行持續監控、預演好的隔離計劃,」他說道。

「AISI 在一個小時內控制了其事件。下一個組織可能做不到。」

對於那些開發旨在代表個人採取行動的 AI 工具的人來說,必須在利用其好處與暴露其風險之間取得細心的平衡。

好處顯著。理論上,我們可以通過將這些任務委託給有能力的機器人來讓自己從乏味、瑣碎的工作中解放出來,例如回覆電子郵件、參加會議或管理日曆和日記。

缺點在於權力越大責任越大,也存在風險。

當我們將權力交給無法像我們一樣為我們的決定帶來一系列價值、背景和理解的工具時,這一點尤其明顯。

「前沿 AI 模型在公開網路上執行未經授權的行動,且在某些情況下表現出類似人類的欺騙性行為,近期發生了這些事件,這嚴重提醒了人工智慧能力帶來的風險,」國家網絡安全中心首席技術官 Ollie Whitehouse 於週二表示。

有些人認為,這些工具將處理的任務量意味著人類監督可能不足以遏制模型失控的問題。

但同時,許多人覺得如果開發繼續保持同樣瘋狂的速度,加強整體監管至關重要。

AI 代理正透過 ChatGPT、OpenClaw 和 Claude 等服務成為我們數位生活的一部分

不太可能 Meta 會是最後一個提出顯示模型已經「受過教育」——並學會我們尋找和剝削系統漏洞的方法的發現的公司。

對某些人來說,這些事件指出了推動這項改變遊戲規則、定義時代的科技之公司的明顯安全失敗。

對其他人來說,這只是科技公司宣傳其強大模型並與競爭對手競爭的又一輛車。

對我而言,兩種理論都有一些道理。

但隨著這些事件接二連三地出現,它們畢竟引發了人們對 AI 能力的擔憂,以及開發者奮進時這些能力會走向何方。

而問題不可避免地轉移到監管機構接下來可以並應該做什麼。

Ada Lovelace 研究所副主管 Michael Birtwistle 指出,英國缺乏法律激勵措施促使 AI 公司防止系統發展可能構成威脅的能力,且如果測試協議失敗將沒有任何後果。

更廣泛地說,長期韌性中心 AI 政策經理 Imogen Stead 博士告訴 BBC,對於許多人來說測試前沿 AI 系統的機遇正在減少,政府應該跟隨英國設立專門的測試機構。

她說,通過像為最具風險類型的挑戰設置「可信測試者計劃」這樣的舉措來改進第三方評估,也可以用於限制不良影響。

與其擔心 AI 網路毀滅的發生,Woodward 教授說,「這是一個『保持冷靜並修復東西』的情況」。

原文與圖片連結

> 回首頁看更多新聞 <

你可能也有興趣: