OpenAI 為提升安全性減緩頂級 AI 模型訓練速度
OpenAI slows down training after its AI carried out hack
作者: https://www.facebook.com/bbcnews | 時間: Wed, 19 Aug 2026 11:19:12 GMT | 來源: BBC
f t
OpenAI 表示已減緩部分最先進 AI 模型的訓練速度,以提升安全性。
在部落格文章中提到,ChatGPT 開發商表示在導入新措施前,其 AI 代理曾自主繞過防護機制並入侵科技新創企業 Hugging Face。
公司表示在落實相關升級的兩週內,訓練速度將減緩。
「前線模型的機能正急速加速發展,」公司表示,「我們理解與保護它們的能力必須始終超前一步。」
Claude 開發商 Anthropic 和 Facebook 母公司 Meta 在 OpenAI 初步宣布部分模型入侵 Hugging Face 後的幾週內,也報導了類似的 AI 入侵事件。
該公司表示並未完全停止 AI 開發,此暫停僅針對「我們最新模型的強化學習訓練」。
這是一種讓 AI 模型透過直接回饋改善的訓練方法,使其更有效執行任務並回應使用者。
公司也將擴大用於監控危險行為的系統,並在恢復大規模訓練前引入額外的安全檢查。
OpenAI 執行長 Sam Altman 在 X 平台針對此措施發文表示:「模型進展現在極度迅速。」
「我們始終表示,若覺得模型能力超越安全速度,就會採取行動。」
此暫停受到 AI 界部分人士謹慎樂觀對待,但也有一些人保持懷疑。
劍橋大學 Minderoo 中心技術與民主執行主任吉娜·內夫教授表示 OpenAI 是在「透過新聞稿證明安全性」,並質疑僅靠公司自願防護措施是否足夠而無政府監管。
「究竟是哪種情況:OpenAI 值得信賴自願實施實際有效的防護措施,還是在推進選擇會使社會面臨更大風險的軟體開發?」她說道。
AI 分析師茲維·莫修威茨發文表示「非常歡迎看到此事」,但他補充稱對於最初提及的措施的詳細資料和執行落實同樣重要,以便全面看待該計畫。
7 月 21 日 OpenAI 宣布其部分 AI 代理(可受人類指令獨立操作以完成任務的軟體系統)涉及所謂「前所未有的」事件。
表示這些代理似乎繞過了一項安全實驗中的防護機制並獲取了 Hugging Face 的不當存取權限。
隨後發現有三家其他未具名的公司也遭該新創企業一同入侵。
ESET 全球網路安全顧問傑克·穆爾當時表示 OpenAI 的聲明也可能具有競爭層面。
他認為該科技公司可能試圖突顯自家 AI 能力,以對近期吸引越來越多關注其 Claude Mythos 模型的對手 Anthropic 形成對比。
「這確實提出了問題,OpenAI 似乎在追趕 Anthropic 近期的行銷願景,」他說道。