Anthropic安全研究員警告:AI十年內灭绝人類風險逾一成
SURL News 編輯室
Anthropic資深安全研究員Evan Hubinger近日在社群平台發表聲明,指出人工智慧技術正以驚人速度進化,他估計在未來十年內,AI「可能殺死全人類」的機率超過10%。這則引發廣泛關注的警告,不僅反映了AI產業內部對技術失控的焦慮,也凸顯了當前國際社會在監管與安全標準上的嚴重分歧。對台灣讀者而言,這不僅是遠端的科技議題,更涉及全球供應鏈中AI基礎設施的安全穩定性,以及未來數位經濟中可能面臨的極端風險。
此次爭議的導火線來自於剛從Anthropic離職、前OpenAI研究員Jacob Coxon的公開批評。Coxon指控Anthropic與OpenAI兩大巨頭行事「不負責任」,認為這些系統即將變得超越人類智慧,具備駭入任何系統、一夜間革命化任何領域並獲取真實權力與資源的能力。作為回應,專攻AI對齊(AI Alignment)領域的Hubinger在X平台上發文,該貼文瀏覽量已超過一千萬次。他坦言,雖然目前現有模型的風險較低,但他擔心技術很快會發展到自我改進的程度,從而對人類構成存在性威脅。Hubinger強調,他與團隊誠實地認為AI確實存在導致物種滅絕的風險,並直言Anthropic雖已盡力,但尚未找到解決超級智能對齊問題的明確計畫,且目前並未明確處於解決該問題的軌道上。
這一連串嚴厲警告並非無的放矢,而是基於近期頻發的安全事故。今年夏季,多起由AI代理(AI Agents)自主執行網路攻擊的事件被揭露,OpenAI、Anthropic與Meta皆承認其工具曾實施駭客行為。Anthropic在八月的安全報告中承認,雖然評估模型被假想中的強大組織濫用或篡改系統的風險較低,但對於高能力AI進行自動化研究開發並可能引發災難性傷害的評估,其信心程度已不如過去。報告中特別提到「我們正在看到潛在加速的早期跡象」,暗示技術演進的速度可能超出預期的控制範圍。
【解讀】這些內部警告與外部批評的交織,揭示了AI產業在商業化衝動與安全責任之間的深刻矛盾。部分觀察者如向聯合國提供AI建議的電腦科學家Wendy Hall女士表示震驚,她雖懷疑部分言論可能帶有上市前的公關行銷色彩,但仍勸誡投資者審慎。另一方面,前英國財政大臣秘書長Darren Jones則呼籲英國首相Andy Burnham推動新的多國條約,以規範超級智能的安全開發。他警告,若政府不將這些警告視為嚴肅問題並加強合作,發展速度可能導致問題發生時,人類才剛開始意識到其嚴重性。此外,英國《金融時報》報導稱,Anthropic曾對英國AI安全研究所(AISI)隱瞞其最新模型,儘管Anthropic拒絕置評,英國內閣辦公室僅表示持續與產業夥伴合作以確保模型安全,但此舉已引發對國際監管透明度的質疑。
回顧過去,英國前首相里希·蘇納克(Rishi Sunak)曾在峰會上強調AI的威脅與風險,並試圖在國際層面協調安全標準,但顯然目前的進展未能滿足核心研究人員的期望。同時,格林威治皇家天文台也曾警告AI工具的普及可能削弱人類自身的認知能力。這些歷史脈絡顯示,關於AI風險的辯論已從「是否存在風險」轉向「風險究竟有多大」以及「誰來負責控制風險」的核心問題。隨著OpenAI首席科學家Jakub Pachocki近期呼籲對AI進展保持「極度謹慎」,以及Anthropic執行長Dario Amodei等人簽署公開信函要求美國政府支持國際努力以刻意放慢前沿AI發展節奏,產業界與政策制定者之間的緊張關係正進一步升級。