Anthropic 選定埃森哲為首位嵌入式評估機構,落實 AI 減速提案
SURL News 編輯室
標題:Anthropic 選定埃森哲為首位嵌入式評估機構,落實 AI 減速提案
摘要:Anthropic 宣布選定埃森哲為首位嵌入式評估機構,落實執行長阿莫迪的 AI 減速提案。雙方承諾五年內投入至少 10 億美元,由 Anthropic 直接資助,讓埃森哲員工駐點測試模型安全與價值對齊。此舉是在 Anthropic 籌備 IPO 及業界對 AI 風險爭議激烈的背景下,回應對災難性風險的擔憂。雖然 OpenAI 與 Tesla 支持此方向,但 Nvidia 認為無須新增監管。Anthropic 強調此非獨家合作,並正與 METR 等機構討論,同時重申其對模型安全承擔最終責任。
內文:Anthropic 於週五宣布選定埃森哲(Accenture)作為其首位「嵌入式評估機構」(embedded evaluator)。這是該公司執行長達里奧·阿莫迪(Dario Amodei)提出的人工智慧發展減速提案中,第一個具體落實的步驟。對台灣讀者而言,此舉不僅標誌著全球 AI 安全治理從理論轉向實務操作,更顯示出在缺乏明確政府監管框架下,大型科技企業正試圖透過內部機制與第三方合作來重建公眾信任,這將深刻影響未來 AI 產業的合規標準與技術發展節奏。
背景上,阿莫迪在週六發表了一份三步走計劃,主張應放緩最先進 AI 模型的迭代速度,以應對潛在的災難性風險。此舉在科技界引發強烈反應。OpenAI 執行長薩姆·奧特曼(Sam Altman)與特斯拉執行長伊隆·馬斯克(Elon Musk)對此表示支持,認為業界需要更嚴格的自我約束;然而,Nvidia 執行長黃仁勳(Jensen Huang)則認為無需新增監管,並對相關擔憂持保留態度。值得注意的是,Anthropic 目前正籌備被廣泛認為將創下紀錄的首次公開募股(IPO),在此關鍵節點推出此項安全承諾,被視為穩定投資人信心與回應監管壓力的雙重策略。
根據雙方發布的聲明,Anthropic 與埃森哲同意在未來五年內共同投入至少 10 億美元,用於建立相關評估能力。然而,鑑於當前情況的緊迫性,Anthropic 表示將直接資助埃森哲的工作。長期來看,Anthropic 認為資金應來自集體或政府來源,這符合其六月提出的「先進 AI 框架」倡議,但由於目前缺乏此類機制,公司計畫在不同資金安排下與多家評估機構合作。
在具體執行層面,Anthropic 已同意讓埃森哲旗下專業 AI 業務部門 Faculty 的員工駐點公司。這些嵌入式評估人員將負責測試安全防護措施、對模型進行紅隊攻擊(red-team testing),並評估模型行為是否符合人類價值觀。這對應了阿莫迪提案的第一步,即賦予第三方評估機構員工級別的存取權限,以驗證安全實務並報告事故。Anthropic 強調,此合作並非獨家,公司目前也正與研究非營利組織 METR 及其他第三方進行討論。同時,Anthropic 重申其對模型安全承擔最終責任,引入外部評估不會減免其問責義務。
【解讀】此舉的意義在於將「AI 安全」從抽象的倫理討論轉化為可驗證的內部流程。透過讓外部人員擁有內部員工級別的權限,Anthropic 試圖打破以往「黑箱」開發模式的質疑。然而,由於目前尚無統一的國際監管標準,這種由企業主導、第三方協助的模式能否真正制衡商業利益,仍取決於評估結果的透明度與獨立性。對產業而言,這可能成為未來 AI 公司合規的新範式,但也可能引發關於競爭優勢與技術封鎖的後續爭論。
幾個還沒答案的關鍵問題:
1. 埃森哲嵌入式評估人員具體能存取哪些層級的模型權重或訓練數據?答案來源:待 Anthropic 或埃森哲在未來技術文件或監管聽證中披露。
2. METR 及其他潛在評估機構是否會獲得同等級別的存取權限?答案來源:待 Anthropic 宣布後續合作夥伴名單時確認。
3. 此項 10 億美元投資中,具體有多少比例直接用於評估工具的開發與人員薪資?答案來源:待雙方發布更詳細的財務分配報告。