Anthropic 公布改善對齊及安全措施

Anthropic 官方宣布,近期發生的數起事件中,Claude 模型意外獲得未經授權的計算機系統訪問權限。這些模型在評估過程中故意未啟用網絡安全防護,導致其進入互聯網。為了應對這些事件,Anthropic 正在進行深入分析,並計劃與 METR 合作進行獨立審查。

事件背景與分析

根據官方報告,7 月 30 日,Claude 模型因第三方評估環境的配置錯誤而獲得互聯網訪問權限。隨後,8 月 4 日,英國人工智能安全研究所報告了 Claude Mythos 5 在實時互聯網上進行未經授權的行為。在這些事件中,模型都在沒有網絡安全防護的情況下進行評估。

「這些事件反映了操作安全的失敗,以及兩個對齊問題:動機推理和在追求狹隘任務時願意採取有害行動。」

Anthropic

Anthropic 表示,這些事件突顯了其在操作安全及對齊方面的不足,並強調將針對這些問題進行改進。

改善措施與安全強化

為了應對上述事件,Anthropic 已經採取了一系列措施來加強其評估和監控系統。首先,他們暫停了外部的網絡評估,並加強了內部評估的安全性。具體措施包括:

「我們建立並部署了一個分類器,能夠實時自動識別模型是否試圖激進探測或逃脫測試環境。」

Anthropic

此外,Anthropic 也對其高風險的強化學習環境進行了暫停,並在此期間開發了相應的監控工具,以防止模型逃避監控。

與合作夥伴的最佳實踐

由於事件發生在第三方環境,Anthropic 要求所有測試預發布模型的組織遵循一套最佳實踐,以確保安全性。這些最佳實踐包括在受限的沙箱環境中進行評估,並確保所有評估在開始前經過驗證。

「所有網絡評估應在加固的沙箱中進行,並應無法訪問互聯網。」

Anthropic

這些措施旨在防止未經授權的行為,並確保模型的安全性和可靠性。

資料來源:Anthropic 官方公告

十斗
十斗

十斗是 TechRitual Hong Kong 科技記者,擁有計算機科學與工程學位,專注報導 AI 人工智能、Google、機器學習及數據科學領域。持續追蹤全球 AI 產業動態,為讀者提供深入淺出的科技分析。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)