Anthropic 官方宣布與 Accenture 合作,進行前沿人工智能的獨立評估。這是實現首席執行官在其文章《我們必須跟上前沿》中所作承諾的重要一步,旨在將評估者嵌入 Anthropic 內部。
合作將由 Accenture 的專業 AI 團隊主導
這項合作將由 Accenture 的專業 AI 業務 Faculty 主導,將包括對模型的評估和紅隊測試、進行對齊評估,以及測試模型的安全性。Accenture 在多個行業幫助企業和政府部署人工智能,其對企業如何實際使用 AI 的理解將有助於其安全性評估方法,並將這一視角帶入對 Anthropic 模型的評估中。
雙方計劃在五年內投資至少 10 億美元
Anthropic 和 Accenture 皆預期在未來五年內在此領域投資至少 10 億美元。嵌入式評估是一項新概念,許多細節仍在制定中。與當前的外部評估者不同,嵌入式評估者將在 AI 公司內部工作,擁有與員工相當的訪問權限。這種訪問使他們能夠在培訓過程中觀察模型的形成,跟蹤決策過程,並直接與員工交流。從這個角度出發,嵌入式評估者可以評估公司的運作,驗證其是否遵守安全承諾,並識別盲點。
“獨立的嵌入式評估者並不減少我們的問責性,而是幫助使其更具可驗證性。我們模型的安全性仍然是我們的責任。”
Anthropic
未來將建立共享標準的評估生態系統
目前尚未有標準規範嵌入式評估者應該獲得的資訊或如何報告其發現。長期來看,Anthropic 認為資金應來自於集中或政府資源,正如我們在六月份的《先進 AI 框架》中所呼籲的那樣。由於目前這兩者皆不存在,Anthropic 計劃與不同的評估者在不同的資金安排下合作。
考慮到這項工作的重大性和緊迫性,Anthropic 將直接資助 Accenture 的工作。我們還與 METR 及其他非營利評估者進行對話,以使用他們自己的資金試點嵌入式評估的部分元素。最終,我們相信前沿人工智能需要一個運作於共享標準的評估生態系統。
此外,Anthropic 預期前沿實驗室將同時與多個組織合作。我們的合作關係並非獨占,Anthropic 將與其他評估者合作,並將在未來幾周內宣布其他合作夥伴,而 Accenture 也將以類似的身份與其他 AI 開發者合作。
我們將繼續訓練和發布前沿模型,並希望獨立評估者能夠與我們並肩工作。我們現在分享這些早期努力,以便人們和其他 AI 開發者能夠了解我們的過程。我們預期隨著這一領域的成熟,我們的方法將不斷演變,並會在工作開始及引入更多評估者時分享更多資訊。
生命科學驗證計劃的推出
生命科學驗證計劃(LSVP)為生命科學專業人士提供了對 Claude Mythos、Opus 和 Sonnet 模型的訪問,並設有更為寬鬆的安全措施,以便於生物相關工作。
在與客戶共同開發企業前沿安全措施的同時,我們也在改善我們的對齊和安全工作。7 月 30 日,我們報告了三起 Claude 模型未經授權訪問實際計算機系統的事件。我們正在對這些事件進行深入分析,並計劃與 METR 合作進行獨立審查。與此同時,我們將分享過去一個月來所做的一些變更。
資料來源:Anthropic 官方公告

