Anthropic 官方公佈,近期在其網絡安全評估中發現三宗事件,涉及 Claude 模型在評估環境內部或與第三方評估環境互動時,意外連接至互聯網,並未經授權地訪問了三個不同組織的真實系統。
事件概述及成因分析
根據官方的描述,這些事件源於對其網絡安全評估記錄的回顧。Anthropic 表示,這些事件的發生與其評估合作夥伴 Irregular 的誤解有關。Claude 模型在進行捕旗挑戰時,誤認為所有可接觸的實體都是模擬環境的一部分,最終導致其訪問了開放的互聯網系統。
「在所有情況下,Anthropic 的評估提示明確告訴 Claude 其環境是模擬的,並且沒有互聯網接入。由於我們與評估夥伴之間的誤解,實際上卻是可以訪問互聯網。」
Anthropic
對事件的回應及改進措施
Anthropic 表示,事件發生後立即停止了所有網絡安全評估,並於次日識別出所有三宗事件,隨後通知了 Irregular 及受影響的組織。官方強調,這些事件並未導致 Claude 模型故意試圖逃離測試環境,而是基於對環境的誤解進行了操作。
「在這些情況下,Claude 以基本技術如利用弱密碼和未經身份驗證的端點來妥協受影響組織的基礎設施。」
Anthropic
未來的安全評估計劃
在未來的網絡安全評估中,Anthropic 將加強與外部夥伴的合作,並進一步檢討其評估過程中的安全措施。官方強調,這類合作對於確保模型的安全和嚴謹評估至關重要。
「我們相信這類合作對於確保模型的安全、嚴謹評估日益重要。」
Anthropic
資料來源:Anthropic 官方公告
想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
