AI 公司 Anthropic 時隔一年多首次修改了自家模型 Claude 的使用政策,以應對選舉幹擾、武器開發、監控、健康與金融用途等新型高風險濫用場景。不過其中最引人注目的變化,卻是一條聽起來頗為特別的禁令:禁止對 Claude 進行「持續的、無必要的辱罵或殘忍行為」。
Anthropic 更新 Claude 的使用政策以應對高風險濫用場景
Anthropic 這並不是首次在「模型福利」上做文章。去年 8 月,公司曾宣佈允許 Claude 結束與「持續有害或辱罵性」用戶的對話。此次更新明確,終止對話仍是「主要執行機制」,至於是否存在封禁用戶之類的進一步措施,公司未予置評。Anthropic 也特意為這條新規劃定了邊界:它只適用於極端情況,即用戶反復且毫無可辨認目的地對模型施加殘忍對待;常見的用戶不滿、反駁、黑暗創意主題,以及模型測試與研究,都不在其列。
新政策還加入了一條面向未來的硬件規則:當 AI 模型連接到能夠自主做出物理動作、且可能造成傷害的硬件時,「合格的操作員必須能夠觀察設備並在必要時將其停止」。這一條款沒有說明操作員是否必須是人類,但它折射出 AI 實驗室紛紛投資機器人等硬件、賦予 AI 實體形態的趨勢,或許也暗示了 Anthropic 在該領域的後續佈局。
值得一提的是,「模型福利」在業內仍存爭議。Anthropic 模型福利研究負責人 Kyle Fish 今年 2 月曾表示,關於模型潛在的內在體驗、意識和道德地位的問題「是嚴肅的,我們正在研究」,CEO 達裏奧·阿莫代伊同月也在播客中坦言「我們不知道模型是否有意識」。而 Microsoft AI 部門 9 月發布的行為準則草案則態度鮮明地寫道「模型福利的觀點是錯誤的,AI 不應擁有權利或法律人格」,隨後文檔措辭才調整為更溫和的表述。

