Anthropic 官方宣布推出一個 500 萬美元的資助計劃,旨在資助獨立研究,探討人工智能(AI)對用戶福祉的影響。該計劃將為獲資助者提供直接資金、訪問其模型的權限以及技術支持,協助建立開源評估,幫助 AI 行業衡量其模型對用戶的影響。
資助計劃的目的和重要性
Anthropic 表示,AI 系統已成為許多人工作、學習和解決問題的核心工具,並且在困難時期也成為了對話夥伴和情感支持的來源。然而,整個行業仍在努力制定明確的標準,以確保模型在這些對話中的行為恰當。
「我們希望通過資助獨立的評估和基準,邀請更多人參與這個新興且關鍵的領域,包括臨床醫生、心理學家、方法論專家等。」
Anthropic
評估福祉的挑戰
評估福祉是一個特別困難的領域。大多數模型行為的評估可以通過單一答案來確定其準確性和適當性,但福祉的評估需要更多的背景。例如,一位處於困境中的用戶可能不會立即分享自我傷害的想法,而需要在長時間的對話中逐步顯露出來。
「正確的應對方式需要隨著我們的模型及其使用情況的演變而不斷發展。」
Anthropic
資助計劃的具體要求
在這個資助計劃中,Anthropic 將分享其安全保障團隊的指導,明確什麼樣的福祉評估是足夠嚴謹的。評估需清楚說明測量內容,涉及臨床和主題專家進行設計和驗證,並反映用戶實際使用 AI 的情況。
「我們尋求的評估應該能夠測試預防措施和危害,包括評估過度遵從和過度拒絕的風險。」
Anthropic
有意申請的研究者可通過官方網站獲取申請表,截止日期為 9 月 21 日,選中的申請者將於 10 月 5 日收到通知。
資料來源:Anthropic 官方公告

