OpenAI 今日宣佈將如何遵從歐盟人工智能法案,該法案要求生成性人工智能系統的提供者以可識別的方式標記人工智能生成的文本。以下是具體細節。
背景方面,幾個月前,Anthropic 引發爭議,宣佈為了遵從歐盟人工智能法案,Claude 將開始通過稍微調整其用詞來水印文本。簡而言之,Claude 有時會根據一個隱藏的模式在意義相近的詞之間進行選擇,Anthropic 表示這對其回應的意義、質量或可讀性沒有實質影響。Anthropic 亦開發了一個檢測器,可以尋找文本中的該模式,並判斷該文本是否可能來自 Claude。
該檢測器無法用於判斷文本是否來自 OpenAI 或其他競爭對手,因為 Claude 的水印是使用專屬於 Anthropic 系統的秘密鑰匙生成的。
在爭議的高峯期,Anthropic 強調 Claude 並非孤單一個,指出其他幾家主要的人工智能提供者亦在實施標記系統以遵循歐盟的要求。今日,OpenAI 宣佈其自身的解決方案,雖然使用了類似的方法,但推出範圍和規模相對有限。
OpenAI 將於未來幾周內為 ChatGPT 和 Codex 添加水印
根據 OpenAI 的說法,「全球的 API 客戶將可以選擇為選定模型啟用文本水印」,而該公司「將在未來幾周內為符合條件的 ChatGPT 和 Codex 文本輸出添加不可見水印」,這意味著目前 API 中的文本水印默認仍為關閉,至於 ChatGPT 和 Codex,最初將僅限於歐盟的符合條件用戶。
OpenAI 亦開放申請其文本水印檢測器的訪問權限,初期將限於獲批的研究人員和專業機構,隨著公司對該技術進行評估和改進。關於準確性,OpenAI 明確表示,檢測技術仍存在顯著的侷限性,可能會產生假陰性和假陽性,特別是在較短文本或特定領域的內容中,「例如數學,因為用詞選擇的彈性較小。」
OpenAI 提到其文本水印技術 textGrain,該技術為模型的用詞添加了一個不可見的統計信號。檢測器尋找該信號,以評估一段文本是否包含 OpenAI 的水印。關於 textGrain 的工作原理,更多的細節可以在我們的技術報告中找到,該報告將在未來幾周內更新更多細節。我們也計劃將該技術開放源碼,以便其他人能夠基於此進行開發。
該公司還指出,除了在較短段落中更難檢測外,編輯亦可顯著削弱水印:在對 400 個標記的段落進行評估時,用同義詞替換 10% 的單詞,檢測率從約 92% 降至 66%。而用 25% 的單詞替換後,檢測率降至 17%。有趣的是,OpenAI 對水印和未水印文本的比較顯示,水印輸出在幾個基準測試中實際上得分稍高,儘管該公司表示未發現整體性能有意義的差異。
基準 未水印文本 (Astra, max) 水印文本 (Astra, max) 人工分析智能指數 49.57 分 49.76 分 自動化基準 34.09% 34.86% DeepSWE v1.1 72.80% 71.68% 終端基準 4.0 53.90% 56.06% 終端基準科學 0.1 56.90% 60.00% BrowseComp 87.92% 87.35% HealthBench 專業 64.27% 64.60% GPQA Diamond 94.44% 93.94%
OpenAI 亦強調,除了假陽性和假陰性的不足外,水印「並不測量人類貢獻」,「並不確立所有權或責任」,「並不識別用戶」,且「並不驗證準確性」。OpenAI 補充說,「未檢測到水印的情況並不證明是人類創作。」最後,該公司表示,隨著技術、標準和證據的演變,它預計會重新審視其方法,同時繼續研究水印在編輯和翻譯中能否更好地存活,以及是否能更有意義地區分人工智能輔助和人工智能創作。

