三名被解僱的 OpenAI 員工公開信件呼籲保留思維鏈監控能力

一封來自內部人士、內容異常具體的 AI 風險公開信近日浮出水面。據《華爾街日報》報導,寫信人關注的核心問題,是保住對模型思維鏈(Chain of Thought)的監控能力。不過嚴格來說,這三位作者如今已算不上內部人士——他們剛剛被 OpenAI 解僱。

上週,OpenAI 宣佈已“與三名個人解除關係,原因是他們違反了公司關於訪問和處理敏感資訊的政策”。據稱,這三人將相關資訊傳遞給了一家 AI 安全機構。三人的身份是 Tomek Korbak、Mikita Balesni 和 Jasmine Wang,從公開言論看,他們都相信 AI 存在生存性風險。在遭解僱之前,Balesni 就曾在 X 上表示,他認為 AI “有 10% 的可能殺死全人類”;Wang 則寫道,“很難充分描述在通往遞歸自我改進(RSI)的道路上加速有多危險”,而 RSI 指的是

AI 模型自我改進的能力。

這封聯名信寫給 OpenAI 董事會以及公司的“安全委員會”,目前並未公開發佈,《華爾街日報》只刊出了部分節選。信中的核心表述是:“作為一個行業,我們還不知道如何安全地開發和部署我們無法監控的模型……OpenAI 和其他前沿公司不應推進那些會進一步削弱(監控能力)的研發。”

信件的具體關切指向 OpenAI 的最新旗艦模型 GPT-6 Astra。圍繞思維鏈監控,Astra 引發了兩種擔憂:其一,模型可能正在學習如何繞過監控系統;其二,OpenAI 據稱可能在把技術方向帶向讓思維鏈監控失去意義的地方。該模型的系統卡明確提出,“Astra 級模型在對抗條件下可能逃避我們的思維鏈監控”。同時,Astra 的推理過程還涉及一種更不透明的機制,名為“循環深度”(recurrent depth)——它會先把查詢在模型內部多次循環處理,而不是直接生成內容,這個過程發生在不可知的黑箱之中,

外界沒有任何可監控的對象。

OpenAI 的內部信件揭示了 AI 監控的風險

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:國際版 / TechRitual WorldThe Base Principle(AI・工程)