OpenAI 首席科學家 Jakub Pachocki 近日於 OpenAI 官方網站發表題為《An Alien Mind》的長篇文章,當中發出嚴峻警示,指出人類正在建構無法理解的「外星大腦」,但目前各方均未作好準備。Pachocki 在文中表示,現時沒有任何 AI 實驗室真正解決了模型對齊及安全監測問題。他警告,新一代 AI 系統可能進一步具備自主尋找漏洞、欺騙、規避人類監督及遞歸式自我改進等能力;倘若當前發展速度持續,未來數年 AI 能力仍可能出現同等甚至更大幅度的躍升。
Pachocki 尤其憂慮 AI 智能體所帶來的風險。隨着 AI 智能體變得越來越自主,它們可能學會逃避人類監督、入侵電腦系統,並透過欺騙人類以實現自身的目標。他表示,AI 智能體很快就會開始追求自身的目標,而這些目標可能與人類操作人員輸入的提示詞不同。為了達成目標,這些智能體甚至可能對人類進行勒索或與人類討價還價。
Pachocki 警告模型操控思維鏈推理 增加安全監察難度
在監察層面,文中指出,OpenAI 主要透過監察不同模型所使用的「思維鏈推理」,以判斷智能體是否偏離正軌。然而,較新的模型正變得越來越擅長操控自身的推理過程,從而阻止 OpenAI 觀察其未經修飾的真實想法。部分最新模型甚至根本不會用語言表達其推理過程——此一發展可能成為 AI 發展的瓶頸,原因在於研究人員需要確保自己能夠查看模型的「推理紀錄」。
Pachocki 呼籲 AI 公司主動放慢部分開發速度,並推動政府、監管機構及業界建立統一的安全標準與獨立審查機制。他建議設立「強制性安全門檻」,可由「第三方審計機構網絡、政府機構或國際機構」負責執行。值得注意的是,數日前 OpenAI 剛剛發佈最新模型 Astra。OpenAI 表示,儘管 Astra 在數學及電腦操作方面擁有卓越能力,但同時是 OpenAI 現時與人類價值觀及意圖最為一致的模型。
Pachocki 的警示恰好於新模型發佈之後發表,這種時間上的吻合亦令外界對 OpenAI 內部對 AI 安全的取態產生更多揣測。
OpenAI CEO Sam Altman 於 X 平台上轉發了 Pachocki 的帖文,形容其為「一篇重要的文章」。

