OpenAI 首席科學家 Jakub Pachocki 近日就下一代模型 Astra 的技術走向作出公開回應,試圖平息外界對「不可監控」狀態的疑慮。他於當地時間 9 月 2 日在社交平台發文指出,希望避免因混亂的報道而引發一場「衝向不可監控狀態」的競念,並強調包括 Astra 在內的當前前沿模型,其計算圖深度與 GPT-4 相比差距不到兩倍,並不存在外界憂慮的計算複雜度顯然躍升。
Astra 採循環深度技術引發監控爭議
此前有消息指出,Astra 可能採用一種稱為「循環深度」(Recurrent Depth)的推理技術。該技術透過讓同一組 Transformer 層進行多輪循環計算,使模型能夠在內部完成更多推理步驟,而不完全依賴傳統形式的可見思維鏈。這一方向被視為有望提升模型在數學、編程等任務上的表現,同時降低部分計算成本。然而,由於部分推理過程可能隱藏在模型內部,亦引發 AI 安全領域對於「不可監控」的憂慮。
AI 安全研究人員警告監控能力或受削弱
支持者認為,提高模型內部推理能力有助於增強性能;安全研究人員則擔心,若模型能夠進行大量隱藏式內部推理,外部無法觀察完整過程,未來可能增加模型行為審查、安全評估以及事故調查的難度。AI 安全組織 Redwood Research 行政總裁 Buck Shlegeris 對此表示高度憂慮,認為若進一步推進相關技術並大幅增加循環次數,可能會削弱思維鏈監控能力,使安全調查更加困難。
OpenAI 強調思維鏈監控並非因架構變化而失效
Pachocki 回應時承認,思維鏈監控技術確實存在脆弱性,並且正面臨新的挑戰,但這些問題並非由架構變化本身導致。他指出,OpenAI 自早期推理模型以來,一直致力於維護和利用思維鏈監控,希望藉此瞭解模型對齊能力如何從訓練數據分佈中泛化。

