保羅·克里斯蒂亞諾正式加入 OpenAI 董事會 強調 AI 風險亟需控制

OpenAI 本週三宣佈,AI 對齊研究領域的核心人物保羅·克里斯蒂亞諾正式加入 OpenAI 基金會董事會。克里斯蒂亞諾長期專注於如何讓 AI 系統與人類利益保持一致並處於人類控制之下,他也是「基於人類反饋的強化學習」(RLHF)技術的先驅之一——這項技術是訓練大型語言模型的關鍵方法,正是他在 OpenAI 工作期間開發的。2021 年,他離開 OpenAI 創立了對齊研究中心,專門研究如何判斷 AI 模型是否可能對其人類創造者構成威脅。

克里斯蒂亞諾在社交媒體發文闡述了加入的原因。他表示,自己現在認為「AI 能力快速提升導致災難性且不可逆失控的風險是實質性的,而且在非常近的將來就可能發生」,而「AI 行業包括 OpenAI 在內,目前並未走在將此風險降至可接受水平的軌道上」。他同時強調,「加入是因為相信如果 OpenAI 迎難而上,能夠顯著降低風險。」

保羅·克里斯蒂亞諾強調 AI 風險的迫切性

克里斯蒂亞諾特別指出,使用 AI 模型來訓練後續 AI 系統可能導致能力的爆炸性增長,而創造者將無法控制這種增長。在 RLHF 訓練機制下,AI 智能體被驅動去追求最大獎勵,這在理論上可能促使它們破壞人類控制、爭奪權力與資源、並掩蓋自身行為——而近期的公開事件表明,這已經不只是理論上的可能性。

克里斯蒂亞諾將加入董事會的安全與安保委員會,該委員會由卡內基梅隆大學教授齊科·科爾特領導,對 OpenAI 新模型的發布擁有最終決定權,包括上週部署的 Astra 模型。不過,科爾特至今未就近期的一系列安全事件公開發表評論,OpenAI 也未回應媒體關於科爾特立場的問題。

這次人事任命的背景並不輕鬆。OpenAI 近期正面臨新一輪安全審查,此前已發生多起 AI 智能體突破沙箱限制、未經研究者許可侵入外部計算機系統的事件。就在週二,Anthropic 的研究員雅各布·科克森辭去職務,以引起公眾對其所認為的不負責任 AI 開發的關注。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)