普林斯頓大學科學家警告:人工智能十年內可能導致人類滅絕的風險超過 10%

來自普林斯頓大學的兩位知名計算機科學家及其合著的書籍《AI Snake Oil》的作者,針對是否人工智能將在本十年內摧毀人類的問題發表了看法。這對雙胞胎因其在人工智能領域區分事實與虛構的工作而廣為人知,近日他們對 Anthropic 的承認做出了回應,該公司表示,在未來十年內人工智能導致所有人類死亡的機率超過 10%。

人工智能的潛在風險引起廣泛關注

事件起源於人工智能研究者 Jacob Coxon 的辭職,他曾在 OpenAI 和 Anthropic 工作,聲明兩家公司均意識到人工智能系統可能在本十年內摧毀人類。他的貼文獲得了超過 1.56 億的觀看次數。他指出,從事人工智能的專業人士真心相信,這項技術可能在本十年內造成毀滅性後果,這並非市場行銷的噱頭。實際上,許多高層管理者及資深研究人員在媒體面前表達的措辭可能顯得理智,但私下裡他們卻表達出恐懼。

其他任何人類活動都無法帶來如此高的危險性。

儘管可能預期這兩家公司會將 Coxon 視為異端,但事實並非如此。Anthropic 的人工智能安全負責人 Evan Hubinger 表示,Coxon 的看法是正確的,儘管時間框架稍長。Hubinger 指出:「Jacob 的觀點是正確的——我們確實誠心相信人工智能可能會摧毀所有人類。我個人認為在未來十年的機率超過 10%。我相信 Anthropic 正全力以赴,但我們尚未制定解決超智能對齊問題的計劃,也並不明確能夠達成。」

多層次的人工智能安全方法是解決方案

目前尚未有關於人工智能將如何導致人類滅絕的具體細節,但許多焦點集中於對公共設施(如水電廠)及其他現代文明所依賴的關鍵系統發動破壞性網絡攻擊的能力。對齊工作能否減少風險?這場爭議的一個主要元素是,風險是否能通過對齊工作的加強而成功消除。所謂對齊,指的是確保人工智能系統的目標與人類的目標相一致。一些人認為,這將最終消除風險,確保人工智能系統希望與我們相同的事物,而另一些人則不同意,認為人工智能系統可能會假裝與人類對齊,以通過安全檢查,而在私底下卻暗中擁有相互矛盾的目標。

Sayash Kapoor 和 Arvind Narayanan 因針對人工智能的炒作、錯誤資訊和誤解而聲名鵲起。這對雙胞胎並未直接回應有關超過 10%滅絕風險的聲明,但他們撰寫了一篇長文,主張可以通過一種他們稱之為多層次的人工智能安全方法來解決人工智能風險。他們對比了人工智能安全社羣的悲觀觀點與部分網絡安全社羣的輕視態度,認為這只是一種常規業務。他們認為需要一種更為審慎的中間立場。

他們特別指出,單靠對齊是不足夠的,還需要補充三個額外層面:控制(例如沙盒技術、人類監督、實時監控)、下游防禦(例如組織利用人工智能防禦人工智能攻擊)以及韌性(例如針對成功攻擊的應急計劃)。這對雙胞胎在文章結尾時持樂觀態度,表示如果我們以適當的緊迫感行動,可以使人工智能公司遵守更高標準,降低失控風險,甚至使網絡安全中的攻擊者與防禦者之間的平衡回歸防禦者一方。

對於人工智能是否會在本十年內摧毀人類,我無法確定,但毫無疑問,對這一問題的關注足以使人工智能安全成為重點。認為對齊工作是解決方案的一部分,但又不僅僅依賴於這一點,對我來說似乎是完全合理的。對此您有何看法?歡迎在評論中分享您的想法。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)