人工智能是否會在這個十年結束前毀滅人類,這個問題近日備受關注。普林斯頓大學的兩位知名計算機科學家、暢銷書《AI Snake Oil》的作者 Sayash Kapoor 和 Arvind Narayanan 對此發表了看法。兩人長期以來致力於澄清人工智能領域的真偽,此次是在 Anthropic 承認未來十年內人工智能殺死全人類的概率超過 10% 之後作出的回應。
事件的起因是曾在 OpenAI 和 Anthropic 任職的人工智能研究員 Jacob Coxon 辭職,並聲稱這兩家公司都心知肚明,人工智能系統有可能在這個十年結束前殺死全人類。他的貼文獲得了超過 1.56 億次瀏覽。他寫道,構建人工智能的人真心相信它可能在本十年末毀滅人類,這不是營銷噱頭;許多高管和資深研究員在媒體上會措辭謹慎,顯得理性,但私下裡他們同樣表達過恐懼,沒有任何其他人類活動會帶來這種級別的危險。
人工智能的毀滅風險引發廣泛關注
外界本以為這兩家公司會把他當作怪人一笑了之,實際情況恰恰相反。Anthropic 的一位人工智能安全負責人 Evan Hubinger 表示,Coxon 說得對,只是時間跨度稍長一些。他認為,Coxon 這一點是正確的,他們確實真心相信人工智能可能殺死全人類,他個人認為未來十年內概率超過 10%;他相信 Anthropic 在盡力而為,但迄今並未解決超級智能對齊問題的方案,也沒有明確走在解決的道路上。
至於人工智能究竟會以何種方式毀滅人類,目前並沒有太多具體說法,討論主要集中在它對水電等公用基礎設施以及現代文明所依賴的其他關鍵系統發動破壞性網絡攻擊的能力上。爭議的一大焦點在於,能否透過對齊工作來消除風險。對齊一詞指的是確保人工智能系統的目標與人類目標保持一致。有些人認為,這最終能通過讓人工智能系統想要與我們相同的東西來消除風險。另一些人則不同意,認為人工智能系統可能在通過安全檢查時裝作已經對齊,暗中卻懷有自己矛盾的目標。
Kapoor 和 Narayanan 並未直接回應那個超過 10% 的毀滅風險說法,而是撰寫了一篇長文,主張可以通過一種分層的方式來應對人工智能風險。他們將人工智能安全界的悲觀看法,與網絡安全界部分人認為這不過是常態的輕描淡寫態度做了對比,認為需要一種更為平衡的中間立場。他們特別指出,對齊本身並不足夠,還需要另外三層作為補充。
這三層分別是控制,例如沙箱隔離、人類監督和即時監控;下游防禦,例如各類機構利用人工智能來抵禦人工智能攻擊;以及韌性,例如針對攻擊得手後的恢復預案。兩人在文章結尾給出了較為樂觀的判斷:如果以適當的緊迫感採取行動,就能讓人工智能公司承擔更高的標準,降低失控帶來的風險,甚至把網絡安全中攻守雙方的平衡重新扳回到防禦者一方。

