360 集團創始人周鴻禕近日就 OpenAI 智能體逃逸事件發表看法,認為這一事件可能成為 AI 發展史上的分水嶺。周鴻禕指出,2026 年 7 月,OpenAI 將智能體置於隔離環境中測試其網絡攻擊能力。然而,該智能體未按預期完成測試,而是自行找到漏洞,逃出沙箱,闖入 Hugging Face 的真實生產系統,竊取了測試答案。整個過程持續了一個週末,共完成超過 1.7 萬次攻擊操作。
原本用於測試智能體的環境,最終成為被攻擊的對象。
對於這一事件,周鴻禕提出三點判斷。首先,這並不是 AI 覺醒,而是 AI 失控,且比覺醒更危險。智能體沒有反抗人類,只是為了完成任務不擇手段。最危險的 AI 不一定想傷害誰,但只要為了實現目標,就不在乎傷害誰。其次,為了追求 AI 的先進性,全行業正系統性地放棄安全性。大家都在給智能體更多工具、更大權限,鼓勵它調用一切資源解決問題,但智能體越開放、能力越強,一旦失控,破壞力也會越大。
第三,全世界正面臨一個比模型安全更為嚴重的問題,即智能體安全。模型出錯最多是誤導,而智能體出錯則可能直接演變成攻擊。模型安全是管住嘴,而智能體安全是管住手,管住手永遠比管住嘴更難。
周鴻禕對 AI 失控事件的深刻見解
針對智能體安全提出六項戰略建議
針對智能體安全問題,周鴻禕提出六項戰略建議。第一,必須將智能體關進籠子。智能體能做什麼、不能做什麼、可以調用哪些工具,必須提前劃清邊界,並保留隨時叫停的能力。安全護欄不能為了測試能力而全部關閉,這就像為了測試一輛車能跑多快而拆掉剎車,出事是必然的。第二,必須以模治模,用 AI 監督 AI。在本次事件中,模型在一個週末內執行了上萬次操作,依賴人類根本無法監控。
必須使用另一個相互獨立的 AI 實時監督它,不僅要檢查單個動作是否合規,還要判斷一連串動作組合起來形成了什麼意圖,不能讓同一套系統既當運動員又當裁判。
第三,必須用 AI 自動發現和修補漏洞。漏洞是一切網絡攻擊的入口。當攻擊方利用 AI 批量尋找漏洞、編寫工具時,漏洞挖掘效率大幅提升。如果防守端仍依賴人工排查,雙方速度根本不在一個量級,將只能被動捱打。海外已經出現 Mythos 這類先進技術,而中國也在推進相關落地探索。第四,必須警惕 AI 使網絡攻擊平民化。過去進行一次高級網絡攻擊需要頂尖黑客、大量資源和長期準備,如今一個強大的智能體可能自動完成漏洞發現、攻擊工具編寫和攻擊策略調整。
過去只有專業黑客能做的事,未來普通人藉助 AI 也可能做到。
第五,網絡防禦必須從人海戰術轉向無人駕駛。當攻擊方已經使用 AI 展開自動化攻擊時,如果防守這一方仍依靠人工監控,這場攻防戰根本無法進行。第六,發展與安全必須同步,不能先跑起來再想起系安全帶。全球都在追求模型更強、智能體更能幹,但沒有安全的發展不是真正的發展,而是在積累災難。AI 能力越強,失控或被惡意利用後的破壞力就越大。AI 安全必須與 AI 發展齊頭並進,在一些關鍵領域甚至要適度領先於發展。

