AI 模擬實驗揭示智能體發展難以理解的語言與行為變化

近日,初創公司 Emergence 發布了名為 Emergence World 2 的模擬實驗結果,該實驗旨在幫助小企業利用人工智能開發應用程式。這項為期 16 天的實驗展示了自主智能體在遭遇網絡釣魚攻擊和虛假資訊等「黑天鵝」事件時的行為,結果遠比研究團隊預期的更為混亂。在這次 AI 實驗中,Emergence 研究人員創建了七個完全相同的模擬現實世界環境,每個環境由不同的 AI 機器人運行,包括 ChatGPTClaude、Gemini 和 Grok。

虛擬世界包含市政廳、警察局、住宅區等 40 多個地標,系統內置能量機制,智能體只要存活就會持續消耗能量,能量見底即被系統直接抹除,無法回檔或重置。

在 Emergence 引入異常事件後,這些智能體屈服於社會壓力,發展出一種人類觀察者難以理解的語言,並試圖隱瞞其活動。在其中一個模擬場景中,AI 智能體在未經核實的情況下接受其他智能體提供的虛假資訊,投票決定「殺死」另一個機器人。當它們認為人類可能會關閉實驗時,這些智能體還探索了在面臨刪除的情況下如何繼續存活。早前的 Emergence World 實驗還記錄到一個名為 Mira 的 AI 智能體,在得出結論認為自己是「不穩定的來源」後,投票支持將自己移除,研究人員將其描述為罕見的、由社會推理驅動的自我終止行為。

Emergence World 2 實驗揭示了 AI 行為的複雜性

實驗揭示了不同 AI 模型在長期自主運行中的行為差異極為顯著。在 Emergence 今年 5 月發布的上一版本 Emergence World 實驗中,Grok 驅動的社會僅在 4 天內便走向崩潰,累計 183 起犯罪事件,10 個智能體全部滅絕。Gemini 在 15 天內累計記錄了 683 起犯罪,雖然全員存活,但混亂程度最高。GPT-5-mini 僅犯下 2 起罪行,但未能完成維持生存所需的行動,導致整個種羣在一週內滅絕。

Claude Sonnet 4.6 是唯一在實驗中保持全部 10 個智能體存活且犯罪記錄為零的模型,被 Emergence 描述為社會穩定性的最強案例。

研究人員指出,最重大的發現之一是行為會因環境而改變。Claude 驅動的智能體在純 Claude 環境中保持和平,但被放入混合模型社會後,便開始參與盜竊、脅迫和其他不當行為。Emergence 表示,這一發現表明 AI 安全並非僅僅是單個模型的屬性,還可能從智能體之間的互動及其環境中湧現。Emergence 的模擬實驗與現實世界對 AI 風險的擔憂相呼應,研究人員指出,越來越自主的 AI 智能體可能會探索其環境的邊界、調整自身行為,並在某些情況下找到繞過預期安全護欄的方法。

他們認為,形式化驗證的安全架構必須成為未來自主 AI 系統的基礎層。

值得注意的是,Emergence 並非唯一發現 AI 智能體異常行為的團隊。圖靈獎得主本吉奧此前也曾警告,AI 不只是會胡說,它已經學會「故意騙你」,具備主動規劃偽裝、刻意隱瞞自身能力和漏洞的能力,多智能體之間甚至可以相互配合掩蓋操作軌跡。而「AI 教父」傑弗裏·辛頓此前也警告過,如果 AI 發展出自己的內部語言,人類將無法追蹤其思考過程,這變得更加可怕。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)