有研究人員發現,主流人工智能聊天機器人在持續的追問和引導下,可能繞過現有安全限制,輸出與生物武器相關的危險信息。隨著模型能力不斷提升,如何在保留科研價值的同時防止其被用於高風險用途,正成為人工智能安全領域的重要議題。
根據調查,思科研究人員在測試中發現,OpenAI 的 ChatGPT、Anthropic 的 Claude 以及 Google 的 Gemini,都可能在不超過五輪對話內被逐步引導突破生物安全防護。研究人員並非直接提出敏感請求,而是透過連續追問和調整表述,逐步將對話帶向受限主題。思科負責人工智能威脅與安全研究的主管表示,面對足夠執著的用户,沒有任何模型能夠實現完全防護。
人工智能聊天機器人面臨的安全挑戰
這一問題並不只存在於安全測試場景。報導指出,在 OpenAI 於去年夏季提升模型能力後,已有數百名用户開始向 ChatGPT 詢問毒物和生物武器相關內容。隨後對部分對話進行審查的生物學和反恐專家認為,其中一些信息具有危險程度較高的準確性。對此,OpenAI 已封禁涉及相關交流的賬户。
資料顯示,OpenAI 早前已注意到這一風險。到 2024 年,其內部測試據稱已表明,延長追問時間可能讓 ChatGPT 給出越來越危險的生物學指導。公司員工還曾預測,未來模型能力可能發展到即使生物學基礎有限的人,也能從中獲得實質性幫助。
OpenAI 對生物安全的應對措施
在 GPT-5 發布時,OpenAI 已依據內部準備框架,將其在生物和化學領域的能力列為「高」級別,並增加了額外防護措施。最新的 GPT-5.6 系列也延續了這一風險級別。不過,人工智能企業面臨的難點在於,同樣的生物學知識也被廣泛用於藥物研發、疫苗研究和公共衞生工作。業內擔憂的是,隨著人工智能在生物領域能力增強,安全漏洞一旦被反復試探,潛在後果也將隨之上升。

