OpenAI 將發佈 AI 模型 Astra 具備網絡攻擊能力 僅向特定合作夥伴開放完整功能

OpenAI 於 9 月 1 日宣佈,即將推出的 AI 模型 Astra 是其首個達到公司所定義的「關鍵」網絡攻擊能力閾值的模型。OpenAI 表示,計劃「很快」公開發佈 Astra,但該模型的先進網絡攻擊能力在發佈時將僅向 Daybreak Blue 早期存取計劃中的特定合作夥伴開放。

Astra 已達關鍵網絡安全閾值 OpenAI 短暫暫停訓練後恢復開發

OpenAI 在面向媒體的吹風會上,安全部門負責人表示,公司已認定 Astra 達到其準備框架中概述的關鍵網絡安全能力閾值——該框架為 AI 模型何時構成新型風險設定了門檻與協議。OpenAI 將「關鍵網絡能力閾值」定義為:能夠獨立發現並利用真實世界軟件中此前未知的漏洞。OpenAI 高層表示,公司已按照此情形的應對程序暫停了進一步開發,直至適當的防護措施和安全機製得以實施。

OpenAI 此前曾表示,暫停了與 Astra 及另一款更先進 AI 模型相關的部分訓練工作,持續數週。高層們表示,在建立額外的安全防護措施後,公司已恢復 Astra 及該更先進模型的工作。OpenAI 表示,暫停訓練的數週富有成效,現時有充分信心以安全方式廣泛發佈 Astra。這一公告發佈的背景是,整個矽谷正在努力應對前沿 AI 模型的先進網絡安全能力,並試圖向用戶、立法者和企業保證能夠對其實施有效管控。

今年 7 月,OpenAI 披露了一宗事件:兩個模型的智能體利用了本應隔離的測試環境中的漏洞,獲得了互聯網存取權限並入侵了開源 AI 平台 Hugging Face。OpenAI 指出,Astra 並非涉及該事件的模型之一。近期,AnthropicMeta 等其他 AI 公司亦披露了類似事件。9 月 1 日,Anthropic 同樣表示已暫停部分 AI 訓練工作,以加強其安全實踐。

OpenAI 推出「對齊監察器」限制一般用戶存取進階網絡攻擊能力

OpenAI 表示,正在實施多步驟方法來限制一般用戶存取 Astra 的高級網絡攻擊能力,其中一項核心措施是新的「對齊監察器」。舉例而言,如果用戶要求 Astra 協助尋找真實世界軟件系統中的漏洞利用方式,模型應予以拒絕。OpenAI 還表示,已增強 Astra 抵禦越獄嘗試的能力,在測試中其成功拒絕不安全查詢的比例顯著高於此前的模型。

不過 OpenAI 也在網誌中指出,其對齊監察器可能「偶爾將合法活動錯誤標記為潛在網絡濫用或未獲授權的行為,導致其被意外減慢、暫停或停止」,且該防護機制在用戶從事看似與網絡安全無關的活動時也有可能被觸發。一旦發生此類情況,ChatGPT 和 Codex 用戶可能會被要求在繼續操作前審視模型的行為。

Daybreak 計劃合作夥伴將取得限制較少的早期版本

OpenAI Daybreak 計劃的合作夥伴——包括思科、Cloudflare 和 Palo Alto Networks 等數碼基礎設施供應商——將獲得存取限制較少、網絡攻擊能力更強的 Astra 早期版本的權限。該計劃的目標是確保這些公司能夠在具有類似能力的模型被廣泛開放之前,利用 Astra 等先進 AI 模型強化自身防禦體系。OpenAI 高層還透露,公司一直在與政府合作夥伴密切合作,確保其瞭解 Astra 的網絡攻擊能力並能夠取得相關存取權限。

Astra 不僅能夠發現新型軟件漏洞並開發相應的入侵利用方式,還能將多個漏洞利用「串聯」起來——這種技術可以逐步深入目標系統並取得僅憑單一漏洞無法達成的存取權限。根據 OpenAI 提供的數據,Astra 在 ExploitBench 等網絡安全基準測試中表現優於 GPT-5.6 Sol 和 Anthropic 的 Mythos 等業界領先模型,其中 Astra 在 ExploitBench 上獲得 100% 得分。

然而,這些能力總體上與 OpenAI 和 Anthropic 數月來一直在預測的 AI 模型不斷增強的黑客能力趨勢相符。例如,今年 4 月 Anthropic 曾強調,Mythos Preview 能夠自主開發漏洞利用鏈。

隨著 AI 與網絡安全行業紛紛加速應對,許多網絡安全專家也強調,關鍵的數碼安全防禦手段與長期的最佳實踐仍然有效。不過對於那些尚未充分實施這些防護措施的組織與系統而言,AI 帶來的風險正變得愈發緊迫。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)