Anthropic 公布 Claude Opus 5,性能與成本效益顯著提升

Anthropic 官方宣布推出 Claude Opus 5,這是一個具備深思熟慮及主動性的新型模型,價格僅為 Claude Fable 5 的一半,卻接近其前沿智能水平。

Claude Opus 5 的性能表現

根據官方資料,Claude Opus 5 在編碼及知識工作評估方面,如 Frontier-Bench 和 GDPval-AA,已成為新的業界標準,儘管在網絡安全任務上仍落後於 Mythos 5。官方表示,

「Opus 5 在日常使用中設計得更為高效,成為 Claude Max 的新默認模型,以及 Claude Pro 上最強的模型。」

Anthropic

性能與成本效益的提升

Claude Opus 5 在性能上有了顯著提升,並且保持與前作 Opus 4.8 相同的成本。官方指出,

「Opus 5 在 Frontier-Bench v0.1 上超越所有其他模型,並且在每項任務的成本上比 Opus 4.8 的表現提升超過兩倍。」

Anthropic
。此外,在 CursorBench 3.2 的最大努力設定下,Opus 5 的表現接近 Fable 5 的最高分數,但每項任務的成本卻僅為其一半。

強化的驗證能力與安全性

在驗證工作及迭代方面,Claude Opus 5 表現出色。官方提到,

「Opus 5 在多個評估及早期測試中展現了其主動性和徹底性。」

Anthropic
。例如,在 Frontier-Bench 的一項任務中,Opus 5 能夠在沒有直接查看圖紙的情況下,自行編寫計算機視覺管道,成功重建機械部件。

安全性與風險管理

在安全性方面,Opus 5 的設計旨在避免風險及雙重用途的能力。官方強調,

「Opus 5 在生物研究及攻擊性網絡安全方面仍落後於 Mythos 5。」

Anthropic
。儘管如此,Opus 5 在發現網絡安全漏洞的能力上已經有了顯著改進,並且能夠找到漏洞,但在利用這些漏洞方面仍然不及 Mythos 5。

Claude Opus 5 現已在所有平台上提供,價格為每百萬個輸入標記 5 美元(約 39 港元),每百萬個輸出標記 25 美元(約 195 港元)。開發者可通過 Claude API 開始使用。

資料來源:Anthropic 官方公告

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
十斗
十斗

十斗是 TechRitual Hong Kong 科技記者,擁有計算機科學與工程學位,專注報導 AI 人工智能、Google、機器學習及數據科學領域。持續追蹤全球 AI 產業動態,為讀者提供深入淺出的科技分析。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)