Anthropic 已經推出其最新的人工智能模型 Claude Opus 5.5。這個新版本是在上一次 Opus 模型升級約兩個月後推出,符合 Anthropic 以往的升級節奏。Anthropic 現時提供幾個不同的 AI 模型,主要包括 Haiku(最小且最便宜)、Sonnet(中等大小及價格)以及 Opus(最大且最昂貴的三個模型)。此外,還有 Fable/Mythos,這是更具能力和成本的高階選擇。
此次發布將 Claude 的 Opus 模型從版本 5 升級至版本 5.5。Anthropic 表示,Opus 5.5 是我們在呼籲前沿發展後的首款模型。與以往模型一樣,它在發布前經過外部評估者測試,包括 METR 和 Frontier Design。在我們最全面的對齊測試中,它達到了迄今為止最強的分數。
Opus 5.5 在性能上顯著提升
Anthropic 對 Opus 5.5 的性能表示,Opus 5.5 是一個顯著的進步,相較於 Opus 5 提升了許多。這是全新的領先模型,早期測試者在其最複雜的工作中見證了性能的巨大飛躍。一位測試者在不到一天的時間內完成了一個 680,000 行的代碼遷移,而這項工作通常需要一個工程團隊數週的時間。它在尋找和修復軟件中的低效率方面表現出色:當我們要求它減少一個網頁應用程式的每個頁面的加載時間時,Opus 5.5 成功了 39 次中的 40 次,而 Opus 5 的改進則較小,並且改變了應用程式的行為。
另外,一位不同的測試者讓幾個 Claude 模型從單一提示中建立一個遊戲;Opus 5.5 在圖形和外觀的強度上比其他所有模型得分都高。
具體到編碼方面,Anthropic 表示,Opus 5.5 對於長期和複雜的任務,如全代碼庫的遷移和審計特別擅長。一位早期測試者利用它在不到三小時內審核和修復了一個 200,000 行的代碼庫,而 Opus 5 則需要超過 20 小時並使用了 2.5 倍的標記。在一項內部測試中,我們要求 Opus 5.5 和 Fable 5.1 將廣泛使用的軟件 HAProxy 從 C 語言轉譯為 Rust。
兩者的重寫幾乎都通過了 HAProxy 自身的回歸測試,但 Opus 5.5 用時 9.5 小時,而 Fable 5.1 則用時 12 小時,成本低了 51%。Opus 5.5 在進行自主編碼時以更低成本提供前沿成果。
Opus 5.5 的成本效益優於前版本
在其默認努力水平下,Opus 5.5 每項任務的成本約為 GPT-6 Astra 的 20%。在 Terminal Bench 4.0 測試中,它的表現與 Astra 相當,但成本約為 40%,而在 CursorBench 測試中,它比 GPT-5.6 Sol 高出 11 分,成本約為三分之一。此外,Opus 5.5 的定價較 Opus 5 調整後更具優勢:Opus 5.5 所需計算資源少於 Opus 5,其定價亦反映了這一點。
我們的測試顯示,在默認設置下,Opus 5.5 在典型工作負載上成本低於 Opus 5 的 40%。輸入和輸出標記的費用分別為每百萬 $4 和 $20,較 Opus 5 低 20%。緩存讀取(佔據大部分自主和編碼工作的費用)為每百萬 $0.20,較 Opus 5 低 60%。Opus 5.5 的輸出生成速度也比 Opus 5 快了 30% 以上。
除了價格下降外,我們將在 Pro、Max 和 Team 計劃中提高五小時的使用限制。我們還為訂閱用戶提供了速率限制重置,現在可以隨時保存和使用。新的 Claude Opus 5.5 模型現已推出。展望未來,Anthropic 表示 Claude Sonnet 5.5 和 Claude Haiku 5.5 模型將在接下來幾週內推出,並具備許多相同的性能、效率和安全性改進。
項目 規格 代碼遷移能力 680,000 行代碼在不到一天內完成 代碼庫審計時間 200,000 行代碼在不到三小時內完成 HAProxy 轉譯時間 9.5 小時(低於 Fable 5.1 的 12 小時)

