【AI算力排行榜】半年前嘅世界冠軍今日排第幾?Claude Opus 5.5 續居榜首

今週兩個榜王:Intelligence 榜 Claude Opus 5.5 (Max, Default Fallback)(57.6分),Coding 榜 Claude Fable 5.1 (Max, Default Fallback)(81.6分)。升跌箭頭見表。

滿分 100 分,但唔好被個數字呃:套題包括 Humanity’s Last Exam 等地獄級基準,57.6 分已經係人類史上最高。

各 lab 最強:現狀+兩把尺

3/6個月前係 baseline;今週+1個月前係現狀,話你知邊個停滯、邊個空降。

Intelligence

Lab今週最強1個月前3個月前6個月前
總冠軍無Claude Fable 5.1 ,53.4GPT-5.5 ,38.4Claude Opus 4.5 ,29.1
Anthropic無Claude Fable 5.1 ,53.4Claude Sonnet 5 ,38.2Claude Opus 4.5 ,29.1
OpenAI無GPT-6 Astra ,52.7GPT-5.5 ,38.4GPT-5.2 Codex ,28.5
Google無Gemini 3.5 Flash ,32.6同左Gemini 2.5 Pro,16.1
xAI無Grok 4.6 ,42.8Grok Build 0.1 0616,27.2Grok 4.20 0309 ,25.2
Qwen無Qwen3.5 27B ,22.9同左同左
智譜無GLM-5.3-Flash,41.8GLM-5 ,27.9同左

Coding

Lab今週最強1個月前3個月前6個月前
總冠軍無Claude Fable 5.1 ,81.6GPT-5.5 ,74.9Qwen3.5 397B A17B ,48.2
Anthropic無Claude Fable 5.1 ,81.6Claude Sonnet 5 ,71.5Claude 3.7 Sonnet ,36.4
OpenAI無GPT-6 Astra ,76.9GPT-5.5 ,74.9o1-preview,34.0
Google無Gemini 3.5 Flash ,70.1同左Gemini 2.5 Pro,33.3
xAI無Grok 4.6 ,74.4Grok Build 0.1 0616,51.5無
Qwen無Qwen3.5 397B A17B ,48.2同左同左
智譜無GLM-5.3-Flash,71.5無同左

過唔到 6 個月前冠軍=落後半年;過到 3 個月前冠軍先叫追上時代。

過線名單:邊啲追上時代?邊啲免費用到?

★=過埋 3 個月強線;✅=該版本免費;◐=同系列免費版;—=冇。免費多數限時,以出文當日為準。

Intelligence——過 6 個月線(29.1分)36 個

模型分數強線OpenRouter免費Opencode免費
Claude Opus 5.5 (Max, Default Fallback)(—)57.6★——
Claude Fable 5.1 (Max, Default Fallback)(—)53.4★——
GPT-6 Astra (Max)(—)52.7★——
GPT-6 Astra (Xhigh)(—)52.4★——
GPT-6.1 Sol (Xhigh)(—)51.0★——
GPT-6.1 Sol (High)(—)50.2★——
Claude Opus 5 (Xhigh)(—)49.7★——
Claude Fable 5.1 (Medium, Default Fallback)(—)48.9★——
Claude Fable 5.1 (Low, Default Fallback)(—)46.8★——
Claude Sonnet 5.5 (High, Default Fallback)(—)46.8★——
MiMo-V2.6-Pro46.3★◐(同系)◐(同系)
Grok 4.7 (High)46.3★——
Step 5 Preview43.7★◐(同系)◐(同系)
Grok 4.6 (Medium)(—)42.8★——
Claude Opus 5.5 (Low, Default Fallback)42.3★——
Grok 4.7 (Low)42.2★——
GLM-5.3-Flash(新)41.8★——(本身US$0.15極平)
Claude Haiku 5.5 (Xhigh)41.2★——(本身US$0.1極平)
Claude Sonnet 5.5 (Medium, Default Fallback)40.8★——
Muse Spark 1.2 (Xhigh)(—)39.6★◐(同系)◐(同系)
Claude Opus 5 (Low)39.4★——
GPT-5.5 (Xhigh)(—)38.4強線本身——
Mistral Large 4 Preview38.4強線本身——
Claude Sonnet 5 (Max)38.2——
MiMo-V2.6-Flash37.9—✅
Claude Haiku 5.5 (High)37.8——(本身US$0.1極平)
GPT-5.6 Luna (Max)37.3——(本身US$0.2極平)
GPT-6 Luna (Xhigh)34.6——(本身US$0.1極平)
GPT-6 Sol (Low)34.2——
GPT-5.6 Sol (Low)33.5——
Gemini 3.5 Flash (High)32.6——
Claude Opus 4.7 (Non-reasoning, High)30.9——
GPT-5.6 Terra (Medium)30.1——
GPT-6 Luna (Medium)29.9——(本身US$0.1極平)
Claude Haiku 5.5 (Low)29.5——(本身US$0.1極平)
MiniMax-M329.2——

Coding——過 6 個月線(48.2分)27 個

模型分數強線OpenRouter免費Opencode免費
Claude Fable 5.1 (Max, Default Fallback)(—)81.6★——
Claude Fable 5.1 (Medium, Default Fallback)(—)77.1★——
Claude Opus 5 (Xhigh)(—)77.0★——
GPT-6 Astra (Max)(—)76.9★——
GPT-6 Astra (Xhigh)(—)75.9★——
Claude Fable 5.1 (Low, Default Fallback)(—)75.2★——
GPT-5.5 (Xhigh)(—)74.9強線本身——
Grok 4.6 (Medium)(—)74.4——
Muse Spark 1.2 (Xhigh)(—)72.2◐(同系)◐(同系)
GLM-5.3-Flash(新)71.5——(本身US$0.15極平)
Claude Sonnet 5 (Max)71.5——
GPT-5.6 Luna (Max)71.4——(本身US$0.2極平)
Gemini 3.5 Flash (High)70.1——
GPT-5.6 Sol (Low)69.7——
Claude Opus 5 (Low)66.9——
GPT-5.6 Terra (Medium)64.7——
Kimi K2.6 (Reasoning)61.8——
Apodex 1.160.8◐(同系)◐(同系)
MiMo-V2.5-Pro (Reasoning)60.2◐(同系)◐(同系)
Nex-N2-Pro (Based on Qwen3.5-397B-A17B)59.1——
MiniMax-M358.6——
Ling-3.0-flash-VL57.0◐(同系)◐(同系)
MiMo-V2.556.8—✅
Solar Pro 452.7——
Inkling (Xhigh)52.1✅—
Grok Build 0.1 061651.5——
Gemini 3.5 Flash-Lite49.3——

性價比:6個月版 vs 3個月版

6個月版入圍>夠用線、過強線×1.5;3個月版入圍>強線、同級比唔加乘。

6個月版

Intelligence(模型/分數/輸入價/每蚊值)Coding(模型/分數/輸入價/每蚊值)
1Claude Haiku 5.5 /41.2/US$0.1/618.0Ling-3.0-flash-VL/57/US$0.075/760.0
2GLM-5.3-Flash/41.8/US$0.15/418.0GLM-5.3-Flash/71.5/US$0.15/476.7
3Claude Haiku 5.5 /37.8/US$0.1/378.0MiMo-V2.5/56.8/US$0.14/405.7

3個月版

Intelligence(模型/分數/輸入價/每蚊值)Coding(模型/分數/輸入價/每蚊值)
1Claude Haiku 5.5 /41.2/US$0.1/412.0Claude Opus 5 /77/US$5/15.4
2GLM-5.3-Flash/41.8/US$0.15/278.7Claude Fable 5.1 /81.6/US$10/8.2
3MiMo-V2.6-Pro/46.3/US$0.435/106.4Claude Fable 5.1 /77.1/US$10/7.7

免費最強+平靚正最強

免費・6個月版(全部過到夠用線)

排名模型分數(榜)OpenRouterOpencode兩邊都有?
1MiMo-V2.556.8(Coding)—✅唔重疊
2Inkling (Xhigh)52.1(Coding)✅—唔重疊
3MiMo-V2.6-Flash37.9(Intelligence)—✅唔重疊

免費・3個月版:從缺。全部過唔到強線,免費追唔上前沿,但贏到半年前嘅世界冠軍,日常用夠。

平靚正

6個月版答案3個月版答案
IntelligenceClaude Haiku 5.5 (Xhigh)(41.2分/US$0.1/618.0)Claude Haiku 5.5 (Xhigh)(41.2分/US$0.1/412.0)
CodingLing-3.0-flash-VL(57分/US$0.075/760.0)Claude Opus 5 (Xhigh)(77分/US$5/15.4)

算力時間軸:而家跑分嘅模型,係咩晶片煉出嚟?

晶片/架構公佈出貨狀態
B200(Blackwell)2024年3月 GTC已成熟大規模商用,各大雲端主力
B300(Blackwell Ultra)2024年底/2025年初定規格出貨爬坡中,DGX B300 已有得買,雲端按小時租到
Vera Rubin(R100+HBM4)2025/2026 GTC 定案2026年中投產,合作伙伴下半年開始交付,未廣泛商用

規律:由開始出貨起計 9–12 個月,先係下一波 AI 算力升級高峰。B300 今年先大規模鋪開,最快年底先見到用佢訓出嚟嘅下一代模型;Rubin 訓出嚟嘅嘢,2027 年先見到。

其餘速報

・最貴:全榜輸入最貴嗰個,又貴又弱就點名唔好用;現役旗艦價 US$10。
・偏科王:Intelligence 從未過線但 Coding 世界級嗰啲,寫 code 專精型。

數據來源:Artificial Analysis Intelligence Index 及 Coding Agent Index,免費公開數據子集;免費模型名單見 OpenRouter 及 Opencode,限時免費隨時完,一切以出文當日為準。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:國際版 / TechRitual WorldThe Base Principle(AI・工程)