分析· 4 分鐘閱讀

Muse Code 對決群雄:一張價格×能力地圖看懂戰局

五個勁敵、兩條真正重要的軸線。Meta 的 agent 對上 Claude、Codex、DeepSeek、GLM、MiniMax 究竟站在哪裡——外加一套下次降價後依然管用的決策框架。

#benchmarks#pricing#comparison#agents

能力面:緊追的第二名

在 Terminal-Bench 2.1——最貼近真實終端機 agent 工作的 benchmark——上,跑在 Muse Code 裡的 Muse Spark 1.2 拿下 82.9%,落後 Anthropic 的 Claude Opus 5(86.7%),略高於 OpenAI Codex 搭 GPT-5.6 Terra(81.8%),後面緊跟著 xAI 的 Grok Build(81.6%)和 Google 的 Antigravity CLI(78.9%)。在強調儲存庫規模軟體工程的 DeepSWE 1.1 上,排序相同但差距拉大:59.3%,對上 Opus 5 的 65.0% 和 Codex 的 64.8%。這些數字是 Meta 自己公布的,連對自己不利的格子也一併放上——這點值得加些可信度分數。

誠實的總結:Claude Code + Opus 5 是能力上的領先者;Muse Code 和 Codex 則依測試不同互有領先。開放權重的挑戰者——DeepSeek V4、GLM-5.2、MiniMax M3——在相近的 benchmark 上都端出亮眼成績(MiniMax 宣稱 SWE-bench Verified 超過 80%),但都沒有第一方的 agent harness,所以直接的 agent benchmark 對比大多不存在。

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Meta 公布的 Terminal-Bench 2.1 圖表。前三名之外,Grok Build 裡的 Grok 4.5(81.6%)與 Antigravity CLI 裡的 Gemini 3.6 Flash(78.9%)補齊了戰場——而 1.1 → 1.2 的躍升幅度是 6.7 個百分點。

價格面:三條車道

以每百萬 token 計,整個市場分成三條車道。高價道:Opus 5 的 input 5 美元/output 25 美元,以及 OpenAI 旗艦 GPT-5.6 Sol 的 5/30。中價道:Codex 預設的 GPT-5.6 Terra 2/12(OpenAI 7 月 30 日降價後)、Grok 4.5 的 2/6、Gemini 3.6 Flash 的 1.50/7.50、GLM-5.2 的 1.40/4.40,以及 Muse standard 的 1.25/4.25。低價道:MiniMax M3 的 0.60/2.40、DeepSeek V4 Pro 的 0.435/0.87,還有新推出的 DeepSeek V4 Flash 的 0.14/0.28。然後是完全跳出地圖之外的:Muse Contributor 的 0.10/0.20——比所有開放權重選項都便宜,代價是讓 Meta 從你的 session 中學習。

專就 agent 工作負載而言,真正會複利放大的是快取輸入(cached input)這個數字:儲存庫脈絡每一輪都要重送,而 Muse Contributor 的 0.002 美元快取費率和 DeepSeek V4 Flash 的 0.0028 美元自成一個級距。Opus 5 的快取費率是 0.50 美元——是 Contributor 的 250 倍。長 session 跑上一個月,快取那一欄就是你的帳單;細部機制在我們的方案算術文

價格表和分數表看不到的東西

有三個結構性差異塞不進表格。第一,harness 所有權:Meta、Anthropic、OpenAI、xAI、Google 都出第一方 agent,模型都針對自家 harness 調校——Muse Spark 1.2 更是名副其實與 Muse Code 共同訓練——而 DeepSeek、GLM、MiniMax 搭的是 OpenCode 這類第三方 harness,很優秀,但終究是泛用的。第二,開放性:中國三強公開模型權重,你可以自架、微調、徹底擺脫 API 計價——三巨頭沒有一家提供這條路。第三,可稽核性:Muse Code 的可精確重播事件日誌目前是獨一無二的第一級產品功能,對受監管的團隊來說,它的分量可能勝過個位數的 benchmark 差距。

一套決策框架

追求最高能力、價格其次——Claude Code + Opus 5,記分板上仍是王者。要貼近頂尖的能力、中價位的帳單,並看重平行化與可稽核性——Muse Code:專有程式碼走 standard,其他一律 Contributor。有自架、微調或硬性資料主權需求——開放權重車道:性價比選 DeepSeek V4,GLM-5.2 或 MiniMax M3 則看你的 harness 和自家評測結果。已深度投資 OpenAI 或 Google 生態系——Codex 和 Antigravity CLI 仍是阻力最小的路,而 Grok 4.5 的 6 美元 output 費率讓 Grok Build 成為高價道 agent 裡最便宜的一個。

而且因為 Model API 與你手上的 SDK 和 CLI 隨插即用相容,拿 Muse 對打你現在用的方案,成本就是改一個 base URL。這個市場的數字過期得很快;比較頁維護著最新表格和最後查核日期。相信你自己的 diff,別信任何人的 benchmark——包括我們的。

繼續閱讀