比較

Muse Code 對決全場。

與 Claude Opus 5、OpenAI Codex、DeepSeek V4、GLM-5.2、MiniMax M3 的價格與能力比較 —— 資料取自各家官方價目表與公開基準測試,統計至 2026 年 8 月 7 日。

API 定價(每 100 萬 token)

快取輸入才是代理式開發的主要開銷 —— 儲存庫上下文每一輪都要重送。

模型
輸入
快取輸入
輸出
資料政策
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
可能用於改進 Meta 產品
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
絕不用於訓練;可洽業務啟用零留存
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
預設不以 API 資料訓練
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
預設不以 API 資料訓練
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
預設不以 API 資料訓練
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
預設不以 API 資料訓練
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
付費方案不用於訓練
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
開源權重;適用託管 API 條款
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
開源權重;適用託管 API 條款
GLM-5.2 (Z.AI)
$1.40
$4.40
開源權重;適用託管 API 條款
MiniMax M3
$0.60
$2.40
開源權重;適用託管 API 條款

程式代理能力

代理基準測試衡量的是模型在其執行框架內的表現。分數來自 Meta 公開的評測與各家廠商自行公布的結果;空格代表沒有公開分數。

Terminal-Bench 2.1 長條圖:Claude Opus 5 86.7%、Muse Spark 1.2 82.9%、GPT 5.6 Terra 81.8%、Grok 4.5 81.6%、Gemini 3.6 Flash 78.9%、Muse Spark 1.1 76.2%

Terminal-Bench 2.1 全場戰況

Meta 公布的圖表補足了表格說不清的脈絡:Muse Code 上的 Muse Spark 1.2(82.9%)位居第二,僅次於 Claude Code 上的 Claude Opus 5 max(86.7%),領先 Codex 上的 GPT 5.6 Terra max(81.8%)、Grok Build 上的 Grok 4.5 high(81.6%)與 Antigravity CLI 上的 Gemini 3.6 Flash high(78.9%)—— 更比自家前代、mini-swe-agent 上的 Muse Spark 1.1(76.2%)整整高出 6.7 個百分點。

代理 / 模型
TERMINAL-BENCH 2.1
DEEPSWE 1.1
上下文
開源權重
Muse Code + Muse Spark 1.2Meta · 模型與框架共同訓練
82.9%
59.3%
1M
否(API + 代理)
Claude Code + Opus 5Anthropic · 第一方代理
86.7%
65.0%
1M
否(API + 代理)
Codex + GPT-5.6 Terra (max)OpenAI · 第一方代理
81.8%
64.8%
1M
否(API + 代理)
Grok Build + Grok 4.5 (high)xAI · 第一方代理
81.6%
500K
否(API + 代理)
Antigravity CLI + Gemini 3.6 Flash (high)Google · 第一方代理
78.9%
1M
否(API + 代理)
DeepSeek V4 Flash / Pro透過 OpenCode / 第三方框架
1M
是(MIT)
GLM-5.2Z.AI · 透過第三方框架
MiniMax M3透過第三方框架 · SWE-bench Verified 80% 以上

論價格,是兩場不同的仗

Muse 標準方案($1.25/$4.25)比 Claude Opus 5($5/$25)便宜 4 到 6 倍,同時定位在中國開源權重三雄之上。Contributor 方案($0.10/$0.20)的輸入單價甚至比 DeepSeek V4 Flash($0.14)還低 —— 代價是分享你的資料。

論能力,緊咬的第二名

Terminal-Bench 2.1 上,Muse Spark 1.2 + Muse Code(82.9%)落後 Claude Opus 5(86.7%),小勝跑 GPT-5.6 Terra 的 Codex(81.8%),Grok Build(81.6%)與 Antigravity CLI(78.9%)居後。DeepSWE 1.1 的差距較大(59.3% vs. 65.0%)。用一小部分的旗艦價格,換到貼近旗艦的實力。

快取那一欄決定真正的帳單

代理工作階段每一輪都會重送儲存庫上下文。Muse Contributor 的 $0.002 快取輸入是全表最低;DeepSeek V4 Flash 的 $0.0028 是唯一接近的對手。跑長時間工作階段時,這一項比帳面上的輸入單價重要得多。

資料來源:Meta Model API 價目表與評測報告(research.meta.ai);OpenAI(GPT-5.6,2026 年 7 月 30 日降價後)、Anthropic、xAI(Grok 4.5,2026 年 7 月 8 日)、Google(Gemini 3.6 Flash,2026 年 7 月 21 日)、DeepSeek(V4 Flash 公開測試,2026 年 7 月 31 日)、Z.AI、MiniMax 公布的價目表;第三方價格追蹤網站,查核於 2026 年 8 月 7 日。各家基準測試條件不同 —— 分數僅供方向性參考。價格隨時會變,編列預算前請先到各家頁面確認。