分析· 4 分钟阅读

Muse Code 对阵群雄:价格-能力地图

五个强劲对手,两条真正重要的坐标轴。Meta 的 agent 相对 Claude、Codex、DeepSeek、GLM 和 MiniMax 的真实位置,以及一套经得起下一次调价的决策框架。

#benchmarks#pricing#comparison#agents

能力格局:紧随其后的第二名

在 Terminal-Bench 2.1——最接近真实终端 agent 工作的基准测试——上,运行在 Muse Code 中的 Muse Spark 1.2 得分 82.9%,落后于 Anthropic 的 Claude Opus 5(86.7%),略高于运行 GPT-5.6 Terra 的 OpenAI Codex(81.8%),xAI 的 Grok Build(81.6%)和 Google 的 Antigravity CLI(78.9%)紧随其后。在考验仓库级软件工程能力的 DeepSWE 1.1 上,排序不变但差距拉大:59.3%,对比 Opus 5 的 65.0% 和 Codex 的 64.8%。这些数字是 Meta 自己公布的,连不好看的格子也一并放了出来——值得为此加几分可信度。

诚实的总结是:Claude Code + Opus 5 是能力上的领跑者;Muse Code 和 Codex 则依测试不同互有胜负。开放权重的挑战者们——DeepSeek V4、GLM-5.2、MiniMax M3——在相邻基准上公布了不俗的成绩(MiniMax 报告在 SWE-bench Verified 上超过 80%),但缺少第一方 agent harness,所以直接的 agent 基准对比大多并不存在。

Terminal-Bench 2.1 柱状图:Claude Opus 5 86.7%,Muse Spark 1.2 82.9%,GPT 5.6 Terra 81.8%,Grok 4.5 81.6%,Gemini 3.6 Flash 78.9%,Muse Spark 1.1 76.2%

Meta 公布的 Terminal-Bench 2.1 图表。前三名之外,Grok Build 中的 Grok 4.5(81.6%)和 Antigravity CLI 中的 Gemini 3.6 Flash(78.9%)补齐了整个战场——而 1.1 → 1.2 的提升是 6.7 个百分点。

价格格局:三条车道

按每百万 token 计价,整个市场分成几条车道。高端档:Opus 5 输入 $5 / 输出 $25,OpenAI 旗舰 GPT-5.6 Sol $5 / $30。中间档:Codex 默认的 GPT-5.6 Terra $2 / $12(OpenAI 7 月 30 日降价之后),Grok 4.5 $2 / $6,Gemini 3.6 Flash $1.50 / $7.50,GLM-5.2 $1.40 / $4.40,以及 Muse 标准档 $1.25 / $4.25。低价档:MiniMax M3 $0.60 / $2.40,DeepSeek V4 Pro $0.435 / $0.87,还有新出的 DeepSeek V4 Flash $0.14 / $0.28。然后是完全跳出这张地图的存在:Muse Contributor $0.10 / $0.20——比所有开放权重选项都便宜,代价是允许 Meta 从你的会话中学习。

具体到 agent 工作负载,缓存输入才是会复利放大的那个数字:仓库上下文每一轮都要重新发送,而 Muse Contributor 的 $0.002 缓存价和 DeepSeek V4 Flash 的 $0.0028 自成一档。Opus 5 的缓存价是 $0.50——是 Contributor 的 250 倍。跑上一个月的长会话之后,缓存那一列就是账单本身;具体机制见我们的档位算账文章

价格表和分数表看不到的东西

有三个结构性差异塞不进表格。第一,harness 归属:Meta、Anthropic、OpenAI、xAI 和 Google 都提供第一方 agent,模型专门为其调优——Muse Spark 1.2 更是真正与 Muse Code 联合训练出来的——而 DeepSeek、GLM 和 MiniMax 只能搭载 OpenCode 这类第三方 harness,它们很优秀,但是通用的。第二,开放性:中国三强公开权重,你可以自托管、微调、彻底摆脱 API 定价——这是三大巨头都不提供的。第三,可审计性:Muse Code 的可精确重放的 event log 作为一等公民产品特性目前是独一份,对受监管的团队来说,它的分量可能超过个位数的基准分差。

一套决策框架

追求能力最大化、价格次要——Claude Code + Opus 5,依然是记分牌上的领跑者。想要接近前沿的能力、中间档的价格,并把并行能力和可审计性当作差异化——Muse Code:专有代码用标准档,其他一切用 Contributor。有自托管、微调或硬性数据主权要求——走开放权重车道:性价比选 DeepSeek V4,GLM-5.2 或 MiniMax M3 则取决于你的 harness 和评测结果。深度绑定 OpenAI 或 Google 生态——Codex 和 Antigravity CLI 依然是阻力最小的路径,而 Grok 4.5 的 $6 输出价让 Grok Build 成为高端车道里最便宜的 agent。

另外,因为 Model API 与你已经在用的 SDK 和 CLI 即插即用兼容,把 Muse 拉来和你现有的方案对比测试,成本只是改一个 base URL。这个市场里数字过时得很快;对比页上有当前的表格和最近核对日期。相比任何人的基准测试——包括我们自己的——更该相信你自己的 diff。

继续阅读