PHÂN TÍCH· 4 phút đọc

Muse Code đấu với cả làng: bản đồ giá và năng lực

Năm đối thủ nặng ký, hai trục tọa độ thực sự quan trọng. Vị trí thật của agent nhà Meta so với Claude, Codex, DeepSeek, GLM và MiniMax — cùng một khung ra quyết định sống sót qua lần đổi giá kế tiếp.

#benchmarks#pricing#comparison#agents

Bức tranh năng lực: á quân bám sát

Trên Terminal-Bench 2.1 — benchmark gần nhất với công việc terminal-agent thực tế — Muse Spark 1.2 chạy trong Muse Code đạt 82.9%, xếp sau Claude Opus 5 của Anthropic ở mức 86.7% và nhỉnh hơn Codex của OpenAI chạy GPT-5.6 Terra ở 81.8%, với Grok Build của xAI (81.6%) và Antigravity CLI của Google (78.9%) bám ngay phía sau. Trên DeepSWE 1.1, bài đánh giá kỹ nghệ phần mềm ở quy mô cả repository, thứ hạng vẫn vậy nhưng khoảng cách rộng hơn: 59.3% so với 65.0% của Opus 5 và 64.8% của Codex. Meta tự công bố những con số này, kể cả các ô không đẹp mắt — điểm cộng cho độ tin cậy.

Tóm tắt sòng phẳng: Claude Code + Opus 5 vẫn dẫn đầu về năng lực; Muse Code và Codex đổi chỗ cho nhau tùy bài test. Nhóm thách thức open-weight — DeepSeek V4, GLM-5.2, MiniMax M3 — công bố kết quả mạnh trên các benchmark liền kề (MiniMax báo cáo trên 80% ở SWE-bench Verified) nhưng thiếu harness agent chính chủ, nên phần lớn các phép so sánh agent-benchmark trực tiếp đơn giản là không tồn tại.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Biểu đồ Terminal-Bench 2.1 do Meta công bố. Ngoài top ba, Grok 4.5 trong Grok Build (81.6%) và Gemini 3.6 Flash trong Antigravity CLI (78.9%) lấp đầy bảng xếp hạng — và cú nhảy từ 1.1 lên 1.2 là 6.7 điểm.

Bức tranh giá cả: ba làn đường

Tính trên mỗi triệu token, cả thị trường tự xếp thành ba làn. Premium: Opus 5 ở mức $5 input / $25 output và flagship của OpenAI, GPT-5.6 Sol, ở $5 / $30. Tầm trung: GPT-5.6 Terra mặc định của Codex ở $2 / $12 (sau đợt giảm giá ngày 30 tháng 7 của OpenAI), Grok 4.5 ở $2 / $6, Gemini 3.6 Flash ở $1.50 / $7.50, GLM-5.2 ở $1.40 / $4.40, và gói standard của Muse ở $1.25 / $4.25. Giá rẻ: MiniMax M3 ở $0.60 / $2.40, DeepSeek V4 Pro ở $0.435 / $0.87, và DeepSeek V4 Flash mới ở $0.14 / $0.28. Rồi văng hẳn ra ngoài bản đồ: Muse Contributor ở $0.10 / $0.20 — rẻ hơn mọi lựa chọn open-weight, đổi lại việc để Meta học từ các phiên làm việc của bạn.

Riêng với workload agent, cached input mới là con số tạo lãi kép: ngữ cảnh repository được gửi lại mỗi lượt, và mức cache $0.002 của Muse Contributor cùng $0.0028 của DeepSeek V4 Flash thuộc một đẳng cấp riêng. Opus 5 cache ở $0.50 — gấp 250 lần mức của Contributor. Sau một tháng toàn phiên dài, cột cache chính là hóa đơn; phần tính toán chi tiết nằm trong bài toán học các gói của chúng tôi.

Những gì bảng giá và bảng điểm bỏ sót

Ba khác biệt mang tính cấu trúc không nhét vừa vào ô bảng. Thứ nhất, quyền sở hữu harness: Meta, Anthropic, OpenAI, xAI và Google đều có agent chính chủ với model được tinh chỉnh riêng cho chúng — Muse Spark 1.2 được co-train đúng nghĩa đen với Muse Code — trong khi DeepSeek, GLM và MiniMax đi nhờ các harness bên thứ ba như OpenCode, vốn xuất sắc nhưng chung chung. Thứ hai, độ mở: bộ ba Trung Quốc công bố weights, nên bạn có thể self-host, fine-tune và thoát hẳn giá API — điều không ông lớn nào trong big three cho phép. Thứ ba, auditability: event log replay chính xác từng bước của Muse Code hiện là tính năng sản phẩm hạng nhất độc nhất trên thị trường, và với các team chịu quản lý chặt, nó có thể nặng ký hơn vài điểm chênh lệch benchmark hàng đơn vị.

Một khung ra quyết định

Cần năng lực tối đa, giá là chuyện phụ — Claude Code + Opus 5, vẫn đang dẫn bảng điểm. Cần năng lực cận-frontier ở giá tầm trung, với chạy song song và auditability làm điểm khác biệt — Muse Code, gói standard cho code độc quyền hoặc Contributor cho mọi thứ còn lại. Cần self-host, fine-tune hoặc yêu cầu chủ quyền dữ liệu cứng — làn open-weight: DeepSeek V4 cho tỉ lệ giá-hiệu năng, GLM-5.2 hoặc MiniMax M3 tùy harness và kết quả eval của bạn. Đã đầu tư sâu vào hệ sinh thái OpenAI hay Google — Codex và Antigravity CLI vẫn là đường ít trở ngại nhất, và mức output $6 của Grok 4.5 khiến Grok Build là agent rẻ nhất trong làn premium.

Và vì Model API tương thích drop-in với các SDK và CLI bạn đang chạy sẵn, test Muse với công cụ đương nhiệm của bạn chỉ tốn một lần đổi base URL. Ở thị trường này số liệu già đi rất nhanh; trang so sánh giữ bảng hiện hành cùng ngày kiểm tra gần nhất. Hãy tin diff của chính bạn hơn benchmark của bất kỳ ai — kể cả của chúng tôi.

Đọc tiếp