So sánh

Muse Code đối đầu cả sân chơi.

Giá và năng lực đặt cạnh Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2 và MiniMax M3 — theo bảng giá chính thức của từng hãng và các benchmark đã công bố, tính đến ngày 7 tháng 8 năm 2026.

Giá API, trên mỗi 1 triệu token

Đầu vào cache mới là khoản mà lập trình kiểu agent thực sự phải trả — ngữ cảnh kho mã được gửi lại ở mỗi lượt.

MÔ HÌNH
ĐẦU VÀO
ĐẦU VÀO CACHE
ĐẦU RA
CHÍNH SÁCH DỮ LIỆU
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
Có thể được dùng để cải thiện sản phẩm Meta
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
Không bao giờ dùng để huấn luyện; lưu trữ bằng không qua bộ phận kinh doanh
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
Mặc định không huấn luyện trên dữ liệu API
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
Mặc định không huấn luyện trên dữ liệu API
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
Mặc định không huấn luyện trên dữ liệu API
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
Mặc định không huấn luyện trên dữ liệu API
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
Gói trả phí không được dùng để huấn luyện
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
Trọng số mở; áp dụng điều khoản của API lưu trữ
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
Trọng số mở; áp dụng điều khoản của API lưu trữ
GLM-5.2 (Z.AI)
$1.40
$4.40
Trọng số mở; áp dụng điều khoản của API lưu trữ
MiniMax M3
$0.60
$2.40
Trọng số mở; áp dụng điều khoản của API lưu trữ

Năng lực agent lập trình

Benchmark agent đo mô hình bên trong chính harness của nó. Điểm số lấy từ báo cáo đánh giá công khai của Meta và số liệu do các hãng tự công bố; ô trống nghĩa là chưa có điểm được công bố.

Biểu đồ cột Terminal-Bench 2.1: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Terminal-Bench 2.1, toàn cảnh cuộc đua

Biểu đồ do Meta công bố bổ sung phần bối cảnh mà bảng số liệu không nói hết được: Muse Spark 1.2 trong Muse Code (82.9%) đứng thứ hai, sau Claude Opus 5 max trong Claude Code (86.7%), vượt GPT 5.6 Terra max trong Codex (81.8%), Grok 4.5 high trong Grok Build (81.6%) và Gemini 3.6 Flash high trong Antigravity CLI (78.9%) — đồng thời bỏ xa chính người tiền nhiệm của mình, Muse Spark 1.1 trong mini-swe-agent (76.2%), tới trọn 6.7 điểm.

AGENT / MÔ HÌNH
TERMINAL-BENCH 2.1
DEEPSWE 1.1
NGỮ CẢNH
TRỌNG SỐ MỞ
Muse Code + Muse Spark 1.2Meta · mô hình và harness được huấn luyện cùng nhau
82.9%
59.3%
1M
Không (API + agent)
Claude Code + Opus 5Anthropic · agent chính hãng
86.7%
65.0%
1M
Không (API + agent)
Codex + GPT-5.6 Terra (max)OpenAI · agent chính hãng
81.8%
64.8%
1M
Không (API + agent)
Grok Build + Grok 4.5 (high)xAI · agent chính hãng
81.6%
500K
Không (API + agent)
Antigravity CLI + Gemini 3.6 Flash (high)Google · agent chính hãng
78.9%
1M
Không (API + agent)
DeepSeek V4 Flash / Proqua OpenCode / harness bên thứ ba
1M
Có (MIT)
GLM-5.2Z.AI · qua harness bên thứ ba
MiniMax M3qua harness bên thứ ba · trên 80% ở SWE-bench Verified

Về giá: hai cuộc chiến khác nhau

Gói tiêu chuẩn của Muse ($1.25/$4.25) rẻ hơn Claude Opus 5 ($5/$25) từ 4 đến 6 lần, nhưng vẫn đứng trên bộ ba trọng số mở Trung Quốc. Bậc Contributor ($0.10/$0.20) có giá đầu vào thậm chí thấp hơn cả DeepSeek V4 Flash ($0.14) — cái giá đổi lại là bạn chia sẻ dữ liệu của mình.

Về năng lực: vị trí thứ hai — bám rất sát

Trên Terminal-Bench 2.1, bộ đôi Muse Spark 1.2 + Muse Code (82.9%) xếp sau Claude Opus 5 (86.7%) và vượt sít sao Codex chạy GPT-5.6 Terra (81.8%); Grok Build (81.6%) và Antigravity CLI (78.9%) theo sau. Trên DeepSWE 1.1 khoảng cách rộng hơn (59.3% so với 65.0%). Năng lực áp sát nhóm dẫn đầu, với chỉ một phần nhỏ mức giá của nhóm dẫn đầu.

Cột cache mới quyết định hóa đơn thật

Phiên làm việc của agent gửi lại ngữ cảnh kho mã ở mỗi lượt. Mức $0.002 cho đầu vào cache của Muse Contributor là con số thấp nhất bảng; $0.0028 của DeepSeek V4 Flash là đối thủ duy nhất bám gần. Với những phiên dài, hàng này quan trọng hơn nhiều so với giá đầu vào ghi trên nhãn.

Nguồn: bảng giá Meta Model API và báo cáo đánh giá (research.meta.ai); bảng giá công bố của OpenAI (GPT-5.6, sau đợt giảm giá ngày 30 tháng 7 năm 2026), Anthropic, xAI (Grok 4.5, ngày 8 tháng 7 năm 2026), Google (Gemini 3.6 Flash, ngày 21 tháng 7 năm 2026), DeepSeek (bản beta công khai V4 Flash, ngày 31 tháng 7 năm 2026), Z.AI và MiniMax; các trang theo dõi giá bên thứ ba, đối chiếu ngày 7 tháng 8 năm 2026. Điều kiện benchmark khác nhau giữa các hãng — bạn nên xem điểm số chỉ mang tính định hướng. Giá có thể thay đổi; hãy kiểm tra lại trên trang của từng hãng trước khi lập ngân sách.