ANALISIS· 3 menit baca

Muse Code melawan para pesaing: peta harga vs kapabilitas

Lima rival serius, dua sumbu yang benar-benar penting. Posisi agent milik Meta di hadapan Claude, Codex, DeepSeek, GLM, dan MiniMax — plus kerangka keputusan yang tetap relevan setelah harga berubah lagi.

#benchmarks#pricing#comparison#agents

Peta kapabilitas: runner-up yang rapat

Di Terminal-Bench 2.1 — benchmark yang paling dekat dengan pekerjaan terminal-agent sungguhan — Muse Spark 1.2 yang berjalan di Muse Code mencetak 82,9%, di belakang Claude Opus 5 milik Anthropic dengan 86,7% dan sedikit di depan Codex milik OpenAI yang menjalankan GPT-5.6 Terra dengan 81,8%, disusul rapat oleh Grok Build dari xAI (81,6%) dan Antigravity CLI dari Google (78,9%). Di DeepSWE 1.1, yang menekankan software engineering skala repositori, urutannya sama tapi jaraknya melebar: 59,3% berhadapan dengan 65,0% milik Opus 5 dan 64,8% milik Codex. Meta mempublikasikan angka-angka ini sendiri, termasuk sel-sel yang tidak menguntungkan mereka — layak diberi poin kredibilitas.

Ringkasan jujurnya: Claude Code + Opus 5 adalah pemimpin kapabilitas; Muse Code dan Codex saling bertukar posisi tergantung ujiannya. Para penantang open-weight — DeepSeek V4, GLM-5.2, MiniMax M3 — mempublikasikan hasil kuat di benchmark yang bersinggungan (MiniMax melaporkan 80%+ di SWE-bench Verified) tapi tidak punya agent harness pihak pertama, sehingga perbandingan agent-benchmark langsung sebagian besar memang tidak ada.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Grafik Terminal-Bench 2.1 yang dipublikasikan Meta. Di luar tiga besar, Grok 4.5 di Grok Build (81,6%) dan Gemini 3.6 Flash di Antigravity CLI (78,9%) melengkapi barisan — dan lompatan dari 1.1 ke 1.2 sebesar 6,7 poin.

Peta harga: tiga jalur

Per juta token, para pemain terpilah ke dalam jalur-jalur. Premium: Opus 5 di $5 input / $25 output dan flagship OpenAI GPT-5.6 Sol di $5 / $30. Menengah: GPT-5.6 Terra bawaan Codex di $2 / $12 (setelah pemangkasan harga OpenAI 30 Juli), Grok 4.5 di $2 / $6, Gemini 3.6 Flash di $1,50 / $7,50, GLM-5.2 di $1,40 / $4,40, dan Muse standard di $1,25 / $4,25. Hemat: MiniMax M3 di $0,60 / $2,40, DeepSeek V4 Pro di $0,435 / $0,87, dan si baru DeepSeek V4 Flash di $0,14 / $0,28. Lalu ada yang keluar dari peta sama sekali: Muse Contributor di $0,10 / $0,20 — lebih murah dari semua opsi open-weight, dengan imbalan mengizinkan Meta belajar dari sesi-sesimu.

Khusus untuk beban kerja agent, cached input adalah angka yang efeknya berlipat: konteks repositori dikirim ulang di setiap giliran, dan tarif cache $0,002 milik Muse Contributor serta $0,0028 milik DeepSeek V4 Flash berada di kelasnya sendiri. Opus 5 men-cache di $0,50 — 250x tarif Contributor. Dalam sebulan penuh sesi panjang, kolom cache adalah tagihannya; mekanismenya ada di tulisan hitung-hitungan tier kami.

Yang luput dari tabel harga dan skor

Tiga perbedaan struktural tidak muat di dalam sel tabel. Pertama, kepemilikan harness: Meta, Anthropic, OpenAI, xAI, dan Google semuanya merilis agent pihak pertama yang modelnya di-tuning khusus untuknya — Muse Spark 1.2 bahkan benar-benar di-co-train dengan Muse Code — sementara DeepSeek, GLM, dan MiniMax menumpang harness pihak ketiga seperti OpenCode, yang bagus tapi generik. Kedua, keterbukaan: trio Tiongkok mempublikasikan weight, jadi kamu bisa self-host, fine-tune, dan lepas sepenuhnya dari harga API — sesuatu yang tidak ditawarkan tiga raksasa mana pun. Ketiga, auditabilitas: event log replay-exact milik Muse Code saat ini satu-satunya yang hadir sebagai fitur produk kelas satu, dan bagi tim di industri teregulasi itu bisa lebih berat timbangannya daripada selisih benchmark satu digit.

Kerangka pengambilan keputusan

Kapabilitas maksimum, harga urusan belakangan — Claude Code + Opus 5, masih pemimpin papan skor. Kapabilitas nyaris-frontier dengan harga pasar menengah, dengan paralelisme dan auditabilitas sebagai pembeda — Muse Code, pakai standard untuk pekerjaan proprietary atau Contributor untuk sisanya. Kebutuhan self-hosting, fine-tuning, atau kedaulatan data yang ketat — jalur open-weight: DeepSeek V4 untuk rasio harga-performa, GLM-5.2 atau MiniMax M3 tergantung harness dan hasil eval milikmu. Investasi mendalam di ekosistem OpenAI atau Google — Codex dan Antigravity CLI tetap jalur paling minim hambatan, dan tarif output $6 milik Grok 4.5 menjadikan Grok Build agent termurah di jalur premium.

Dan karena Model API kompatibel drop-in dengan SDK dan CLI yang sudah kamu jalankan, menguji Muse melawan juara bertahanmu hanya butuh satu perubahan base URL. Angka-angka di pasar ini cepat basi; halaman perbandingan memuat tabel terkini beserta tanggal terakhir dicek. Percayai diff milikmu sendiri di atas benchmark siapa pun — termasuk milik kami.

Lanjut membaca