Confronto

Muse Code contro tutti.

Prezzo e capacità a confronto con Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2 e MiniMax M3 — in base ai listini ufficiali dei vendor e ai benchmark pubblicati, al 7 agosto 2026.

Prezzi API, per 1 milione di token

L’input in cache è ciò che il coding agentico paga davvero: il contesto del repository viene rinviato a ogni turno.

MODELLO
INPUT
INPUT IN CACHE
OUTPUT
POLITICA SUI DATI
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
Può essere usato per migliorare i prodotti Meta
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
Mai usato per l’addestramento; retention zero tramite il team commerciale
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
Di default non addestra sui dati API
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
Di default non addestra sui dati API
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
Di default non addestra sui dati API
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
Di default non addestra sui dati API
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
Il piano a pagamento non viene usato per l’addestramento
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
Pesi aperti; si applicano i termini dell’API in hosting
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
Pesi aperti; si applicano i termini dell’API in hosting
GLM-5.2 (Z.AI)
$1.40
$4.40
Pesi aperti; si applicano i termini dell’API in hosting
MiniMax M3
$0.60
$2.40
Pesi aperti; si applicano i termini dell’API in hosting

Capacità come agente di codice

I benchmark per agenti misurano il modello dentro il suo harness. Punteggi tratti dalla valutazione pubblicata da Meta e dai risultati dichiarati dai vendor; le celle vuote indicano che non esiste un punteggio pubblicato.

Grafico a barre Terminal-Bench 2.1: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Terminal-Bench 2.1, il quadro completo

Il grafico pubblicato da Meta aggiunge un contesto che la tabella non può dare: Muse Spark 1.2 dentro Muse Code (82.9%) è al secondo posto dietro Claude Opus 5 max in Claude Code (86.7%), davanti a GPT 5.6 Terra max in Codex (81.8%), Grok 4.5 high in Grok Build (81.6%) e Gemini 3.6 Flash high in Antigravity CLI (78.9%) — e ben 6.7 punti sopra il proprio predecessore, Muse Spark 1.1 in mini-swe-agent (76.2%).

AGENTE / MODELLO
TERMINAL-BENCH 2.1
DEEPSWE 1.1
CONTESTO
PESI APERTI
Muse Code + Muse Spark 1.2Meta · modello e harness addestrati insieme
82.9%
59.3%
1M
No (API + agente)
Claude Code + Opus 5Anthropic · agente di prima parte
86.7%
65.0%
1M
No (API + agente)
Codex + GPT-5.6 Terra (max)OpenAI · agente di prima parte
81.8%
64.8%
1M
No (API + agente)
Grok Build + Grok 4.5 (high)xAI · agente di prima parte
81.6%
500K
No (API + agente)
Antigravity CLI + Gemini 3.6 Flash (high)Google · agente di prima parte
78.9%
1M
No (API + agente)
DeepSeek V4 Flash / Provia OpenCode / harness di terze parti
1M
Sì (MIT)
GLM-5.2Z.AI · via harness di terze parti
MiniMax M3via harness di terze parti · oltre l’80% su SWE-bench Verified

Sul prezzo, due partite diverse

Il piano standard di Muse ($1.25/$4.25) costa da 4 a 6 volte meno di Claude Opus 5 ($5/$25), pur restando sopra il trio cinese a pesi aperti. Il livello Contributor ($0.10/$0.20) scende in input perfino sotto DeepSeek V4 Flash ($0.14) — il prezzo da pagare è condividere i tuoi dati.

Sulla capacità, un secondo posto di misura

Su Terminal-Bench 2.1, Muse Spark 1.2 + Muse Code (82.9%) resta dietro Claude Opus 5 (86.7%) e supera di poco Codex con GPT-5.6 Terra (81.8%), con Grok Build (81.6%) e Antigravity CLI (78.9%) più indietro. Su DeepSWE 1.1 il divario si allarga (59.3% contro 65.0%). Prestazioni quasi da frontiera, a una frazione del prezzo di frontiera.

È la colonna della cache a decidere la bolletta vera

Le sessioni di un agente rinviano il contesto del repository a ogni turno. I $0.002 di input in cache di Muse Contributor sono la cifra più bassa della tabella; i $0.0028 di DeepSeek V4 Flash sono l’unico rivale vicino. Nelle sessioni lunghe questa riga pesa più del prezzo di input in vetrina.

Fonti: listino della Meta Model API e report di valutazione (research.meta.ai); listini pubblicati da OpenAI (GPT-5.6, dopo il taglio del 30 luglio 2026), Anthropic, xAI (Grok 4.5, 8 luglio 2026), Google (Gemini 3.6 Flash, 21 luglio 2026), DeepSeek (beta pubblica di V4 Flash, 31 luglio 2026), Z.AI e MiniMax; tracker di prezzi di terze parti, verificati il 7 agosto 2026. Le condizioni dei benchmark variano da vendor a vendor: prendi i punteggi come indicativi. I prezzi cambiano; verificali sulla pagina di ciascun vendor prima di fare i conti.