Muse Code contro tutti.
Prezzo e capacità a confronto con Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2 e MiniMax M3 — in base ai listini ufficiali dei vendor e ai benchmark pubblicati, al 7 agosto 2026.
Prezzi API, per 1 milione di token
L’input in cache è ciò che il coding agentico paga davvero: il contesto del repository viene rinviato a ogni turno.
Capacità come agente di codice
I benchmark per agenti misurano il modello dentro il suo harness. Punteggi tratti dalla valutazione pubblicata da Meta e dai risultati dichiarati dai vendor; le celle vuote indicano che non esiste un punteggio pubblicato.

Terminal-Bench 2.1, il quadro completo
Il grafico pubblicato da Meta aggiunge un contesto che la tabella non può dare: Muse Spark 1.2 dentro Muse Code (82.9%) è al secondo posto dietro Claude Opus 5 max in Claude Code (86.7%), davanti a GPT 5.6 Terra max in Codex (81.8%), Grok 4.5 high in Grok Build (81.6%) e Gemini 3.6 Flash high in Antigravity CLI (78.9%) — e ben 6.7 punti sopra il proprio predecessore, Muse Spark 1.1 in mini-swe-agent (76.2%).
Sul prezzo, due partite diverse
Il piano standard di Muse ($1.25/$4.25) costa da 4 a 6 volte meno di Claude Opus 5 ($5/$25), pur restando sopra il trio cinese a pesi aperti. Il livello Contributor ($0.10/$0.20) scende in input perfino sotto DeepSeek V4 Flash ($0.14) — il prezzo da pagare è condividere i tuoi dati.
Sulla capacità, un secondo posto di misura
Su Terminal-Bench 2.1, Muse Spark 1.2 + Muse Code (82.9%) resta dietro Claude Opus 5 (86.7%) e supera di poco Codex con GPT-5.6 Terra (81.8%), con Grok Build (81.6%) e Antigravity CLI (78.9%) più indietro. Su DeepSWE 1.1 il divario si allarga (59.3% contro 65.0%). Prestazioni quasi da frontiera, a una frazione del prezzo di frontiera.
È la colonna della cache a decidere la bolletta vera
Le sessioni di un agente rinviano il contesto del repository a ogni turno. I $0.002 di input in cache di Muse Contributor sono la cifra più bassa della tabella; i $0.0028 di DeepSeek V4 Flash sono l’unico rivale vicino. Nelle sessioni lunghe questa riga pesa più del prezzo di input in vetrina.
Fonti: listino della Meta Model API e report di valutazione (research.meta.ai); listini pubblicati da OpenAI (GPT-5.6, dopo il taglio del 30 luglio 2026), Anthropic, xAI (Grok 4.5, 8 luglio 2026), Google (Gemini 3.6 Flash, 21 luglio 2026), DeepSeek (beta pubblica di V4 Flash, 31 luglio 2026), Z.AI e MiniMax; tracker di prezzi di terze parti, verificati il 7 agosto 2026. Le condizioni dei benchmark variano da vendor a vendor: prendi i punteggi come indicativi. I prezzi cambiano; verificali sulla pagina di ciascun vendor prima di fare i conti.