Comparativo

Muse Code contra todo o pelotão.

Preço e capacidade frente a Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2 e MiniMax M3 — com base nas tabelas oficiais de preços e nos benchmarks publicados, em 7 de agosto de 2026.

Preços de API, por 1 milhão de tokens

Entrada em cache é o que a programação agêntica realmente paga — o contexto do repositório é reenviado a cada turno.

MODELO
ENTRADA
ENTRADA EM CACHE
SAÍDA
POLÍTICA DE DADOS
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
Pode ser usado para melhorar produtos da Meta
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
Nunca usado para treinamento; retenção zero via time de vendas
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
Não treina com dados da API por padrão
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
Não treina com dados da API por padrão
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
Não treina com dados da API por padrão
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
Não treina com dados da API por padrão
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
Plano pago não é usado para treinamento
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
Pesos abertos; valem os termos da API hospedada
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
Pesos abertos; valem os termos da API hospedada
GLM-5.2 (Z.AI)
$1.40
$4.40
Pesos abertos; valem os termos da API hospedada
MiniMax M3
$0.60
$2.40
Pesos abertos; valem os termos da API hospedada

Capacidade como agente de código

Benchmarks de agente medem o modelo dentro do seu harness. Notas extraídas da avaliação publicada pela Meta e de resultados divulgados pelos próprios fornecedores; células vazias significam que não há nota publicada.

Gráfico de barras do Terminal-Bench 2.1: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Terminal-Bench 2.1, o quadro completo

O gráfico publicado pela Meta acrescenta um contexto que a tabela não consegue dar: o Muse Spark 1.2 dentro do Muse Code (82.9%) fica em segundo lugar, atrás do Claude Opus 5 max no Claude Code (86.7%) e à frente do GPT 5.6 Terra max no Codex (81.8%), do Grok 4.5 high no Grok Build (81.6%) e do Gemini 3.6 Flash high no Antigravity CLI (78.9%) — e 6.7 pontos inteiros acima do próprio antecessor, o Muse Spark 1.1 no mini-swe-agent (76.2%).

AGENTE / MODELO
TERMINAL-BENCH 2.1
DEEPSWE 1.1
CONTEXTO
PESOS ABERTOS
Muse Code + Muse Spark 1.2Meta · modelo e harness treinados juntos
82.9%
59.3%
1M
Não (API + agente)
Claude Code + Opus 5Anthropic · agente da própria casa
86.7%
65.0%
1M
Não (API + agente)
Codex + GPT-5.6 Terra (max)OpenAI · agente da própria casa
81.8%
64.8%
1M
Não (API + agente)
Grok Build + Grok 4.5 (high)xAI · agente da própria casa
81.6%
500K
Não (API + agente)
Antigravity CLI + Gemini 3.6 Flash (high)Google · agente da própria casa
78.9%
1M
Não (API + agente)
DeepSeek V4 Flash / Provia OpenCode / harnesses de terceiros
1M
Sim (MIT)
GLM-5.2Z.AI · via harnesses de terceiros
Sim
MiniMax M3via harnesses de terceiros · mais de 80% no SWE-bench Verified
Sim

No preço, duas brigas diferentes

O plano padrão do Muse ($1.25/$4.25) custa de 4 a 6 vezes menos que o Claude Opus 5 ($5/$25), mas fica acima do trio chinês de pesos abertos. O nível Contributor ($0.10/$0.20) desce na entrada abaixo até do DeepSeek V4 Flash ($0.14) — o preço de compartilhar os seus dados.

Na capacidade, um segundo lugar apertado

No Terminal-Bench 2.1, Muse Spark 1.2 + Muse Code (82.9%) fica atrás do Claude Opus 5 (86.7%) e supera por pouco o Codex rodando GPT-5.6 Terra (81.8%), com Grok Build (81.6%) e Antigravity CLI (78.9%) mais atrás. No DeepSWE 1.1 a distância aumenta (59.3% contra 65.0%). Desempenho quase de fronteira, por uma fração do preço de fronteira.

A coluna de cache é que decide a fatura real

Sessões de agente reenviam o contexto do repositório a cada turno. Os $0.002 de entrada em cache do Muse Contributor são o menor número da tabela; os $0.0028 do DeepSeek V4 Flash são o único rival próximo. Em sessões longas, essa linha pesa mais do que o preço de entrada da manchete.

Fontes: tabela de preços da Meta Model API e relatório de avaliação (research.meta.ai); tabelas publicadas por OpenAI (GPT-5.6, após o corte de 30 de julho de 2026), Anthropic, xAI (Grok 4.5, 8 de julho de 2026), Google (Gemini 3.6 Flash, 21 de julho de 2026), DeepSeek (beta pública do V4 Flash, 31 de julho de 2026), Z.AI e MiniMax; rastreadores de preços de terceiros, conferidos em 7 de agosto de 2026. As condições de benchmark variam entre os fornecedores — trate as notas como referência direcional. Preços mudam; confirme na página de cada fornecedor antes de fechar o orçamento.