ANÁLISE· 4 min de leitura

Muse Code contra o pelotão: o mapa de preço e capacidade

Cinco rivais sérios, dois eixos que importam. Onde o agente da Meta realmente fica em relação a Claude, Codex, DeepSeek, GLM e MiniMax — e um framework de decisão que sobrevive à próxima mudança de preço.

#benchmarks#pricing#comparison#agents

O retrato de capacidade: um segundo lugar apertado

No Terminal-Bench 2.1 — o benchmark mais próximo do trabalho real de agente no terminal — o Muse Spark 1.2 rodando no Muse Code marca 82,9%, atrás do Claude Opus 5 da Anthropic com 86,7% e logo à frente do Codex da OpenAI rodando GPT-5.6 Terra, com 81,8%; o Grok Build da xAI (81,6%) e o Antigravity CLI do Google (78,9%) vêm colados. No DeepSWE 1.1, que estressa engenharia de software em escala de repositório, a ordem é a mesma mas a distância é maior: 59,3% contra 65,0% do Opus 5 e 64,8% do Codex. A própria Meta publicou esses números, células desfavoráveis incluídas — o que vale alguns pontos de credibilidade.

O resumo honesto: Claude Code + Opus 5 é o líder em capacidade; Muse Code e Codex trocam de posição dependendo do teste. Os desafiantes de pesos abertos — DeepSeek V4, GLM-5.2, MiniMax M3 — publicam resultados fortes em benchmarks adjacentes (a MiniMax reporta 80%+ no SWE-bench Verified), mas não têm harness de agente próprio, então comparações diretas de benchmark de agente em geral simplesmente não existem.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

O gráfico do Terminal-Bench 2.1 publicado pela Meta. Além do top 3, o Grok 4.5 no Grok Build (81,6%) e o Gemini 3.6 Flash no Antigravity CLI (78,9%) completam o pelotão — e o salto de 1.1 para 1.2 é de 6,7 pontos.

O retrato de preço: três pistas

Por milhão de tokens, o mercado se organiza em pistas. Premium: Opus 5 a US$ 5 de entrada / US$ 25 de saída e o carro-chefe da OpenAI, o GPT-5.6 Sol, a US$ 5 / US$ 30. Intermediária: o GPT-5.6 Terra, padrão do Codex, a US$ 2 / US$ 12 (após o corte de preço da OpenAI em 30 de julho), Grok 4.5 a US$ 2 / US$ 6, Gemini 3.6 Flash a US$ 1,50 / US$ 7,50, GLM-5.2 a US$ 1,40 / US$ 4,40 e o Muse standard a US$ 1,25 / US$ 4,25. Econômica: MiniMax M3 a US$ 0,60 / US$ 2,40, DeepSeek V4 Pro a US$ 0,435 / US$ 0,87 e o novo DeepSeek V4 Flash a US$ 0,14 / US$ 0,28. E então, fora do mapa por completo: Muse Contributor a US$ 0,10 / US$ 0,20 — mais barato que qualquer opção de pesos abertos, em troca de deixar a Meta aprender com suas sessões.

Para cargas de trabalho de agente em particular, entrada em cache é o número que compõe: o contexto do repositório é reenviado a cada turno, e a tarifa de cache de US$ 0,002 do Muse Contributor e a de US$ 0,0028 do DeepSeek V4 Flash estão numa classe à parte. O Opus 5 faz cache a US$ 0,50 — 250x a tarifa do Contributor. Num mês de sessões longas, a coluna de cache é a fatura; a mecânica está no nosso post sobre a matemática dos tiers.

O que tabelas de preço e score não capturam

Três diferenças estruturais não cabem em células. Primeira, a propriedade do harness: Meta, Anthropic, OpenAI, xAI e Google entregam agentes de primeira mão cujos modelos foram ajustados para eles — o Muse Spark 1.2 foi literalmente co-treinado com o Muse Code — enquanto DeepSeek, GLM e MiniMax pegam carona em harnesses de terceiros como o OpenCode, que são excelentes, porém genéricos. Segunda, abertura: o trio chinês publica os pesos, então você pode fazer self-host, fine-tune e escapar do preço de API por completo — algo que nenhum dos três grandes oferece. Terceira, auditabilidade: o event log com replay exato do Muse Code é, hoje, único como feature de produto de primeira classe, e para times regulados pode pesar mais que deltas de benchmark de um dígito.

Um framework de decisão

Capacidade máxima, preço em segundo plano — Claude Code + Opus 5, ainda o líder do placar. Capacidade na vizinhança da fronteira a preço de mercado intermediário, com paralelismo e auditabilidade como diferenciais — Muse Code, no standard para trabalho proprietário ou no Contributor para todo o resto. Self-hosting, fine-tuning ou requisitos duros de soberania de dados — a pista de pesos abertos: DeepSeek V4 pelo custo-benefício, GLM-5.2 ou MiniMax M3 dependendo do seu harness e dos seus resultados de avaliação. Investimento profundo no ecossistema OpenAI ou Google — Codex e Antigravity CLI seguem sendo o caminho de menor resistência, e a tarifa de saída de US$ 6 do Grok 4.5 faz do Grok Build o mais barato entre os agentes da pista premium.

E como a Model API é compatível drop-in com os SDKs e CLIs que você já roda, testar o Muse contra o seu incumbente custa uma troca de base URL. Os números envelhecem rápido nesse mercado; a página de comparação mantém a tabela atual e a data da última checagem. Confie nos seus próprios diffs mais do que no benchmark de qualquer um — inclusive o nosso.

Continue lendo