Muse Code frente al pelotón: el mapa de precio y capacidad
Cinco rivales serios, dos ejes que importan. Dónde se sitúa realmente el agente de Meta frente a Claude, Codex, DeepSeek, GLM y MiniMax — y un marco de decisión que sobrevive al próximo cambio de precios.
La foto de capacidad: un segundo puesto ajustado
En Terminal-Bench 2.1 — el benchmark más parecido al trabajo real de un agente de terminal — Muse Spark 1.2 corriendo en Muse Code puntúa un 82,9%, por detrás de Claude Opus 5 de Anthropic con un 86,7% y justo por delante de Codex de OpenAI con GPT-5.6 Terra, que marca un 81,8%; Grok Build de xAI (81,6%) y Antigravity CLI de Google (78,9%) siguen de cerca. En DeepSWE 1.1, que estresa la ingeniería de software a escala de repositorio, el orden se repite pero la brecha se abre: 59,3% frente al 65,0% de Opus 5 y el 64,8% de Codex. Meta publicó estos números por su cuenta, celdas poco favorecedoras incluidas — lo cual suma algunos puntos de credibilidad.
El resumen honesto: Claude Code + Opus 5 es el líder en capacidad; Muse Code y Codex se intercambian el puesto según la prueba. Los aspirantes de pesos abiertos — DeepSeek V4, GLM-5.2, MiniMax M3 — publican buenos resultados en benchmarks adyacentes (MiniMax reporta más de un 80% en SWE-bench Verified), pero no tienen harness de agente propio, así que las comparaciones directas en benchmarks de agentes en general no existen.

El gráfico de Terminal-Bench 2.1 publicado por Meta. Más allá del top tres, Grok 4.5 en Grok Build (81,6%) y Gemini 3.6 Flash en Antigravity CLI (78,9%) completan el pelotón — y el salto de 1.1 a 1.2 es de 6,7 puntos.
La foto de precios: tres carriles
Por millón de tokens, el mercado se ordena en carriles. Premium: Opus 5 a 5 $ de entrada / 25 $ de salida y el buque insignia de OpenAI, GPT-5.6 Sol, a 5 $ / 30 $. Medio: GPT-5.6 Terra, el modelo por defecto de Codex, a 2 $ / 12 $ (tras el recorte de precios de OpenAI del 30 de julio), Grok 4.5 a 2 $ / 6 $, Gemini 3.6 Flash a 1,50 $ / 7,50 $, GLM-5.2 a 1,40 $ / 4,40 $ y Muse standard a 1,25 $ / 4,25 $. Económico: MiniMax M3 a 0,60 $ / 2,40 $, DeepSeek V4 Pro a 0,435 $ / 0,87 $ y el nuevo DeepSeek V4 Flash a 0,14 $ / 0,28 $. Y luego, directamente fuera del mapa: Muse Contributor a 0,10 $ / 0,20 $ — más barato que cualquier opción de pesos abiertos, a cambio de dejar que Meta aprenda de tus sesiones.
Para cargas de trabajo agénticas en concreto, la entrada cacheada es el número que se acumula: el contexto del repositorio se reenvía en cada turno, y la tarifa cacheada de 0,002 $ de Muse Contributor y la de 0,0028 $ de DeepSeek V4 Flash están en una categoría propia. Opus 5 cachea a 0,50 $ — 250 veces la tarifa de Contributor. Tras un mes de sesiones largas, la columna de caché es la factura; la mecánica está en nuestro post sobre las cuentas de los niveles.
Lo que las tablas de precios y puntuaciones no ven
Hay tres diferencias estructurales que no caben en una celda. Primera, la propiedad del harness: Meta, Anthropic, OpenAI, xAI y Google publican agentes de primera mano cuyos modelos están afinados para ellos — Muse Spark 1.2 fue literalmente co-entrenado con Muse Code — mientras que DeepSeek, GLM y MiniMax viajan en harness de terceros como OpenCode, excelentes pero genéricos. Segunda, la apertura: el trío chino publica los pesos, así que puedes autoalojar, hacer fine-tuning y escapar por completo del precio de la API — algo que ninguno de los tres grandes ofrece. Tercera, la auditabilidad: el event log con replay exacto de Muse Code es hoy único como característica de producto de primera clase, y para equipos regulados puede pesar más que unas décimas de benchmark.
Un marco de decisión
Máxima capacidad, con el precio en segundo plano — Claude Code + Opus 5, todavía el líder del marcador. Capacidad casi de frontera a precio de mercado medio, con paralelismo y auditabilidad como diferenciales — Muse Code, en standard para trabajo propietario o en Contributor para todo lo demás. Autoalojamiento, fine-tuning o requisitos duros de soberanía de datos — el carril de pesos abiertos: DeepSeek V4 por relación precio-rendimiento, GLM-5.2 o MiniMax M3 según tu harness y tus resultados de evaluación. Inversión profunda en el ecosistema de OpenAI o Google — Codex y Antigravity CLI siguen siendo los caminos de menor resistencia, y la tarifa de salida de 6 $ de Grok 4.5 convierte a Grok Build en el más barato de los agentes del carril premium.
Y como el Model API es compatible sin cambios con los SDKs y CLIs que ya usas, probar Muse contra tu herramienta actual cuesta un cambio de URL base. En este mercado los números envejecen rápido; la página de comparación mantiene la tabla vigente y su fecha de última revisión. Fíate de tus propios diffs antes que del benchmark de nadie — el nuestro incluido.