ANALYSE· 4 min de lecture

Muse Code face à la concurrence : la carte prix-capacité

Cinq rivaux sérieux, deux axes qui comptent. Où se situe vraiment l'agent de Meta face à Claude, Codex, DeepSeek, GLM et MiniMax — avec une grille de décision qui survivra au prochain changement de prix.

#benchmarks#pricing#comparison#agents

Le tableau des capacités : un solide deuxième

Sur Terminal-Bench 2.1 — le benchmark le plus proche du vrai travail d’agent en terminal — Muse Spark 1.2 dans Muse Code marque 82,9 %, derrière Claude Opus 5 d’Anthropic à 86,7 % et juste devant Codex d’OpenAI propulsé par GPT-5.6 Terra à 81,8 %, avec Grok Build de xAI (81,6 %) et l’Antigravity CLI de Google (78,9 %) juste derrière. Sur DeepSWE 1.1, qui met à l’épreuve l’ingénierie logicielle à l’échelle d’un dépôt, l’ordre est le même mais l’écart plus large : 59,3 % contre 65,0 % pour Opus 5 et 64,8 % pour Codex. Meta a publié ces chiffres elle-même, cases peu flatteuses comprises — ça vaut quelques points de crédibilité.

Le résumé honnête : Claude Code + Opus 5 est le leader en capacité ; Muse Code et Codex échangent leurs places selon le test. Les challengers open-weight — DeepSeek V4, GLM-5.2, MiniMax M3 — publient de bons résultats sur des benchmarks adjacents (MiniMax annonce plus de 80 % sur SWE-bench Verified) mais n’ont pas de harnais d’agent maison, donc les comparaisons directes sur benchmarks d’agents n’existent pour l’essentiel pas.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Le graphique Terminal-Bench 2.1 publié par Meta. Au-delà du trio de tête, Grok 4.5 dans Grok Build (81,6 %) et Gemini 3.6 Flash dans l’Antigravity CLI (78,9 %) complètent le tableau — et le saut de 1.1 à 1.2 fait 6,7 points.

Le tableau des prix : trois voies

Par million de tokens, le marché se range en voies. Premium : Opus 5 à 5 $ en entrée / 25 $ en sortie et le flagship d’OpenAI, GPT-5.6 Sol, à 5 $ / 30 $. Milieu de gamme : le GPT-5.6 Terra par défaut de Codex à 2 $ / 12 $ (après la baisse de prix d’OpenAI du 30 juillet), Grok 4.5 à 2 $ / 6 $, Gemini 3.6 Flash à 1,50 $ / 7,50 $, GLM-5.2 à 1,40 $ / 4,40 $, et Muse standard à 1,25 $ / 4,25 $. Budget : MiniMax M3 à 0,60 $ / 2,40 $, DeepSeek V4 Pro à 0,435 $ / 0,87 $, et le nouveau DeepSeek V4 Flash à 0,14 $ / 0,28 $. Et puis, carrément hors de la carte : Muse Contributor à 0,10 $ / 0,20 $ — moins cher que toutes les options open-weight, en échange de laisser Meta apprendre de tes sessions.

Pour les charges d’agents en particulier, l’entrée en cache est le chiffre qui compose : le contexte du dépôt est renvoyé à chaque tour, et le tarif caché de 0,002 $ de Muse Contributor comme les 0,0028 $ de DeepSeek V4 Flash jouent dans une catégorie à part. Opus 5 cache à 0,50 $ — 250x le tarif Contributor. Sur un mois de longues sessions, la colonne cache, c’est la facture ; la mécanique est détaillée dans notre post sur les maths des paliers.

Ce que les tableaux de prix et de scores ratent

Trois différences structurelles ne tiennent pas dans des cases. Un, la propriété du harnais : Meta, Anthropic, OpenAI, xAI et Google livrent tous des agents maison dont les modèles sont réglés pour eux — Muse Spark 1.2 a été littéralement co-entraîné avec Muse Code — pendant que DeepSeek, GLM et MiniMax roulent sur des harnais tiers comme OpenCode, excellents mais génériques. Deux, l’ouverture : le trio chinois publie ses poids, donc tu peux auto-héberger, fine-tuner et échapper totalement à la tarification API — ce qu’aucun des trois grands ne propose. Trois, l’auditabilité : l’event log rejouable à l’identique de Muse Code est aujourd’hui unique comme fonctionnalité produit de premier rang, et pour les équipes en secteur régulé, ça peut peser plus lourd que quelques points de benchmark.

Une grille de décision

Capacité maximale, prix secondaire — Claude Code + Opus 5, toujours en tête du tableau. Capacité proche de la frontière à prix milieu de gamme, avec parallélisme et auditabilité comme différenciateurs — Muse Code, en standard pour le code propriétaire ou en Contributor pour tout le reste. Auto-hébergement, fine-tuning ou exigences dures de souveraineté des données — la voie open-weight : DeepSeek V4 pour le rapport prix-performance, GLM-5.2 ou MiniMax M3 selon ton harnais et tes évals. Investissement profond dans l’écosystème OpenAI ou Google — Codex et l’Antigravity CLI restent les chemins de moindre résistance, et le tarif de sortie à 6 $ de Grok 4.5 fait de Grok Build le moins cher des agents de la voie premium.

Et comme le Model API est compatible en drop-in avec les SDK et CLI que tu utilises déjà, tester Muse contre ton outil en place coûte un changement d’URL de base. Les chiffres vieillissent vite sur ce marché ; la page comparatif porte le tableau à jour et sa date de dernière vérification. Fais confiance à tes propres diffs plutôt qu’aux benchmarks de qui que ce soit — les nôtres compris.

Poursuivre la lecture