Muse Code na tle stawki: mapa ceny i możliwości
Pięciu poważnych rywali, dwie osie, które się liczą. Gdzie naprawdę siedzi agent Mety względem Claude, Codexa, DeepSeeka, GLM i MiniMaxa — plus framework decyzyjny, który przetrwa następną zmianę cennika.
Obraz możliwości: mocne drugie miejsce
Na Terminal-Bench 2.1 — benchmarku najbliższym prawdziwej pracy agenta w terminalu — Muse Spark 1.2 działający w Muse Code osiąga 82,9%, za Claude Opus 5 od Anthropica z 86,7% i tuż przed Codexem OpenAI na GPT-5.6 Terra z 81,8%, z Grok Build od xAI (81,6%) i Antigravity CLI od Google (78,9%) depczącymi po piętach. Na DeepSWE 1.1, który wyciska inżynierię oprogramowania w skali całego repozytorium, kolejność jest ta sama, ale dystans większy: 59,3% wobec 65,0% Opus 5 i 64,8% Codexa. Meta opublikowała te liczby sama, łącznie z niepochlebnymi komórkami — co warte jest kilku punktów wiarygodności.
Uczciwe podsumowanie: Claude Code + Opus 5 to lider możliwości; Muse Code i Codex zamieniają się miejscami zależnie od testu. Challengerzy open-weight — DeepSeek V4, GLM-5.2, MiniMax M3 — publikują mocne wyniki na pokrewnych benchmarkach (MiniMax raportuje 80%+ na SWE-bench Verified), ale nie mają własnych, first-party harnessów agentowych, więc bezpośrednie porównania agent-do-agenta w większości nie istnieją.

Opublikowany przez Metę wykres Terminal-Bench 2.1. Poza pierwszą trójką stawkę uzupełniają Grok 4.5 w Grok Build (81,6%) i Gemini 3.6 Flash w Antigravity CLI (78,9%) — a skok z 1.1 na 1.2 to 6,7 punktu.
Obraz cen: trzy pasy ruchu
W przeliczeniu na milion tokenów stawka układa się w pasy. Premium: Opus 5 za 5 USD in / 25 USD out i flagowy GPT-5.6 Sol od OpenAI za 5 / 30 USD. Środek: domyślny dla Codexa GPT-5.6 Terra za 2 / 12 USD (po lipcowej, z 30 lipca, obniżce OpenAI), Grok 4.5 za 2 / 6 USD, Gemini 3.6 Flash za 1,50 / 7,50 USD, GLM-5.2 za 1,40 / 4,40 USD i Muse standard za 1,25 / 4,25 USD. Budżet: MiniMax M3 za 0,60 / 2,40 USD, DeepSeek V4 Pro za 0,435 / 0,87 USD i nowy DeepSeek V4 Flash za 0,14 / 0,28 USD. I wreszcie coś zupełnie poza mapą: Muse Contributor za 0,10 / 0,20 USD — taniej niż każda opcja open-weight, w zamian za zgodę, by Meta uczyła się z twoich sesji.
Konkretnie dla obciążeń agentowych liczbą, która się kumuluje, jest cached input: kontekst repozytorium jest dosyłany w każdej turze, a stawka cache 0,002 USD w Muse Contributor i 0,0028 USD w DeepSeek V4 Flash to osobna liga. Opus 5 cache’uje po 0,50 USD — 250x stawki Contributora. Po miesiącu długich sesji kolumna cache jest rachunkiem; mechanikę rozpisaliśmy w poście o matematyce taryf.
Czego nie widać w tabelach cen i wyników
Trzy różnice strukturalne nie mieszczą się w komórkach. Po pierwsze, własność harnessu: Meta, Anthropic, OpenAI, xAI i Google dostarczają first-party agentów, pod których modele są strojone — Muse Spark 1.2 był dosłownie współtrenowany z Muse Code — podczas gdy DeepSeek, GLM i MiniMax jeżdżą na harnessach third-party jak OpenCode, świetnych, ale generycznych. Po drugie, otwartość: chińska trójka publikuje wagi, więc możesz self-hostować, fine-tunować i całkowicie uciec od cennika API — czego żaden z wielkiej trójki nie oferuje. Po trzecie, audytowalność: odtwarzalny co do zdarzenia log Muse Code jest obecnie unikatem jako pełnoprawna funkcja produktu i dla zespołów w branżach regulowanych może przeważyć jednocyfrowe różnice w benchmarkach.
Framework decyzyjny
Maksimum możliwości, cena na drugim planie — Claude Code + Opus 5, wciąż lider tabeli. Możliwości niemal frontier w cenie środka rynku, z równoległością i audytowalnością jako wyróżnikami — Muse Code, na taryfie standard do pracy nad kodem własnościowym albo Contributor do całej reszty. Self-hosting, fine-tuning albo twarde wymogi suwerenności danych — pas open-weight: DeepSeek V4 za stosunek ceny do wydajności, GLM-5.2 lub MiniMax M3 zależnie od twojego harnessu i wyników ewaluacji. Głębokie zakorzenienie w ekosystemie OpenAI lub Google — Codex i Antigravity CLI pozostają ścieżkami najmniejszego oporu, a stawka 6 USD za output Groka 4.5 czyni Grok Build najtańszym z agentów pasa premium.
A ponieważ Model API jest kompatybilne drop-in z SDK i CLI, których już używasz, przetestowanie Muse przeciwko twojemu obecnemu narzędziu kosztuje jedną zmianę bazowego URL-a. Liczby na tym rynku starzeją się szybko; strona porównawcza trzyma aktualną tabelę wraz z datą ostatniej weryfikacji. Ufaj własnym diffom bardziej niż czyimkolwiek benchmarkom — naszym też.