Porównanie

Muse Code kontra cała stawka.

Cena i możliwości na tle Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2 i MiniMax M3 — według oficjalnych cenników dostawców i opublikowanych benchmarków, stan na 7 sierpnia 2026 r.

Cennik API, za 1 mln tokenów

To wejście z cache generuje większość kosztów agentowego kodowania — kontekst repozytorium leci od nowa w każdej turze.

MODEL
WEJŚCIE
WEJŚCIE Z CACHE
WYJŚCIE
POLITYKA DANYCH
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
Może posłużyć do ulepszania produktów Meta
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
Nigdy nie trafia do treningu; zerowa retencja przez dział sprzedaży
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
Domyślnie nie trenuje na danych z API
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
Domyślnie nie trenuje na danych z API
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
Domyślnie nie trenuje na danych z API
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
Domyślnie nie trenuje na danych z API
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
Płatny plan nie jest używany do treningu
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
Otwarte wagi; hostowane API podlega warunkom dostawcy
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
Otwarte wagi; hostowane API podlega warunkom dostawcy
GLM-5.2 (Z.AI)
$1.40
$4.40
Otwarte wagi; hostowane API podlega warunkom dostawcy
MiniMax M3
$0.60
$2.40
Otwarte wagi; hostowane API podlega warunkom dostawcy

Możliwości agenta kodującego

Benchmarki agentowe mierzą model wewnątrz jego harnessu. Wyniki pochodzą z opublikowanej ewaluacji Meta i danych podawanych przez samych dostawców; puste komórki oznaczają brak opublikowanego wyniku.

Wykres słupkowy Terminal-Bench 2.1: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Terminal-Bench 2.1, pełna stawka

Opublikowany przez Metę wykres dodaje kontekst, którego tabela nie odda: Muse Spark 1.2 w Muse Code (82.9%) zajmuje drugie miejsce za Claude Opus 5 max w Claude Code (86.7%), przed GPT 5.6 Terra max w Codex (81.8%), Grok 4.5 high w Grok Build (81.6%) i Gemini 3.6 Flash high w Antigravity CLI (78.9%) — a własnego poprzednika, Muse Spark 1.1 w mini-swe-agent (76.2%), wyprzedza o pełne 6.7 punktu.

AGENT / MODEL
TERMINAL-BENCH 2.1
DEEPSWE 1.1
KONTEKST
OTWARTE WAGI
Muse Code + Muse Spark 1.2Meta · model i harness trenowane razem
82.9%
59.3%
1M
Nie (API + agent)
Claude Code + Opus 5Anthropic · własny agent producenta
86.7%
65.0%
1M
Nie (API + agent)
Codex + GPT-5.6 Terra (max)OpenAI · własny agent producenta
81.8%
64.8%
1M
Nie (API + agent)
Grok Build + Grok 4.5 (high)xAI · własny agent producenta
81.6%
500K
Nie (API + agent)
Antigravity CLI + Gemini 3.6 Flash (high)Google · własny agent producenta
78.9%
1M
Nie (API + agent)
DeepSeek V4 Flash / Proprzez OpenCode / harnessy firm trzecich
1M
Tak (MIT)
GLM-5.2Z.AI · przez harnessy firm trzecich
Tak
MiniMax M3przez harnessy firm trzecich · ponad 80% w SWE-bench Verified
Tak

W cenach — dwie różne bitwy

Standardowy plan Muse ($1.25/$4.25) jest 4–6 razy tańszy od Claude Opus 5 ($5/$25), choć plasuje się powyżej chińskiego tria z otwartymi wagami. Poziom Contributor ($0.10/$0.20) schodzi na wejściu nawet poniżej DeepSeek V4 Flash ($0.14) — to cena za dzielenie się swoimi danymi.

W możliwościach — drugie miejsce, o włos

W Terminal-Bench 2.1 duet Muse Spark 1.2 + Muse Code (82.9%) przegrywa z Claude Opus 5 (86.7%) i o włos wyprzedza Codex napędzany GPT-5.6 Terra (81.8%); Grok Build (81.6%) i Antigravity CLI (78.9%) zostają z tyłu. W DeepSWE 1.1 różnica jest większa (59.3% vs. 65.0%). Niemal poziom frontier, za ułamek ceny frontier.

O prawdziwym rachunku decyduje kolumna cache

Sesje agenta przesyłają kontekst repozytorium od nowa w każdej turze. $0.002 za wejście z cache w planie Muse Contributor to najniższa liczba w tabeli; jedynym bliskim rywalem jest DeepSeek V4 Flash z $0.0028. Przy długich sesjach ten wiersz waży więcej niż cena wejścia z nagłówka cennika.

Źródła: cennik Meta Model API i raport ewaluacyjny (research.meta.ai); opublikowane cenniki OpenAI (GPT-5.6, po obniżce z 30 lipca 2026 r.), Anthropic, xAI (Grok 4.5, 8 lipca 2026 r.), Google (Gemini 3.6 Flash, 21 lipca 2026 r.), DeepSeek (publiczna beta V4 Flash, 31 lipca 2026 r.), Z.AI i MiniMax; zewnętrzne trackery cen, sprawdzone 7 sierpnia 2026 r. Warunki benchmarków różnią się między dostawcami — traktuj wyniki jako orientacyjne. Ceny się zmieniają; zanim zaplanujesz budżet, zweryfikuj je na stronie każdego dostawcy.