Muse Code, 전 라인업과 붙어 보다.
Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2, MiniMax M3와의 가격·성능 비교 — 각 벤더의 공식 가격표와 공개 벤치마크 기준, 2026년 8월 7일 현재.
API 요금 (100만 토큰당)
에이전트 코딩에서 비용의 대부분은 캐시 입력이다 — 리포지토리 컨텍스트가 매 턴 다시 전송되기 때문이다.
코딩 에이전트 성능
에이전트 벤치마크는 하니스 안에서의 모델 성능을 측정한다. 점수는 Meta의 공개 평가와 각 벤더의 자체 발표치 기준이며, 빈칸은 공개된 점수가 없다는 뜻이다.

Terminal-Bench 2.1, 전체 판도
Meta가 공개한 차트는 표만으로는 보이지 않는 맥락을 채워 준다. Muse Code 위의 Muse Spark 1.2(82.9%)는 Claude Code 위의 Claude Opus 5 max(86.7%)에 이은 2위로, Codex 위의 GPT 5.6 Terra max(81.8%), Grok Build 위의 Grok 4.5 high(81.6%), Antigravity CLI 위의 Gemini 3.6 Flash high(78.9%)를 앞선다 — 그리고 전작인 mini-swe-agent 위의 Muse Spark 1.1(76.2%)보다는 무려 6.7포인트 높다.
가격에서는, 서로 다른 두 개의 싸움
Muse 표준 요금($1.25/$4.25)은 Claude Opus 5($5/$25)의 4~6분의 1 수준이면서, 중국계 오픈 웨이트 3사보다는 위에 있다. Contributor 요금($0.10/$0.20)은 입력 단가가 DeepSeek V4 Flash($0.14)보다도 낮다 — 데이터를 공유하는 대가로 얻는 가격이다.
성능에서는, 근소한 차이의 2위
Terminal-Bench 2.1에서 Muse Spark 1.2 + Muse Code(82.9%)는 Claude Opus 5(86.7%)에는 못 미치지만, GPT-5.6 Terra를 얹은 Codex(81.8%)를 근소하게 앞서고, Grok Build(81.6%)와 Antigravity CLI(78.9%)를 뒤에 둔다. DeepSWE 1.1에서는 격차가 더 벌어진다(59.3% vs. 65.0%). 프런티어에 근접한 성능을, 프런티어 가격의 일부만 내고 쓰는 셈이다.
실제 청구서를 가르는 건 캐시 열
에이전트 세션은 매 턴 리포지토리 컨텍스트를 다시 보낸다. Muse Contributor의 캐시 입력 $0.002는 표 전체에서 가장 낮은 수치이고, 근접한 경쟁자는 DeepSeek V4 Flash의 $0.0028뿐이다. 긴 세션에서는 이 행이 겉으로 보이는 입력 단가보다 훨씬 크게 작용한다.
출처: Meta Model API 가격표 및 평가 보고서(research.meta.ai); OpenAI(GPT-5.6, 2026년 7월 30일 인하 이후), Anthropic, xAI(Grok 4.5, 2026년 7월 8일), Google(Gemini 3.6 Flash, 2026년 7월 21일), DeepSeek(V4 Flash 퍼블릭 베타, 2026년 7월 31일), Z.AI, MiniMax의 공식 가격표; 서드파티 가격 추적 사이트, 2026년 8월 7일 확인. 벤치마크 조건은 벤더마다 다르므로 점수는 방향성 참고용으로만 보길 권한다. 가격은 수시로 바뀌니, 예산을 잡기 전에 각 벤더 페이지에서 반드시 확인해야 한다.