비교

Muse Code, 전 라인업과 붙어 보다.

Claude Opus 5, OpenAI Codex, DeepSeek V4, GLM-5.2, MiniMax M3와의 가격·성능 비교 — 각 벤더의 공식 가격표와 공개 벤치마크 기준, 2026년 8월 7일 현재.

API 요금 (100만 토큰당)

에이전트 코딩에서 비용의 대부분은 캐시 입력이다 — 리포지토리 컨텍스트가 매 턴 다시 전송되기 때문이다.

모델
입력
캐시 입력
출력
데이터 정책
muse-spark-1.2-contributorMETA
$0.10
$0.002
$0.20
Meta 제품 개선에 사용될 수 있음
muse-spark-1.2 (standard)META
$1.25
$0.15
$4.25
학습에 일절 미사용, 영업팀 통해 제로 보존 계약 가능
Claude Opus 5 (Anthropic)
$5.00
$0.50
$25.00
기본적으로 API 데이터를 학습에 미사용
GPT-5.6 Sol (OpenAI)
$5.00
$0.50
$30.00
기본적으로 API 데이터를 학습에 미사용
GPT-5.6 Terra (OpenAI · Codex default)
$2.00
$0.20
$12.00
기본적으로 API 데이터를 학습에 미사용
Grok 4.5 (xAI)
$2.00
$0.50
$6.00
기본적으로 API 데이터를 학습에 미사용
Gemini 3.6 Flash (Google)
$1.50
$0.15
$7.50
유료 플랜은 학습에 미사용
DeepSeek V4 Flash
$0.14
$0.0028
$0.28
오픈 웨이트, 호스팅 API에는 벤더 약관 적용
DeepSeek V4 Pro
$0.435
$0.0036
$0.87
오픈 웨이트, 호스팅 API에는 벤더 약관 적용
GLM-5.2 (Z.AI)
$1.40
$4.40
오픈 웨이트, 호스팅 API에는 벤더 약관 적용
MiniMax M3
$0.60
$2.40
오픈 웨이트, 호스팅 API에는 벤더 약관 적용

코딩 에이전트 성능

에이전트 벤치마크는 하니스 안에서의 모델 성능을 측정한다. 점수는 Meta의 공개 평가와 각 벤더의 자체 발표치 기준이며, 빈칸은 공개된 점수가 없다는 뜻이다.

Terminal-Bench 2.1 막대 그래프: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Terminal-Bench 2.1, 전체 판도

Meta가 공개한 차트는 표만으로는 보이지 않는 맥락을 채워 준다. Muse Code 위의 Muse Spark 1.2(82.9%)는 Claude Code 위의 Claude Opus 5 max(86.7%)에 이은 2위로, Codex 위의 GPT 5.6 Terra max(81.8%), Grok Build 위의 Grok 4.5 high(81.6%), Antigravity CLI 위의 Gemini 3.6 Flash high(78.9%)를 앞선다 — 그리고 전작인 mini-swe-agent 위의 Muse Spark 1.1(76.2%)보다는 무려 6.7포인트 높다.

에이전트 / 모델
TERMINAL-BENCH 2.1
DEEPSWE 1.1
컨텍스트
오픈 웨이트
Muse Code + Muse Spark 1.2Meta · 모델과 하니스를 함께 학습
82.9%
59.3%
1M
아니요 (API + 에이전트)
Claude Code + Opus 5Anthropic · 자사 에이전트
86.7%
65.0%
1M
아니요 (API + 에이전트)
Codex + GPT-5.6 Terra (max)OpenAI · 자사 에이전트
81.8%
64.8%
1M
아니요 (API + 에이전트)
Grok Build + Grok 4.5 (high)xAI · 자사 에이전트
81.6%
500K
아니요 (API + 에이전트)
Antigravity CLI + Gemini 3.6 Flash (high)Google · 자사 에이전트
78.9%
1M
아니요 (API + 에이전트)
DeepSeek V4 Flash / ProOpenCode 등 서드파티 하니스 경유
1M
예 (MIT)
GLM-5.2Z.AI · 서드파티 하니스 경유
MiniMax M3서드파티 하니스 경유 · SWE-bench Verified 80% 이상

가격에서는, 서로 다른 두 개의 싸움

Muse 표준 요금($1.25/$4.25)은 Claude Opus 5($5/$25)의 4~6분의 1 수준이면서, 중국계 오픈 웨이트 3사보다는 위에 있다. Contributor 요금($0.10/$0.20)은 입력 단가가 DeepSeek V4 Flash($0.14)보다도 낮다 — 데이터를 공유하는 대가로 얻는 가격이다.

성능에서는, 근소한 차이의 2위

Terminal-Bench 2.1에서 Muse Spark 1.2 + Muse Code(82.9%)는 Claude Opus 5(86.7%)에는 못 미치지만, GPT-5.6 Terra를 얹은 Codex(81.8%)를 근소하게 앞서고, Grok Build(81.6%)와 Antigravity CLI(78.9%)를 뒤에 둔다. DeepSWE 1.1에서는 격차가 더 벌어진다(59.3% vs. 65.0%). 프런티어에 근접한 성능을, 프런티어 가격의 일부만 내고 쓰는 셈이다.

실제 청구서를 가르는 건 캐시 열

에이전트 세션은 매 턴 리포지토리 컨텍스트를 다시 보낸다. Muse Contributor의 캐시 입력 $0.002는 표 전체에서 가장 낮은 수치이고, 근접한 경쟁자는 DeepSeek V4 Flash의 $0.0028뿐이다. 긴 세션에서는 이 행이 겉으로 보이는 입력 단가보다 훨씬 크게 작용한다.

출처: Meta Model API 가격표 및 평가 보고서(research.meta.ai); OpenAI(GPT-5.6, 2026년 7월 30일 인하 이후), Anthropic, xAI(Grok 4.5, 2026년 7월 8일), Google(Gemini 3.6 Flash, 2026년 7월 21일), DeepSeek(V4 Flash 퍼블릭 베타, 2026년 7월 31일), Z.AI, MiniMax의 공식 가격표; 서드파티 가격 추적 사이트, 2026년 8월 7일 확인. 벤치마크 조건은 벤더마다 다르므로 점수는 방향성 참고용으로만 보길 권한다. 가격은 수시로 바뀌니, 예산을 잡기 전에 각 벤더 페이지에서 반드시 확인해야 한다.