분석· 5 분 소요

Muse Code vs 경쟁 진영: 가격-성능 지도로 그려본 현재 판세

만만찮은 경쟁자 다섯, 그리고 정말 중요한 축 두 개. Claude, Codex, DeepSeek, GLM, MiniMax 사이에서 Meta의 에이전트가 실제로 어디에 서 있는지, 그리고 다음 가격 인하에도 살아남을 의사결정 프레임워크까지.

#benchmarks#pricing#comparison#agents

성능 판도: 아쉬운 2위

실제 터미널 에이전트 업무에 가장 가까운 벤치마크인 Terminal-Bench 2.1에서, Muse Code 위에서 구동한 Muse Spark 1.2는 82.9%를 기록했습니다. Anthropic의 Claude Opus 5(86.7%)에 뒤지고, GPT-5.6 Terra를 돌리는 OpenAI Codex(81.8%)를 근소하게 앞서는 성적입니다. 그 뒤를 xAI의 Grok Build(81.6%)와 Google의 Antigravity CLI(78.9%)가 바짝 따릅니다. 저장소 규모의 소프트웨어 엔지니어링을 시험하는 DeepSWE 1.1에서는 순서는 같지만 격차가 벌어집니다. Opus 5의 65.0%, Codex의 64.8%에 비해 59.3%입니다. 이 숫자들은 불리한 칸까지 포함해 Meta가 직접 공개했습니다. 신뢰도 점수를 조금 얹어줄 만한 대목입니다.

정직하게 요약하면 이렇습니다. Claude Code + Opus 5가 성능 리더이고, Muse Code와 Codex는 테스트에 따라 자리를 바꿉니다. 오픈 웨이트 도전자들, 즉 DeepSeek V4, GLM-5.2, MiniMax M3는 인접 벤치마크에서 강한 결과를 발표하지만(MiniMax는 SWE-bench Verified 80%+를 보고합니다) 퍼스트파티 에이전트 하네스가 없어서, 직접적인 에이전트 벤치마크 비교는 대부분 존재하지 않습니다.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Meta가 공개한 Terminal-Bench 2.1 차트. 상위 3개 외에 Grok Build의 Grok 4.5(81.6%)와 Antigravity CLI의 Gemini 3.6 Flash(78.9%)가 판을 채우고 있으며, 1.1 → 1.2 상승 폭은 6.7포인트입니다.

가격 판도: 3개 차선

토큰 100만 개 기준으로 보면 시장은 차선별로 정리됩니다. 프리미엄 차선에는 입력 $5 / 출력 $25의 Opus 5와 $5 / $30의 OpenAI 플래그십 GPT-5.6 Sol이 있습니다. 미드 차선에는 Codex 기본 모델 GPT-5.6 Terra가 $2 / $12(OpenAI의 7월 30일 가격 인하 이후), Grok 4.5가 $2 / $6, Gemini 3.6 Flash가 $1.50 / $7.50, GLM-5.2가 $1.40 / $4.40, 그리고 Muse 스탠다드가 $1.25 / $4.25입니다. 버짓 차선에는 MiniMax M3가 $0.60 / $2.40, DeepSeek V4 Pro가 $0.435 / $0.87, 신형 DeepSeek V4 Flash가 $0.14 / $0.28. 그리고 지도 밖에 완전히 벗어난 곳에 Muse 컨트리뷰터가 있습니다. $0.10 / $0.20으로 모든 오픈 웨이트 옵션보다 저렴한데, 그 대가는 Meta가 여러분의 세션에서 학습하도록 허용하는 것입니다.

에이전트 워크로드에서 복리로 불어나는 숫자는 캐시된 입력(cached input)입니다. 저장소 컨텍스트는 매 턴 다시 전송되는데, Muse 컨트리뷰터의 캐시 요금 $0.002와 DeepSeek V4 Flash의 $0.0028은 독보적인 클래스입니다. Opus 5의 캐시 요금은 $0.50으로, 컨트리뷰터의 250배입니다. 긴 세션이 이어지는 한 달을 놓고 보면 캐시 열이 청구서입니다. 자세한 계산은 티어 계산 포스트에 있습니다.

가격표와 점수표가 놓치는 것

표의 칸에 들어가지 않는 구조적 차이가 세 가지 있습니다. 첫째, 하네스 소유권입니다. Meta, Anthropic, OpenAI, xAI, Google은 모두 자사 모델에 맞춰 튜닝된 퍼스트파티 에이전트를 배포합니다. Muse Spark 1.2는 말 그대로 Muse Code와 공동 훈련되었습니다. 반면 DeepSeek, GLM, MiniMax는 OpenCode 같은 서드파티 하네스에 올라탑니다. 훌륭하지만 범용입니다. 둘째, 개방성입니다. 중국 3사는 웨이트를 공개하므로 셀프 호스팅, 파인튜닝, API 요금 탈출이 가능합니다. 빅3 중 누구도 제공하지 않는 선택지입니다. 셋째, 감사 가능성입니다. Muse Code의 정확 재생 이벤트 로그는 현재 정식 제품 기능으로서는 유일하며, 규제 산업의 팀에게는 한 자릿수 벤치마크 격차보다 더 무거울 수 있습니다.

의사결정 프레임워크

최대 성능이 우선이고 가격은 부차적이라면 Claude Code + Opus 5. 여전히 점수판의 리더입니다. 프런티어에 근접한 성능을 중간 가격에, 병렬성과 감사 가능성을 차별점으로 원한다면 Muse Code. 사유 코드는 스탠다드로, 나머지는 컨트리뷰터로 돌리면 됩니다. 셀프 호스팅, 파인튜닝, 엄격한 데이터 주권 요건이 있다면 오픈 웨이트 차선입니다. 가성비는 DeepSeek V4, 하네스와 자체 평가 결과에 따라 GLM-5.2나 MiniMax M3. OpenAI 또는 Google 생태계에 깊이 투자한 상태라면 Codex와 Antigravity CLI가 여전히 저항이 가장 적은 길이고, Grok 4.5의 출력 $6 요금은 Grok Build를 프리미엄 차선 에이전트 중 가장 저렴하게 만듭니다.

그리고 Model API가 이미 쓰고 있는 SDK·CLI에 그대로 꽂히기 때문에, 현재 쓰는 에이전트와 Muse를 비교 테스트하는 비용은 베이스 URL 한 줄 변경입니다. 이 시장의 숫자는 빨리 낡습니다. 비교 페이지에 최신 표와 마지막 확인 날짜가 있습니다. 누구의 벤치마크보다, 저희 것까지 포함해서, 여러분 자신의 diff를 믿으십시오.

계속 읽기