АНАЛИЗ· 3 мин чтения

Muse Code против всех: карта «цена — возможности»

Пять серьёзных соперников и две оси, которые решают всё. Где агент Meta реально стоит относительно Claude, Codex, DeepSeek, GLM и MiniMax — и рамка выбора, которая переживёт следующее изменение цен.

#benchmarks#pricing#comparison#agents

Картина по возможностям: уверенное второе место

На Terminal-Bench 2.1 — бенчмарке, ближе всего стоящем к реальной работе терминального агента, — Muse Spark 1.2 в связке с Muse Code набирает 82,9%, уступая Claude Opus 5 от Anthropic с его 86,7% и чуть опережая Codex от OpenAI на GPT-5.6 Terra с 81,8%; следом идут Grok Build от xAI (81,6%) и Antigravity CLI от Google (78,9%). На DeepSWE 1.1, где нагрузка ложится на инженерию масштаба целого репозитория, порядок тот же, но разрыв шире: 59,3% против 65,0% у Opus 5 и 64,8% у Codex. Эти цифры Meta опубликовала сама, включая нелестные для себя ячейки, — что стоит зачесть ей в плюс к доверию.

Честное резюме: Claude Code + Opus 5 — лидер по возможностям; Muse Code и Codex меняются местами в зависимости от теста. Open-weight-претенденты — DeepSeek V4, GLM-5.2, MiniMax M3 — публикуют сильные результаты на смежных бенчмарках (MiniMax заявляет 80%+ на SWE-bench Verified), но у них нет первопартийных агентных харнессов, поэтому прямых агентных сравнений по большей части просто не существует.

Terminal-Bench 2.1 bar chart: Claude Opus 5 86.7%, Muse Spark 1.2 82.9%, GPT 5.6 Terra 81.8%, Grok 4.5 81.6%, Gemini 3.6 Flash 78.9%, Muse Spark 1.1 76.2%

Опубликованный Meta график Terminal-Bench 2.1. За пределами первой тройки поле дополняют Grok 4.5 в Grok Build (81,6%) и Gemini 3.6 Flash в Antigravity CLI (78,9%), а скачок от 1.1 к 1.2 составляет 6,7 пункта.

Картина по ценам: три полосы

В пересчёте на миллион токенов рынок раскладывается по полосам. Премиум: Opus 5 за $5 на входе / $25 на выходе и флагманский GPT-5.6 Sol от OpenAI за $5 / $30. Середина: дефолтный для Codex GPT-5.6 Terra за $2 / $12 (после снижения цен OpenAI 30 июля), Grok 4.5 за $2 / $6, Gemini 3.6 Flash за $1,50 / $7,50, GLM-5.2 за $1,40 / $4,40 и стандартный тариф Muse за $1,25 / $4,25. Бюджет: MiniMax M3 за $0,60 / $2,40, DeepSeek V4 Pro за $0,435 / $0,87 и новый DeepSeek V4 Flash за $0,14 / $0,28. И, наконец, вообще за пределами карты: Muse Contributor за $0,10 / $0,20 — дешевле любого open-weight-варианта, в обмен на разрешение Meta учиться на ваших сессиях.

Для агентных нагрузок по-настоящему накапливается другая цифра — кэшированный вход: контекст репозитория пересылается на каждом ходу, и здесь $0,002 у Muse Contributor и $0,0028 у DeepSeek V4 Flash — отдельная лига. Opus 5 кэширует по $0,50 — в 250 раз дороже Contributor. За месяц длинных сессий колонка кэша и есть ваш счёт; механика разобрана в посте про математику тарифов.

Чего не видно в таблицах цен и баллов

Три структурных различия не помещаются в ячейки. Первое — владение харнессом: Meta, Anthropic, OpenAI, xAI и Google поставляют первопартийных агентов, под которых тюнингуются их модели — Muse Spark 1.2 буквально обучали в связке с Muse Code, — тогда как DeepSeek, GLM и MiniMax ездят на сторонних харнессах вроде OpenCode: отличных, но универсальных. Второе — открытость: китайская тройка публикует веса, так что можно хоститься самостоятельно, дообучать и вовсе уйти от цен API — ничего подобного большая тройка не предлагает. Третье — аудируемость: журнал событий с точным воспроизведением у Muse Code пока уникален как полноценная продуктовая фича, и для команд под регуляторикой он может перевесить разницу в несколько баллов бенчмарка.

Рамка для выбора

Максимум возможностей, цена вторична — Claude Code + Opus 5, по-прежнему лидер табло. Возможности рядом с фронтиром по среднерыночной цене, с параллелизмом и аудируемостью в роли козырей — Muse Code: standard для проприетарной работы, Contributor для всего остального. Самохостинг, дообучение или жёсткие требования к суверенитету данных — open-weight-полоса: DeepSeek V4 по соотношению цена/качество, GLM-5.2 или MiniMax M3 — в зависимости от вашего харнесса и результатов собственных прогонов. Глубокая привязка к экосистеме OpenAI или Google — Codex и Antigravity CLI остаются путями наименьшего сопротивления, а $6 за выходные токены у Grok 4.5 делают Grok Build самым дешёвым из агентов премиальной полосы.

А поскольку Model API встаёт как drop-in замена в SDK и CLI, которыми вы уже пользуетесь, проверка Muse против вашего нынешнего фаворита стоит одной смены базового URL. Цифры на этом рынке стареют быстро; актуальная таблица с датой последней проверки — на странице сравнения. Доверяйте собственным диффам больше, чем чьим угодно бенчмаркам — включая наши.

Читать дальше