ИССЛЕДОВАНИЕ· 2 мин чтения

Как обучали Muse Spark 1.2: связка с харнессом, длинный горизонт и цикл самоулучшения

«Built for Muse Spark» — не маркетинговый штамп, а описание стратегии обучения. Три техники из релизных заметок Meta объясняют, почему модель и агент вместе работают лучше, чем каждый из них — с чужаком.

#muse-spark#training#co-training#self-improvement

Апдейт с прицелом на код и серьёзно нарощенным масштабом

Muse Spark 1.2 — это обновление 1.1, нацеленное прямиком на код: генерация, сложная отладка, понимание кодовых баз и сквозные девелоперские воркфлоу. Meta существенно нарастила обучающие вычисления на кодинговых задачах и расширила разнообразие обучающих сред — при этом не разменяла, а сохранила общеагентную силу модели. Измеримый итог в паре с Muse Code: 82,9% на Terminal-Bench 2.1 и 59,3% на DeepSWE 1.1 — на уровне сильнейших агентов категории.

Техника первая: обучение в связке с харнессом

Большинство кодинг-агентов — это универсальная модель в накинутой сверху обёртке: харнесс промптит модель, модель подчиняется, а швы вылезают наружу ретраями и криво использованными инструментами. Meta вместо этого обучала Muse Spark 1.2 вместе с Muse Code. В обучающую смесь вошли отобранные rejection sampling’ом траектории харнесса — полные прогоны агента, отфильтрованные так, чтобы модель учили только успешные, — плюс оптимизация рецептов для целей, компактизации и сабагентов и интеграция реального набора инструментов Muse Code.

Следствие — модель, которая уже видела ситуации, в которые её поставит харнесс: когда раздать работу сабагенту, как сформулировать вызов инструмента, который примет рантайм, как выглядит компактизированный контекст. Заявление Meta — лучшее обращение с инструментами, меньше ретраев и более качественный результат, чем у универсальной обёртки, — прямое следствие такой схемы.

Техника вторая: обучение на длинном горизонте

Muse Spark 1.2 обстоятельно тренировали на задачах, которые не помещаются в один присест: генерация целых репозиториев, большие сквозные проекты, автоматические исследования. Такую работу скрепляют три выученных навыка: планирование — чтобы выстроить последовательность шагов, кондиционирование на цель — чтобы держать курс через сотни решений, и компактизация контекста — чтобы сохранять важное, когда история перерастает даже окно в 1M токенов. Это не прикрученные сбоку фичи: в продукте они всплывают напрямую как /plan и /goal, и именно они сделали возможным 24-часовой прогон на ядрах.

Техника третья: модель, принимавшая экзамен у преемницы

Самая любопытная деталь — цикл самоулучшения. Meta использовала Muse Spark 1.1, чтобы генерировать сложные кодинговые окружения и шаблоны на следование инструкциям, а затем поручала ей же оценивать решения-кандидаты: насколько хорошо те удовлетворяют требованиям. Оценённый выход стал масштабируемым обучающим датасетом для 1.2 — предыдущее поколение изготовило и экзамен, и критерии проверки для следующего. Именно этому циклу Meta приписывает то, что 1.2 следует сложным инструкциям точнее предшественницы.

Почему это важно шире одного релиза

Каждая техника усиливает остальные: обучение в связке превращает харнесс в обучающий сигнал, длинный горизонт делает выучиваемыми более крупные задачи, а самоулучшение удешевляет масштабирование всего конвейера в следующий раз. Meta говорит, что более крупные и способные модели уже в пути, — и, судя по всему, строить их будут именно этой машинерией. Полная методология оценки опубликована на исследовательском сайте Meta; а чтобы понять, как эти цифры ощущаются на практике, начните с квикстарта.

Читать дальше