リサーチ· 5 分で読めます

Muse Spark 1.2 はこう訓練された:共同訓練・長時間タスク・自己改善ループ

「Built for Muse Spark」はマーケティング用語ではなく、訓練戦略の記述です。Meta のリリースノートにある 3 つの手法が、モデルとエージェントが「他人同士」より一緒のほうが強い理由を説明します。

#muse-spark#training#co-training#self-improvement

コード特化アップデートを、計算量で殴る

Muse Spark 1.2 は 1.1 のアップデートで、狙いはコードに一直線です。コード生成、複雑なデバッグ、コードベース理解、そしてエンドツーエンドの開発者ワークフロー。Meta はコーディングタスクへの訓練計算量を大幅にスケールさせつつ、訓練環境の多様性を広げました。しかも汎用エージェントとしての強さを引き換えに差し出すのではなく、そのまま維持しています。測定可能な成果は、Muse Code と組み合わせたときの Terminal-Bench 2.1 で 82.9%、DeepSWE 1.1 で 59.3%。カテゴリ最強クラスのエージェントと渡り合う数字です。

手法その 1:ハーネスとの共同訓練

大半のコーディングエージェントは「汎用モデルにラッパーを着せたもの」です。ハーネスがモデルにプロンプトを出し、モデルが応じる。その継ぎ目は、リトライやツールの誤用として表に出てきます。Meta はそうではなく、Muse Spark 1.2 を Muse Code と一緒に訓練しました。訓練データには、リジェクションサンプリングされたハーネス軌跡、つまり成功した実行だけを選別した完全なエージェントランが含まれ、さらにゴール・コンパクション・サブエージェントに関するレシピの最適化と、Muse Code の実際のツールセットの統合が行われています。

その帰結として、モデルはハーネスが自分を置くであろう状況をすでに見てきています。いつサブエージェントに仕事をファンアウトすべきか、ランタイムが受理するツールコールをどう書くか、コンパクション後のコンテキストがどんな見た目か。Meta の主張、すなわち「汎用ラッパーよりツール使用が上手く、リトライが少なく、出力品質が高い」は、このセットアップから直接導かれる予測です。

手法その 2:長時間タスクの訓練

Muse Spark 1.2 は、一度の作業では終わらないタスクで徹底的に訓練されました。リポジトリ丸ごとの生成、大規模なエンドツーエンドプロジェクト、自動リサーチ。こうした仕事をまとめ上げるのは、学習によって獲得された 3 つの能力です。ステップを順序立てるプランニング、数百の意思決定を越えて方向を保つゴールコンディショニング、そして履歴が 1M トークンのウィンドウすら超えたときに重要な情報だけを残すコンテキストコンパクション。これらは後付けの機能ではありません。プロダクトでは /plan と /goal として直接姿を現しますし、24 時間のカーネルランを可能にしたのもこれらです。

手法その 3:後継モデルを採点した先代モデル

最も面白いディテールが自己改善ループです。Meta は Muse Spark 1.1 に、難易度の高いコーディング環境と指示追従テンプレートを生成させ、さらに候補解がその要件をどれだけ満たしているかを採点させました。採点済みの出力は 1.2 のためのスケーラブルな訓練データセットになります。前の世代が、次の世代のための試験問題と採点基準の両方を製造したわけです。1.2 が先代より複雑な指示を正確に守れるようになったのは、まさにこのループのおかげだと Meta は明言しています。

1 リリースを超えて意味を持つ理由

3 つの手法は互いを増幅します。共同訓練はハーネスを訓練シグナルに変え、長時間訓練はより大きなタスクを学習可能にし、自己改善はパイプライン全体の次回のスケールコストを下げる。Meta は「より大きく高性能なモデルを準備中」と述べていますが、それを作る機構がおそらくこれです。評価手法の全容は Meta のリサーチサイトで公開されています。数字が実際にどう感じられるかは、まずクイックスタートから試してみてください。

続けて読む