Muse Spark 1.2 是怎麼練成的:共同訓練、長時程任務,還有一個自我改進迴圈
「為 Muse Spark 打造」不是行銷話術,而是一套訓練策略的描述。Meta 版本說明裡的三項技術,解釋了為什麼模型和 agent 湊在一起,比各自搭配陌生對象都要強。
一次火力全開的程式碼特化更新
Muse Spark 1.2 是 1.1 的更新版,火力全數對準程式碼:程式碼生成、複雜除錯、codebase 理解,以及端到端的開發者工作流程。Meta 大幅擴增了程式碼任務上的訓練運算量,同時拓寬訓練環境的多樣性——而且保住了模型的通用 agent 能力,沒有拿它去換。搭配 Muse Code 之後可量測的成果:Terminal-Bench 2.1 拿下 82.9%、DeepSWE 1.1 拿下 59.3%,足以和這個類別裡最強的 agent 掰手腕。
技術一:和 harness 共同訓練
大多數 coding agent 都是「泛用模型套一層包裝」:harness 下 prompt、模型照辦,接縫處就以重試和誤用工具的形式露出來。Meta 反其道而行,讓 Muse Spark 1.2 和 Muse Code 一起訓練。訓練資料混入了經拒絕採樣(rejection sampling)篩選的 harness 軌跡——完整的 agent 執行紀錄,過濾到只留成功案例來教模型——外加針對目標、脈絡壓縮、subagent 的配方最佳化,以及 Muse Code 實際工具集的整合。
結果就是一個早已見過 harness 會把它放進哪些情境的模型:什麼時候該把工作分派給 subagent、工具呼叫要怎麼措辭執行環境才會接受、壓縮過的脈絡長什麼樣子。Meta 的宣稱——工具使用更精準、重試更少、產出品質高於泛用包裝——正是這套設定的直接推論。
技術二:長時程訓練
Muse Spark 1.2 大量訓練於那些一口氣做不完的任務:整個儲存庫的生成、大型端到端專案、自動化研究。三種習得的能力把這類工作撐住——規劃(planning)負責排列步驟順序、目標制約(goal conditioning)在上百個決策之間維持方向、脈絡壓縮(context compaction)在歷史紀錄連 1M token 視窗都塞不下時留住重點。這些不是事後外掛的功能;它們直接以 /plan 和 /goal 的形式出現在產品裡,也是 24 小時 kernel 實驗得以成立的原因。
技術三:讓上一代模型幫下一代改考卷
最有意思的細節是那個自我改進迴圈。Meta 用 Muse Spark 1.1 生成高難度的程式任務環境和指令遵循模板,再讓它依據這些要求替候選解法評分。評分後的產出成為 1.2 可規模化的訓練資料集——上一代模型同時製造了下一代的考題和評分標準。Meta 明確把 1.2 在複雜指令遵循上比前代更精準這件事,歸功於這個迴圈。
為什麼影響不只這一版
三項技術彼此複利:共同訓練把 harness 變成訓練訊號、長時程訓練讓更大的任務變得可學習、自我改進讓整條管線下次擴張時更便宜。Meta 說更大、更強的模型正在路上——想必就是用這套機器造出來的。完整的評測方法論發表在 Meta 的研究網站上;想親自感受這些數字在實務上的手感,就從快速上手指南開始。