Muse Spark 1.2 是怎么训练的:协同训练、长时程任务与自我改进循环
"为 Muse Spark 而生"不是营销口号——它描述的是一套训练策略。Meta 发布说明里的三项技术,解释了为什么这个模型和这个 agent 搭配在一起,比各自配一个陌生搭档表现更好。
一次专注编码的升级,规模拉满
Muse Spark 1.2 是对 1.1 的一次直指代码的升级:代码生成、复杂调试、代码库理解,以及端到端的开发者工作流。Meta 大幅扩大了编码任务上的训练算力,同时拓宽了训练环境的多样性——并且保住了模型作为通用 agent 的实力,没有拿它做交换。可度量的结果(与 Muse Code 搭配时):Terminal-Bench 2.1 上 82.9%,DeepSWE 1.1 上 59.3%,与该品类中最强的 agent 处于同一梯队。
技术一:与 harness 协同训练
大多数编码 agent 是一个套着外壳的通用模型:harness 向模型发提示,模型照办,而接缝处的问题以重试和误用工具的形式暴露出来。Meta 的做法不同——让 Muse Spark 1.2 和 Muse Code 一起训练。训练数据中包含了经拒绝采样(rejection sampling)筛选的 harness 轨迹——完整的 agent 运行记录,只保留成功的那些来教模型——外加针对目标、上下文压缩(compaction)和 subagent 的 recipe 优化,以及对 Muse Code 真实工具集的整合。
结果是一个早已见过 harness 将要把它置于何种处境的模型:什么时候该把工作扇出给 subagent、怎样措辞才能让运行时接受一次工具调用、压缩后的上下文长什么样。Meta 的宣称——比通用外壳方案有更好的工具使用、更少的重试、更高质量的输出——正是这套配置的直接推论。
技术二:长时程训练
Muse Spark 1.2 在那些一口气做不完的任务上接受了大量训练:整仓库生成、大型端到端项目、自动化研究。三种习得的能力把这类工作拢在一起——用规划为步骤排序,用目标条件化(goal conditioning)在数百个决策之间保持方向,用上下文压缩在历史超出哪怕 1M token 窗口时留住真正重要的信息。这些不是外挂功能;它们直接以 /plan 和 /goal 的形式出现在产品里,也正是它们让那次 24 小时内核优化成为可能。
技术三:给继任者打分的上一代模型
最有意思的细节是自我改进循环。Meta 用 Muse Spark 1.1 生成高难度的编码环境和指令遵循模板,再让它按候选解满足这些要求的程度打分。打好分的输出成为 1.2 的可扩展训练数据集——上一代模型同时炮制了下一代的考卷和评分标准。Meta 明确把 1.2 在复杂指令遵循上比前代更精准这一点归功于这个循环。
为什么它的意义超出这一次发布
三项技术彼此叠加:协同训练让 harness 本身成为训练信号,长时程训练让更大的任务变得可学习,自我改进则让整条流水线在下一次扩展时更便宜。Meta 表示更大、更强的模型正在路上——而这套机器,大概就是它们将被造出来的方式。完整的评测方法已发布在 Meta 的 research 站点上;想体会这些数字在实践中是什么感觉,从快速上手开始。