事件日志:精确重放,重启无忧
连续工作数小时的 agent,需要一份任何情况下都不会丢失的记忆。Muse Code 的运行时围绕单一的 append-only 日志构建——产品几乎所有的信任特性都由此推导而来。
一份日志,包罗一切
这个设计简单得近乎激进:Muse Code 把每一次模型调用、每一次工具运行、每一次审批、每一处编辑,都追加写入本地事件日志。它不是聊天记录,也不是摘要——而是真实的操作序列,按顺序记录,就在你自己的机器上。Meta 称之为运行时的单一事实来源(single source of truth),这个说法是字面意义上的:关于 agent 做过什么,无论你有什么疑问,答案都在这份日志里。
重启无忧:崩溃不再昂贵
因为日志记录了故障发生前的一切,崩溃不会让会话归零——agent 会从中断处精确恢复,不需要重跑之前的步骤。对于五分钟的小任务,这只是锦上添花。但对于 Muse Code 瞄准的长时程(long-horizon)工作,这是产品能不能用的分水岭:Meta 的内核优化案例研究跑了 1,000 多次工具调用,历时最长达 24 小时。没有人敢在一个“第 23 小时可能凭空蒸发”的运行时上跑 24 小时的任务。
精确重放:逐步回放即审计
让重启变得安全的同一个特性,也让会话变得可审查。muse replay 会一步一步走完一次已记录的会话——每次 subagent 的生成、每次转向、每次取消,都按实际发生的顺序呈现。当 agent 做了一个你看不懂的决定时,你不用审问它;你重放一遍,看着它发生。
完整的 trace 还可以导出。这让一次 agent 会话变成了可以交给同事审查、或附到合规记录里的东西——外部人员无需重跑任何步骤,就能获得足够的上下文来评估 agent 的推理过程。对 AI 生成的改动抱有(合理)怀疑的团队,得到的不只是 diff,而是针对过程本身的 code review 材料。
为什么多 agent 场景下这一点更重要
单个 agent 的历史,翻翻终端回滚缓冲区就能看个大概。但 Muse Code 会运行常驻的后台 agent,并把工作扇出给并行的子 agent——这些活动在设计上就不是让你实时盯着的。“完全可审计”正是让“默认多 agent”变得可以接受的配重:那些 agent 在你没看着的时候做的一切,事后都是透明、可追溯、可重放的。自主性与可审计性成对出现,而不是二选一。
更大的图景
事件溯源(event sourcing)——从 append-only 的事实日志中推导状态——是分布式系统领域几十年前的老思想,如今正悄悄成为 agent 可靠性问题的标准答案。Muse Code 展示的是一个原语能撑起多少产品能力:崩溃恢复、单步调试、会话交接、合规导出,全都是同一份日志戴着不同的帽子。从一个小任务开始,然后重放它——快速上手大约只需五分钟。