快速上手

幾分鐘內就能讓 Muse Code 跑起來。

Muse Code 目前為 macOS 與 Linux 提供 Beta 版。它能在大型儲存庫中承接複雜的軟體工程任務 —— 規劃變更、撰寫程式碼、驗證結果 —— 全部在你的終端機裡完成。

1. 安裝

一行指令就能裝好 CLI:

$curl -fsSL https://dev.meta.ai/install.sh | bash

指令碼會把 muse 執行檔放進 PATH —— 用 muse --version 驗證。想先檢視指令碼內容?用 -o install.sh 下載、審閱後再執行。

2. 驗證身分

第一次執行會開啟瀏覽器,在 dev.meta.ai 以 Meta 開發者帳號完成驗證。憑證會快取在本機 —— 之後的工作階段不必重新驗證。存取與計費都透過 Meta Model API。

非互動式執行。 在 CI、指令碼與 headless 機器上,請改用 API key 取代瀏覽器流程:到 Model API 儀表板建立(API keys → Create API key),並設定為環境變數 MODEL_API_KEY

3. 執行你的第一個任務

完成驗證後,到任何專案目錄都能直接開工:

$ cd my-repo$ muse

用白話描述你想要的結果。好的第一個任務要小而可驗證 —— 「幫 parseDate 補上缺少的測試並確認通過」—— 你會看到 worker 草擬修改、reviewer 提出批評,測試實際跑起來。

有兩個成本開關值得從第一天就認識:Muse Spark 是推理模型 —— 回答前會先思考,思考的 token 以輸出計費 —— 用 /effort 可以針對每個任務調高或調低思考量。另外,語氣、格式等固定規則可以放進 system message,不必每次提示都重複一遍。

非同步背景代理

Muse Code 以一個簡單的代理迴圈,搭配一組強化主代理能力的非同步背景代理來運作。這些專責代理在整個工作階段持續存活,而不是每個任務才臨時產生,避免了重複蒐集資訊。它們會自主推進後續步驟,並自行決定何時回報主代理 —— 這種常駐特性降低了延遲,也減少困難多步驟任務所需的人為介入。

代理扇出與 git worktree

當一項工作拆成多個任務時,它們會自動扇出給各自獨立的代理:父代理為每個任務產生一個具寫入權限的子代理,每個子代理擁有自己的 git worktree —— 平行執行的子代理絕不會在同一批檔案上互相衝突,你的工作副本也始終保持乾淨。

事件日誌

Muse Code 使用本機事件日誌,每一次模型呼叫、工具執行、核准與編輯都會附加進去。這個單一事實來源讓執行期可以精確重播、安全重啟:當機後,代理會從停下的地方精準續跑,長時間任務不會被故障打亂。每一次子代理的產生、引導與取消都可觀測 —— muse replay 能逐步重播工作階段,完整軌跡也可匯出供交接或稽核使用。

內建技能與指令

Muse Code 內建多個預設技能 —— 丟進一個粗略的想法,就能拿到一個被反覆拷問、驗證到位的功能:

/plan在動任何程式碼之前,先把任務轉成需要核准的計畫
/grill對計畫持續進行壓力測試,直到它站得住腳
/goal朝指定目標持續推進 —— 你最初想要的,才是最後合併進去的
/model切換底層模型 —— 例如換成以標準 Model API 價格計費的 muse-spark-1.2
/effort調高或調低推理量 —— 思考 token 以輸出計費,深度推理留給難題
muse replay逐步重播工作階段的事件日誌;完整軌跡可匯出供交接或稽核使用

Muse Spark 1.2

Muse Spark 1.2 是 Muse Spark 1.1 針對程式開發的更新版本,在程式碼產生、複雜除錯、程式庫理解與端對端開發工作流程上都有進步 —— 程式開發任務的訓練運算量大幅擴增,環境多樣性也同步擴大。三個突出之處:

與 Muse Code 共同訓練
與執行框架(harness)本身一起訓練 —— 經拒絕取樣的 harness 軌跡、針對目標/壓縮(compaction)/子代理的訓練配方最佳化,以及 Muse Code 工具組的整合 —— 帶來更好的工具使用、更少的重試,以及比一般包裝層更高品質的輸出。
長程任務
在長程程式開發上大量訓練:整個儲存庫的生成、大型端對端專案、自動化研究。它會規劃工作順序、以目標條件化維持方向,並壓縮上下文以持續推進。
自我改進
Muse Spark 1.1 產生高難度的程式開發環境與指令遵循範本,再為候選解評分 —— 這個可擴展的訓練迴圈,讓 1.2 遵循複雜指令比前一代更精準。

基準測試(搭配 Muse Code):Terminal-Bench 2.1 · 82.9% — DeepSWE 1.1 · 59.3%。完整方法請見 research.meta.ai 上 Meta 的評測報告。

案例研究:kernel 最佳化

Meta 測試了模型在 1,000 次以上工具呼叫(最長 24 小時)中反覆最佳化 GPU kernel 的能力。在 Muse Code 的代理環境裡,模型撰寫、編譯、剖析並逐步提升 kernel 效能,以 NVIDIA Hopper GPU 的 KDA 與 MLA kernel 為基準。在禁止包裝第三方 kernel 函式庫的前提下,它直接以 Triton 實作演算法 —— 而且持續找出遠優於基準線的改進。

Meta Model API

Muse Code 背後的模型也能直接取用 —— Muse Spark 1.2 同步上線 Muse Code、Meta Model API 與 OpenRouter,全球開放範圍也隨之擴大。API 與 OpenAI SDK、Anthropic SDK,以及 OpenCode、Claude Code 等代理 CLI 隨插即用:把用戶端指向新的 base URL,其餘程式碼原封不動。上下文視窗為 1,048,576 個 token。

# export MODEL_API_KEY="LLM|{numeric_id}|{secret}"client = OpenAI( base_url="https://api.meta.ai/v1", api_key=os.environ["MODEL_API_KEY"], ) response = client.chat.completions.create( model="muse-spark-1.2", messages=[{"role": "user", "content": "Hello, world!"}], )

Cookbook

複製下來第一次就能跑的範例 —— 每一份都解決一個聚焦的問題、附上能動的程式碼,並指出下一步。共三大區塊,外加 Muse Code 核心模式的專屬範例。瀏覽全部 28 份範例 →

API 基礎 · 10 份範例
逐一驗證每個基本功能:chat completions、串流、工具呼叫、結構化輸出、prompt caching、推理 token、視覺輸入、長上下文、錯誤處理,以及附行內引用的 search grounding。
代理模式 · 5 份範例
把模型變成代理的那些迴圈:感知-決策-行動迴圈、推理與工具呼叫交錯進行、多輪上下文管理,以及附驗證的原地編輯。
應用實例 · 13 份範例
端對端:以瀏覽器驗證的網頁設計與遊戲開發、透過共享看板協調的四角色多代理產品工作室、跑在 OpenCode 上的自主 GitHub Actions 機器人、Linux 與 macOS 的電腦操作等。
Muse Code 範例
代理扇出 —— 把一件大工作拆給隔離 worktree 裡的子代理;內建技能 —— 丟進粗略想法、拿出驗證到位的功能;目標追蹤 —— 讓代理緊盯任務,直到合併你想要的成果。