把 mp4 直接丟進終端機:多模態寫程式的實際演示
上線 demo 裡最低調卻最激進的一個,講的不是速度也不是平行化,而是一支影片檔變成了一個網站。
那個 demo
在 Meta 的上線資料裡,使用者把一支度假屋的環景走拍影片,以 mp4 檔的形式丟進終端機。Muse Code 解讀影片內容——房間、採光、環境——然後產出一個視覺豐富的物件行銷兼訂房頁面。沒有需求文件、沒有文案撰寫、沒有素材清單。影片本身就是規格。
這和一般的視覺輸入支援哪裡不同
能吃圖片的模型很多;cookbook 的視覺輸入範例講的正是這件事,「截圖丟進去、bug 修出來」也早就是大家熟悉的工作流程。這個 demo 展示的是更進一步的東西:把非結構化、與程式碼無關的媒體,當成一整項工程任務的主要輸入,放進 agent 迴圈裡跑。模型得先萃取意圖(這是一間需要自我推銷的出租物件)、推導內容(頁面該說什麼、秀什麼),然後從這份理解出發,執行一次正常的多頁面開發——規劃、寫程式、驗證。
這把傳統管線整個折疊了。從「這是房子的影片」到「這是訂房網站」的傳統路徑,要經過文案、設計師、開發者三站,每一站都在轉譯上一站的產出。多模態 agent 把這條轉譯鏈全部收進內部處理。
放進真實工作流程會長什麼樣
度假屋頁面是行銷用的 demo,但這個模式可以推廣到工程師手上真正有的輸入:一段用文字很難描述清楚的 bug 螢幕錄影;白板上架構草圖的照片;一段要研究的競品操作流程;一張匯出成圖片的設計稿。凡是任務最真實的描述是視覺而非文字的場合,把它硬打成一段文字近似值塞進 prompt,就是有損壓縮。直接把原始素材交出去,就不是。
cookbook 的感知(perception)類範例在較小尺度上勾勒了同一個方向——圖表分析從圖片中抽取結構化資料、感知定位(perception grounding)把互動式標註釘到照片的像素座標上。mp4 demo 就是這些基本元件組合起來、推到極致的樣子。
誠實的但書
上線 demo 展示的是最佳情況。這種深度的影片解讀非常燒 token——別忘了輸入計價對媒體檔同樣適用——而且「影片就是規格」在交付物形態很常見(例如物件頁面)時效果最好。但作為方向宣示,它毫不含糊:coding agent 的輸入端正在從文字,拓寬到任何最能承載你意圖的素材。想看看這個基本元件,可以試試 cookbook 裡的視覺輸入範例;快速上手指南則帶你打開一個可以直接丟檔案進去的終端機。