把 mp4 拖进终端:多模态编程的现场演示
发布会上最安静也最激进的演示,与速度或并行无关。它是一个视频文件变成了一个网站。
那个演示
在 Meta 的发布材料里,一位用户把一段度假屋的穿行漫游视频以 mp4 文件的形式拖进终端。Muse Code 解读了这段视频——房间、光线、环境——然后为这处房产生成了一个视觉上相当丰富的营销与预订页面。没有需求简报,没有文案环节,没有素材清单。视频就是规格说明。
这和普通的视觉支持有何不同
能接受图片的模型很多;cookbook 的 vision-input 配方讲的正是这个,“截图转 bug 修复”也早已是熟悉的工作流。这个演示展示的是更进一步的东西:把非结构化的、与代码无关的媒体,用作一整个工程任务的主要输入,并且发生在 agent 循环内部。模型必须提取意图(这是一处需要把自己卖出去的出租房产)、推导内容(页面该说什么、展示什么),然后基于这份理解执行一次常规的多页面构建——规划、编码、验证。
这压缩了通常的流水线。从“这是房子的视频”到“这是预订网站”的传统路径,要经过文案、设计师和开发者三道手,每一道都在翻译上一步的产出。而多模态 agent 把这条翻译链在内部跑完。
它在真实工作流中的位置
度假屋页面是个营销演示,但这个模式可以推广到工程师手头真正会有的输入:一段难以用文字描述的 bug 的屏幕录像;一张白板上架构草图的照片;一段用来研究的竞品操作演示;一张导出为图片的设计稿。凡是任务最真实的描述是视觉而非语言的地方,把一段散文式的近似敲进提示词里就是有损压缩。直接把原始产物交出去则不是。
Cookbook 的感知类配方在更小尺度上勾勒了同一个方向——图表分析从图片中提取结构化数据,感知定位(perception grounding)把可交互标注钉在照片的像素位置上。mp4 演示就是这些基元的组合,并被推到了它们的终局。
诚实的但书
发布演示是最理想的情况。这种深度的视频解读会烧掉可观的 token——别忘了输入定价同样适用于媒体——而且“视频即规格”在交付物形态足够常规时效果最好,比如一个房产页面。但作为方向宣言,它毫不含糊:编程 agent 的输入端正在从文本拓宽到任何最能承载你意图的产物。去 cookbook 试试 vision-input 配方,看看这个基元本身;快速上手指南会带你到达一个可以拖入文件的终端。