Бросьте mp4 в терминал: мультимодальный кодинг в действии
Самое тихо-радикальное демо запуска было не про скорость и не про параллелизм. Это был видеофайл, который стал сайтом.
Само демо
В материалах запуска Meta пользователь перетаскивает в терминал mp4-файл — видеооблёт дома для отпуска. Muse Code интерпретирует видео — комнаты, свет, окружение — и выдаёт визуально насыщенную маркетинговую страницу с бронированием для этого объекта. Ни брифа, ни прохода копирайтера, ни списка ассетов. Видео и есть спецификация.
Чем это отличается от обычной поддержки vision
Картинки принимают многие модели; рецепт vision-input из кукбука покрывает ровно это, а «скриншот → багфикс» — уже привычный воркфлоу. Демо показывает нечто большее: неструктурированный, некодовый медиафайл как основной вход полноценной инженерной задачи, внутри агентного цикла. Модель должна извлечь намерение (это сдаваемый дом, который должен продавать себя сам), вывести из него контент (что страницы должны говорить и показывать), а затем выполнить обычную многостраничную сборку — планирование, код, проверки — исходя из этого понимания.
Это схлопывает привычный конвейер. Традиционный путь от «вот видео дома» до «вот сайт бронирования» проходит через копирайтера, дизайнера и разработчика, каждый из которых переводит результат предыдущего. Мультимодальный агент прокручивает всю эту цепочку переводов внутри себя.
Где это пригодится в реальных воркфлоу
Страница дома для отпуска — маркетинговое демо, но паттерн обобщается на входы, которые у инженеров есть на самом деле: запись экрана с багом, который трудно описать словами; фото доски с наброском архитектуры; прохождение по продукту конкурента, который надо изучить; дизайн-макет, экспортированный картинкой. Везде, где самое точное описание задачи визуальное, а не словесное, набивать в промпт его прозаический пересказ — это сжатие с потерями. Передать сам артефакт — нет.
Рецепты восприятия из кукбука намечают то же направление в меньшем масштабе: анализ графиков извлекает структурированные данные из изображений, perception grounding привязывает интерактивные аннотации к пиксельным координатам на фото. Демо с mp4 — это те же примитивы, скомпонованные и доведённые до логического конца.
Честные оговорки
Демо запуска — это лучший случай. Интерпретация видео на такой глубине сжигает серьёзные объёмы токенов — не забывайте, что цены на входные токены распространяются и на медиа, — а «видео как спецификация» лучше всего работает, когда форма результата конвенциональна, как у страницы объекта недвижимости. Но как заявление о направлении оно недвусмысленно: входная сторона кодинг-агентов расширяется от текста к любому артефакту, который лучше всего передаёт ваше намерение. Попробуйте рецепт vision-input в кукбуке, чтобы увидеть примитив в деле; квикстарт доведёт вас до терминала, куда можно бросить файл.