Что если у интерфейса вообще нет кода: ни HTML, ни CSS, ни React, а есть только видеомодель, которая рисует пиксели и реагирует на клики? Так устроена interface world model от Runway. О ней рассказал Анастасис Германидис, сооснователь компании, в подкасте Latent Space. Для тех, кто работает с Claude Code и агентами, тема важная: она заставляет заново спросить, что такое «приложение».
Как работает interface world model
Модель генерирует картинку интерфейса в реальном времени. На вход она получает клики, перетаскивания и скролл, а на выходе предсказывает, что должно произойти дальше. Поведение элементов задаётся не разметкой, а текстом: «если нажать эту кнопку, случится то-то». К видео можно добавить звук, то есть описать и визуальный результат клика, и звуковой эффект.
Сами авторы видят применение в прототипировании, творческих инструментах и обучающих сценариях, где нужна открытая визуальная экспедиция по теме. Германидис сравнил подход с генерацией того же интерфейса через Claude по референсу из Figma. По его словам, LLM работает медленнее, а часть взаимодействий ей просто трудно передать. Это оценка самого разработчика, независимой проверки в интервью нет.
Нейросетевая операционная система как конечная точка
Главный аргумент Германидиса: сегодняшняя LLM универсальна, она поддержит разговор на любую тему, но общаться с ней приходится через жёсткий интерфейс. Если интерфейс тоже становится обучаемым, вы поставляете end-to-end не только языковую модель, но и рендер, и пиксели. Предел этой идеи — полностью нейросетевая операционная система. Похожие мысли раньше высказывал Андрей Карпатый.
Отсюда вывод про сами приложения. Они существуют потому, что каждому инструменту нужна отдельная кодовая база. Если интерфейс генерируется на лету и берёт контекст у LLM, функции из разных «приложений» можно смешивать. Второй эффект — персонализация: тот же интерфейс легко подстроить под пользователя, например увеличить шрифт ради доступности.
Ограничений много, и Германидис их не скрывает. Реальное время на видеомодели заметно дороже, чем отрисовка HTML. Кроме того, авторегрессионные модели копят ошибки: сгенерированные кадры возвращаются на вход, и мелкие огрехи растут. У аватарной модели Runway это позволяет держать до 30 минут видео, у модели открытых миров GWM Worlds — несколько минут.
От Gen-1 к world models: почему это не поворот, а продолжение
Путь Runway помогает понять, откуда растёт идея. Gen-2 начинался как хакерский двухстадийный конвейер: текст превращался в карту глубины, а её на выходе достраивала Gen-1. Управление камерой в Gen-2 впервые дало ощущение, что вы перемещаетесь внутри мира, а не смотрите готовый ролик. Отсюда в конце 2023 года выросла отдельная группа по world models.
Тезис у команды такой: чтобы хорошо предсказывать видео, модель должна всё лучше симулировать физику и действия людей. Как аргумент приводится бенчмарк Physics IQ: его оценка предсказуемо растёт с масштабом. На критику о том, что красивые ролики не равны пониманию физики, Германидис отвечает, что признаков насыщения нет. Он же предупреждает: удачные примеры легко подобрать, и модели умеют скрывать слабые места, например монтажными склейками.
World models для агентов и робототехники
У world models, по словам Германидиса, всегда два применения: для людей и для обучения агентов. Interface world model может стать источником синтетических данных и живой RL-средой для computer use агентов: интерфейсы разнообразны и создаются на ходу, что повышает устойчивость агента.
Робототехника — второй пример. Модель GWM-1 построена на Gen-4.5. Лаборатории сами пришли к Runway за видеомоделями для синтетических данных, а затем стало ясно, что модель полезна и как симулятор. Команда проверила корреляцию между результатами action-модели внутри world model и в реальности и получила хорошее совпадение. Значит, политики можно оценивать быстрее и дешевле, чем на физическом оборудовании.
Что из этого следует
Пока interface world model — ранняя и дорогая демонстрация, и никто не обещает, что завтра вы выкинете React. Но для разработчиков агентов в ней два практических сигнала. Во-первых, среды для тренировки и тестирования computer use агентов можно генерировать, а не собирать вручную. Во-вторых, граница между «моделью» и «интерфейсом» может стереться: то, что мы называем фронтендом, станет ещё одним обучаемым компонентом всей системы.
Latent Space — подкаст для AI-инженеров. Источник: видео «Runway’s Bet Beyond Video: World Models, Robotics, and the Neural OS — Anastasis Germanidis».
Добавить комментарий