8 миллиардов цифровых двойников: как Simile AI учит ИИ вести себя по-человечески

8 миллиардов цифровых двойников: как Simile AI учит ИИ вести себя по-человечески

Два года назад статья про Smallville — городок, населённый generative agents с памятью и распорядком дня, — стала одной из самых цитируемых работ 2023 года. Её автор, Джун Сон Пак, с тех пор основал стартап Simile AI и в разговоре с Latent Space объяснил, куда завела эта идея: от игрушечной симуляции — к попытке создать цифровые двойники людей в масштабе всего человечества.

Отправная точка звучит просто: чтобы ИИ-ассистент действительно понимал пользователя, ему сначала нужна точная модель этого пользователя. Пак приводит пример — попросишь модель заказать ужин, а она закажет пиццу с ананасами, потому что не знает вашей истории и вкусов. По его мнению, персональные агенты буксуют именно потому, что индустрия пытается построить автоматизацию раньше, чем понимание человека.

От markdown-памяти к behavior foundation model

В Smallville память агентов хранилась текстом — простой, но рабочий трюк, который позже переиспользовали и другие агентные системы. Пак признаёт: подход хорошо масштабируется, но упирается в потолок, когда данных становится действительно много. Отсюда идея behavior foundation model — модели, дообученной не на «рациональном» вебовском корпусе, а на данных о том, как люди реально ошибаются, ленятся и противоречат себе. Ключевой тезис: базовые LLM учат «социальной физике» ровно настолько, насколько эта физика видна в вебе — то есть в основном в декларациях людей о себе, а не в их поступках. Разница между тем, что человек говорит о себе, и тем, что он делает, — и есть слепая зона, которую Simile пытается закрыть.

Симуляция — это не прогноз, а маршрут

Самая содержательная часть разговора — про то, зачем вообще нужна такая симуляция общества. Пак разводит два разных запроса: узнать будущее и изменить его. Предсказание падения продаж бесполезно само по себе; ценность — в пошаговом плане, как этого избежать, даже если промежуточные шаги контринтуитивны. Аналогия с психоисторией из «Академии» Азимова здесь не случайна: хорошая симуляция должна показывать не итог, а последовательность нетривиальных решений, которые к этому итогу ведут.

85% точности против 20–60% у обычных LLM

Главное эмпирическое доказательство подхода — эксперимент из статьи «Generative simulations of a thousand people»: тысяча человек два часа отвечали на вопросы и проходили интервью, после чего их цифровые двойники предсказывали ответы этих же людей в опросах и поведенческих играх с точностью около 85% — против типичных 20–60% у моделей общего назначения на нишевых группах. Для этого Simile целенаправленно собирает три типа данных: качественные интервью о жизни человека, поведенческие следы (транзакции, действия) и, что особенно ценно, данные рандомизированных контролируемых экспериментов — они одни показывают причинно-следственную механику решений, а не просто статистику.

Кому это нужно и где проходит красная черта

Сегодня клиенты Simile — это, по сути, замена традиционных фокус-групп и панелей: тестирование концепций, A/B на выборках виртуальных пользователей, даже моделирование реакции инвесторов на earnings call. Индустрия маркетинговых исследований оценивается в 100 млрд долларов, но Пак настаивает, что реальный рынок шире — это инструмент для любого решения, которое касается людей. При этом он подчёркивает: в политику компания сознательно не идёт, несмотря на спрос, — слишком велика цена ошибки и риск манипуляции.

Зачем это нужно на самом деле

Финальная амбиция звучит почти научно-фантастически — смоделировать восемь миллиардов человек и с помощью такой симуляции подступиться к «нерешаемым» проблемам вроде изменения климата, где десятки акторов с разными интересами годами не могут скоординироваться. Прямая параллель с моделью сегрегации Шеллинга 1970-х, которая, несмотря на примитивность (просто красные и синие точки на сетке), реально повлияла на жилищную политику, показывает суть ставки Пака: agent-based моделирование давно доказало свою силу, ему просто не хватало достаточно богатого описания человека — и теперь оно появилось.

Latent Space — подкаст для AI-инженеров. Источник: видео «Simulating Humanity: from Generative Agents to 8 Billion Digital Twins — Joon Sung Park, Simile AI».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *