Рекурсивные языковые модели: агенты устали таскать весь контекст в промпте

Когда в подкасте Latent Space сравнивают Claude Code, Codex, Pi и десяток похожих инструментов, звучит неожиданный тезис: по сути это одна и та же программа. Так считает Алекс Джанг, аспирант MIT и один из авторов идеи Recursive Language Models (RLM) — рекурсивных языковых моделей. Разговор о GPU-ядрах, бенчмарках и академических ставках в итоге сводится к одному вопросу: что на самом деле меняет возможности агента, если не обвязка вокруг него?

Что такое рекурсивные языковые модели

Большинство агентских фреймворков устроены одинаково: модель копит всю траекторию диалога — запросы, ответы инструментов, промежуточные рассуждения — прямо в промпте и периодически сжимает его, когда контекст переполняется. Рекурсивные языковые модели предлагают другое: контекст не живёт в промпте, а хранится в среде исполнения — файловой системе или REPL, — а единственный инструмент модели — код. Модель пишет программу, которая по необходимости сама вызывает языковую модель как подпрограмму для решения подзадачи, и так рекурсивно. Это не очередной набор функций для вызова инструментов, а смена места, где хранится память агента.

Почему это не просто новый harness

Джанг ссылается на недавнюю работу о «налоге на обвязку» (harness tax): если разложить логику Claude Code, Codex или аналогов на составляющие, окажется, что отличий почти нет — те же циклы вызовов инструментов, тот же способ упаковки истории в контекст. RLM меняет именно этот слой — как задача разбивается на части и где живёт состояние, — а не косметику промпта.

Компоновочное обобщение: короткие задачи учат решать длинные

Самое интересное в RLM — побочный эффект обучения. Модель, обученную на коротких задачах, тестировали на задачах в 8–30 раз длиннее — и она справлялась, потому что выучила не конкретную траекторию, а общую стратегию: завести вспомогательных агентов, перечислить решения, написать цикл проверки. Более того, одна и та же стратегия переносится между задачами из разных областей — поиском и агрегацией данных, например, — хотя внешне промпты не похожи. Для обычной агентской системы, которая хранит всю историю в контексте, такие задачи выглядят совершенно разными; для RLM — одной и той же программой с другой переменной длины.

Кому это пригодится уже сейчас

Идею подхватила команда Prime Intellect — их Prime Agent построен поверх минималистичного каркаса Pi, но с одним инструментом (IPython) и системой самообновления, которая позволяет агенту модифицировать собственные навыки и системный промпт. Для практиков вывод простой: выбор между Claude Code, Codex и остальными харнессами почти не влияет на результат, если задача укладывается в их общую логику. А вот для задач с низкой задержкой (игры, GPU-ядра) или многодневных автономных прогонов — вроде описанного в разговоре эксперимента на 10 000 агентов за 88 часов — архитектура работы с контекстом начинает иметь значение сама по себе.

Что это значит для исследователей

Джанг отдельно подчёркивает: ценность таких идей редко видна сразу. Sweet Bench и STaR в своё время тоже казались академическими курьёзами, пока не появился практический повод — агент для автономного программирования. Рекурсивные языковые модели он описывает как «примитивную» по дизайну, но потенциально гораздо более масштабируемую абстракцию, чем нынешние harness-ы. Для аспирантов и небольших лабораторий это и есть несправедливое преимущество: можно делать рискованную ставку на архитектуру контекста, вместо того чтобы соревноваться с Frontier Labs в вычислительных ресурсах.

Вывод простой: спор о том, какой агентский инструмент «умнее», во многом беспредметен — они решают задачи одинаково. А вот вопрос, где и как хранится контекст модели, только начинает открываться, и рекурсивные языковые модели — первый заметный шаг в эту сторону.

Latent Space — подкаст для AI-инженеров. Источник: видео «Recursive Language Models — Alex Zhang, MIT PhD».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *