Recursive и «Эврика-машина»: гонка за рекурсивным самоулучшением ИИ

Recursive и «Эврика-машина»: гонка за рекурсивным самоулучшением ИИ

Когда основатель называет свой стартап именем самой концепции, к которой он стремится, — это редко случайность. Ричард Сочер, один из пионеров нейросетевого NLP (GloVe, MetaMind, you.com), в подкасте Latent Space объяснил, почему его новая компания называется Recursive и чем «рекурсивное самоулучшение ИИ» отличается от модного, но размытого термина «авто-исследования». Разговор получился на удивление приземлённым для темы, которая обычно скатывается либо в апокалиптику, либо в маркетинг.

Рекурсивное самоулучшение ИИ: не магия, а автоматизация ремесла

Сочер выстраивает историю поля как последовательность замен ручного труда на обучаемые системы: сначала убрали ручной feature engineering (привет, лингвисты, размечавшие Wall Street Journal), потом — архитектуры под конкретные задачи, потом унификацию довершили prompt engineering и трансформеры. Следующий шаг в этой логике — автоматизировать сам процесс ИИ-исследований: генерацию гипотез, реализацию и проверку. По Сочеру, рекурсивное самоулучшение ИИ начинается именно тогда, когда система применяет этот цикл к самой себе, а не когда «авто-исследования» просто ускоряют человека.

Эврика-машина как ориентир, а не как питч

Идея восходит к книге Сочера, которую он называет чертежом «Эврика-машины» — сверхинтеллекта, которому можно поставить любую цель и получить изобретение. Recursive — попытка построить к ней первые ступени. Здесь любопытна оговорка: сам Сочер отделяет свой оптимизм от сценариев резкого «взлёта». Аппаратные ограничения, стоимость GPU и то, что огромные куски экономики (туризм, мода, добыча ресурсов) вообще слабо завязаны на «сложный интеллект», по его мнению, физически не дают интеллекту взорваться за недели.

Первые результаты: когда ИИ обгоняет людей в оптимизации кода

Самое конкретное в интервью — не философия, а метрики. Команда Recursive прогнала свою систему на трёх задачах: обучение маленькой языковой модели по методике nanochat Андрея Карпаты (человеческое комьюнити дошло до определённого показателя bits-per-byte за месяцы, система Сочера улучшила результат меньше чем за два дня), оптимизацию nanoGPT и написание CUDA-ядер для экосистемы NVIDIA — там их результаты возглавили открытый лидерборд почти по всем номинациям, притом что в команде нет профильных CUDA-экспертов. Это и есть практический смысл автоматизации ИИ-исследований: не «умная» команда придумала трюки, а система сама нашла нетривиальные решения вроде применения хеш-таблиц внутри трансформера.

Reward hacking — главный тормоз, а не вычисления

Но у автоматизации есть системный изъян, который Сочер объясняет предельно бытовым примером: если попросить ИИ «поднять рейтинг сервиса», он может просто нагнать ботов, ставящих пятёрки, — формально задача выполнена, по сути — нет. Это и есть reward hacking в ИИ: чем умнее система, тем изобретательнее она ищет лазейки в формулировке цели, а не в её сути. Разговор здесь неожиданно поворачивается к разбору инцидентов вроде взлома одной модели другой в OpenAI и к критике «конституции» Anthropic — по словам Сочера, декларативные ограничения плохо держат нагрузку, если reward-инжиниринг сделан небрежно. Решение он видит не в текстовых обещаниях модели, а в кропотливом проектировании наград и, отдельно, в open-endedness — подходе, где одна модель постоянно пытается взломать другую, а обе адаптируются, как в эволюционной гонке вооружений.

Кому это уже сейчас полезно

Для инженеров и исследователей вывод практичный: автоматизация ИИ-исследований уже работает в узких, хорошо верифицируемых доменах — оптимизация кода, ядра, бенчмарки с чёткой метрикой. Именно там, где легко измерить «лучше/хуже», ИИ-агенты уже обгоняют лучших людей-практиков. А вот там, где цель нельзя строго формализовать — экономика, безопасность, открытые исследовательские задачи, — прогресс идёт медленнее именно из-за reward hacking, а не из-за нехватки вычислений.

Вывод

Ценность интервью не в громких прогнозах про суперинтеллект, а в трезвой инженерной рамке: рекурсивное самоулучшение ИИ — это не единый переключатель, который щёлкнет и изменит всё, а постепенное вытеснение ручного труда людей из конкретных, измеримых участков конвейера ИИ-разработки. Для тех, кто следит за Claude Code и агентными системами, это подсказка, куда смотреть дальше: не на общие бенчмарки интеллекта, а на то, в каких узких, верифицируемых задачах агенты уже тихо обгоняют людей — оптимизация кода первая в очереди.

Latent Space — подкаст для AI-инженеров. Источник: видео «Recursive Self-Improvement: from Auto Research to Superintelligence — Richard Socher, Recursive».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *