Что если научный вопрос превратить в функцию, которая возвращает число, а поиск ответа поручить модели, умеющей писать код и читать статьи? По этой схеме работает ERA. Её развивает команда Джона Платта, Google Fellow и главы прикладной науки в Google Research. Это один из самых конкретных примеров того, как выглядит ИИ для науки от Google на практике. В подкасте Latent Space Платт рассказал, почему подход заработал только в последние версии Gemini и где он упирается в человека.
Scorable tasks: наука как задача на максимизацию
Ключевая идея проста. Команда обнаружила, что множество научных задач можно переформулировать как scorable tasks: нужно написать код, который максимизирует некоторую оценку. Для статистической модели оценка очевидна: качество подгонки под датасет. Но можно и хитрее. В прикладной математике есть асимптотические разложения: как ведёт себя дифференциальное уравнение, когда малый параметр стремится к нулю. Такую задачу превращают в эмпирическую. Модель предлагает асимптотическое решение, его сверяют с численным расчётом при epsilon = 1e-4, а Gemini одновременно рассуждает математически и подгоняет результат.
Самое трудное здесь — сформулировать саму оценку. Поэтому в продукте есть отдельный агент-собеседник: вы рассказываете о проблеме, он помогает определить scorable task и собирает Python-ноутбук с функцией оценки. Уже потом начинается оптимизация.
Дерево ноутбуков и UCB: как устроен поиск
Внутри работает специализированная обвязка с алгоритмом Monte Carlo tree search. Система держит сотни или тысячи вариантов ноутбуков в виде дерева. Кандидата выбирают по UCB, классическому алгоритму из обучения с подкреплением. Это оптимистичная стратегия: берут не лучший на данный момент ноутбук, а тот, у которого выше сумма текущего результата и запаса неопределённости, примерно «плюс два сигма». Поэтому иногда растёт пятый по качеству кандидат. Пробовали и рекомбинацию: взять идеи из двух ноутбуков и склеить третий.
Параллелизм по умолчанию — около десяти листьев за раз. Это компромисс. Если запускать тысячу веток одновременно, они не видят результатов друг друга, и вычисления тратятся впустую. Когда небольшая пачка завершается, история попыток (с обрезкой, чтобы не раздувать контекст) уходит в общий контекст. Поэтому Платт говорит о нагрузке на длинный контекст Gemini.
Есть и ответ на вопрос, почему эволюционное программирование десятилетиями не взлетало. Случайные мутации кода почти всегда вредны, как и в ДНК. Здесь мутации предлагает ИИ с огромным запасом знаний о мире, и он чувствует, какие изменения имеют смысл. Начальную популяцию он тоже пишет сам: читает приложенные статьи и делает первый заход. Код может быть с багами и возвращать минус бесконечность, но дальше идёт итерация.
Переобучение и закон Гудхарта: инструмент, которым можно порезаться
Платт различает предсказательные и описательные модели. Предсказательная просто минимизирует ошибку на данных. Описательная содержит что-то о механизме реальности и потому способна экстраполировать. Его пример: модель XVII века «яблоки падают» ничего не скажет о планетах. ERA пока опирается на «интуицию» LLM и на статьи, которые ей показали. Полностью новую физику она с нуля не открывала, и сам Платт называет систему мощным инструментом, но не заменой учёного.
Отсюда — требование строгости. Агент, как джинн из сказок, склонен находить лазейки в функции оценки: сработает закон Гудхарта, и метрика, ставшая целью, перестаёт быть хорошей метрикой. Поэтому нужны скрытые hold-out выборки, которые вы сами не смотрите, и готовность переписывать оценку («нет, я имел в виду не это»). Платт приводит пример с Kaggle-соревнованием по контрейлам: участники обошли команду Google, обнаружив в разметке ошибку в полпикселя и использовав её. Люди хакают метрики не хуже моделей. Кстати, ERA и родилась как проект «авто-Kaggle», и на площадках вроде соревнования CDC по прогнозу COVID и гриппа показывала очень сильный результат. Правда, до самых верхних мест не дотягивала: последние тысячные доли даются ручной доводкой.
Контрейлы: где ERA уже распутала задачу
Показательный кейс — конденсационные следы самолётов. По оценкам, они дают около 1% антропогенного потепления, а локально, например над Европой, до одного ватта на квадратный метр. Команда строит карты областей, пересыщенных льдом, чтобы самолёты обходили их по высоте. Но для выбора самых вредных следов нужна контрфактическая модель: что излучала бы атмосфера без следа. Для отражённого солнечного света такая модель два года не получалась и не проходила даже собственные тесты на искусственных данных. ERA нашла простую модель с удачным набором конфаундеров, которую люди просто не пробовали.
Человек во внешнем цикле
Платт сравнивает ERA с неутомимым аспирантом, который не спит. Внутренний цикл занимает несколько часов, после чего человек смотрит результаты, подсовывает статью, ругает за лазейку. Учёный уходит от возни с CSV и базами к самой сути — что вообще считать целевой функцией. Платт считает, что нужны и творчество, и строгость, пусть даже в разных людях. Для тех, кто работает с агентами вроде Claude Code, это узнаваемая картина: чем сильнее исполнитель, тем важнее хорошо заданная метрика и честная проверка.
Вывод
ERA показывает, что сила подхода не в самом переборе, а в том, что перебор ведёт модель с мировыми знаниями. Но вместе с мощностью растёт цена ошибки: закон Гудхарта и переобучение никуда не делись. Тем, кто строит собственные циклы «агент — оценка — итерация», стоит взять у Платта два урока: тщательно проектировать функцию оценки и держать закрытую выборку, которую агент не видит.
Latent Space — подкаст для AI-инженеров. Источник: видео «🔬 Google’s AI Scientist Started as an Attempt to Automate Kaggle — John Platt, Google Fellow».
Добавить комментарий