Когда в 2021 году Анима Анандкумар — тогда глава AI-исследований NVIDIA, ныне профессор Caltech — предложила метеорологам натравить нейросеть на прогноз погоды, ей вежливо объяснили, что это не сработает: за плечами классических моделей десятилетия физики жидкости и газа, а нейросеть учится на паттернах, а не на уравнениях. Через несколько месяцев её команда выкатила модель, которая била традиционные суперкомпьютерные симуляции по скорости в десятки тысяч раз — и почти не уступала им в точности, помещаясь при этом на одну потребительскую видеокарту. Разговор с Анандкумар в подкасте Latent Space — это не история про очередной хайп, а внятное объяснение того, почему нейронные операторы оказались тем самым инструментом, который наконец подружил AI с физическим миром.
Чем нейронные операторы отличаются от обычных нейросетей
Обычная нейросеть работает с фиксированным разрешением: языковая модель — с фиксированным словарём, модель компьютерного зрения — с фиксированным размером картинки. Физический мир так не устроен: погода, деформация материалов, поведение плазмы происходят на бесконечном числе масштабов одновременно, и заранее решать, с каким разрешением их описывать, — заведомо проигрышная стратегия.
Нейронные операторы решают эту проблему иначе: они учат не отображение «пиксели → пиксели», а отображение между функциональными пространствами, то есть между непрерывными функциями. На практике это означает, что модель, обученную на данных одного разрешения, можно спросить о прогнозе в любом другом — так называемое zero-shot super-resolution. Наиболее удачная архитектура — Fourier Neural Operator — переносит вычисления в частотную область: там естественно описываются нелокальные зависимости («что происходит в Чикаго, скажется на Сан-Франциско»), а сложность вычислений растёт квазилинейно, а не квадратично, как у трансформеров на сопоставимых разрешениях.
Прогноз погоды нейросетью: не имитация, а новый инструмент
Именно на этой архитектуре построен FourCastNet — модель, которую Анандкумар с коллегами обучили на 50 тысячах примеров глобальных карт погоды ECMWF и выложили в открытый доступ, что довольно быстро подтолкнуло DeepMind, Huawei и других выпустить свои аналоги. С 2023 года FourCastNet доступен на портале самого ECMWF, и публичным подтверждением его пользы стал ураган Ли: модель предсказала выход на сушу на несколько дней раньше классических систем.
Ключевое ограничение первой версии — она предполагала, что Земля плоская (в буквальном смысле проекции), из-за чего при длинных прогонах модель быстро расходилась. В FourCastNet 3 в архитектуру встроили сферическую геометрию, что дало достаточную устойчивость для перехода от краткосрочной погоды к климатическим ансамблям — множеству прогонов с разными начальными возмущениями, по которым можно оценивать вероятность экстремальных событий, а не единственную траекторию.
Физически информированные нейронные сети: где кончаются данные
Здесь важно не путать нейронные операторы с physics-informed neural networks (PINN) — моделями, которые с нуля решают конкретное уравнение, используя только физические ограничения как функцию потерь. Для стационарных задач это работает, но для турбулентных и хаотичных процессов оптимизационный ландшафт становится, по словам Анандкумар, «безнадёжным». Нейронные операторы берут лучшее из обоих миров: обучаются на реальных данных (там, где они есть) и одновременно накладывают физические ограничения — законы сохранения, уравнения — как дополнительный сигнал, а не единственный источник истины.
Это же сочетание работает и за пределами погоды: цифровой двойник плазмы в токамаке, обученный на паре тысяч примеров, теперь моделируется в миллион раз быстрее, чем классическими симуляциями, — шаг к предсказанию и предотвращению срывов плазмы в термоядерных реакторах.
Верификация нейронных сетей для критичных систем
Отдельная линия работы Анандкумар — TorchLean, фреймворк, позволяющий описывать нейросети в PyTorch-подобном синтаксисе и тут же формально верифицировать их в системе доказательств Lean: сертифицированную устойчивость к возмущениям входа, эффекты конечной точности вычислений и другие гарантии. Это то, что нужно, если нейросеть встраивается в контур управления дроном или ядерным реактором — там мало «обычно работает», нужна формальная граница. Пока упирается в масштабируемость: Lean — CPU-инструмент, и перенос верификации больших сетей на GPU остаётся открытой задачей.
Главный вывод
Общий тезис у всех этих примеров один: физический мир структурирован сильнее, чем кажется, и именно поэтому редкие, экстремальные события — ураганы, срывы плазмы — распознаются моделями с относительно небольшим объёмом данных лучше, чем можно было ожидать. Для языковых моделей это звучит контринтуитивно: там редкость события обычно означает низкое качество предсказания. Для инженеров, которые проектируют климатические модели, системы раннего предупреждения или AI-контуры управления в промышленности, из этого следует практический вывод — не пытаться заменить физику данными или данные физикой, а с самого начала проектировать архитектуру так, чтобы совмещать оба источника сигнала.
Latent Space — подкаст для AI-инженеров. Источник: видео «🔬 The Physical World Is More Forgiving Than You Think — Anima Anandkumar, Caltech».

Добавить комментарий