Cerebras и гонка за скорость инференса ИИ: зачем нужны 10 000 токенов в секунду

Cerebras и гонка за скорость инференса ИИ: зачем нужны 10 000 токенов в секунду

Ещё пару лет назад 100–200 токенов в секунду считались нормальной скоростью для больших языковых моделей. Сегодня, судя по разговору с CTO Cerebras Шоном Ли на подкасте Latent Space, это уже «новый batch-режим» — то есть скорость, достаточная только для фоновых, не интерактивных задач. Рост скорости инференса ИИ — не косметическое улучшение, а смена класса задач, которые вообще можно решать с помощью языковых моделей.

Почему скорость инференса ИИ стала бутылочным горлышком для агентов

Ключевой аргумент Ли простой: агентные системы работают циклами — модель рассуждает, вызывает инструмент, получает результат, снова рассуждает. Каждый такой круг стоит времени, и если модель отвечает медленно, агент не может позволить себе много итераций без того, чтобы пользователь не заскучал. Когда модель выдаёт не сотни, а тысячи токенов в секунду, у агента появляется бюджет на больше проверок, больше самокоррекции и более длинные цепочки рассуждений — при том же ощущении «отклика в реальном времени». Иными словами, скорость напрямую конвертируется в интеллект: не потому что модель стала умнее сама по себе, а потому что ей позволили думать дольше за то же время ожидания пользователя.

Wafer scale чип как альтернатива классическому GPU

Архитектурная ставка Cerebras — цельная кремниевая пластина (wafer scale чип) вместо связки отдельных GPU. Главный практический эффект — на порядки больше памяти рядом с вычислительными блоками, что снимает узкое место классических ускорителей: недостаток SRAM для хранения весов модели целиком на кристалле. Показанная на Hot Chips CS4 система удвоила энергоснабжение и пропускную способность межсоединений по сравнению с предыдущим поколением и уже гоняет open-weight модель GPT-OSS на скорости свыше 4400 токенов в секунду. Анонсированная CS5 обещает системы среднего размера (GPT-OSS, Gemma) на скоростях до 10 000 ток/с, а модели уровня frontier (Kimi, DeepSeek, GPT-5) — до 5000 ток/с.

Совместный дизайн модели и железа

Отдельная тема разговора — переход от «железо для демонстрации возможностей» к «железо, спроектированное вместе с моделью». Сотрудничество Cerebras с OpenAI (продукт Ultra-fast с 14-кратным ускорением флагманской модели) интересно тем, что часть выигрыша получена не только за счёт чипа, но и за счёт того, что модели изначально оптимизировались под GPU других производителей — и даже небольшая адаптация архитектуры под новое железо даёт заметный прирост. Ли прямо называет это «наименее использованной возможностью» индустрии: почти все современные модели заточены под конкретные конфигурации Nvidia, и никто пока системно не переписывает архитектуры под альтернативные чипы.

Что это значит для рынка LLM

Показательно, что в разговоре Ли осторожно комментирует конкурентов — Groq (запуск на модели всего 30 млрд параметров он объясняет нехваткой памяти на чип у SRAM-архитектур без wafer-scale интеграции) и стартап Etched, который пока не подкрепил громкие обещания цифрами. Общий вывод CTO Cerebras: рынок инференса больше не единая задача, а набор разных подзадач — prefill, decode, работа с KV-кэшем, балансировка экспертов в MoE — и для каждой рано или поздно появится своё специализированное железо. Ближайший фронт инноваций, по его словам, сместится с самого чипа на интеграцию вокруг него: упаковку, охлаждение, подачу питания, объединение стойки в единый вычислительный узел.

Вывод

За цифрами вроде «10 000 токенов в секунду» стоит не гонка бенчмарков, а попытка снять ограничение, которое сдерживает всю агентную парадигму ИИ. Для разработчиков, которые строят продукты на базе Claude Code и подобных агентных инструментов, это сигнал: инфраструктура для сверхбыстрого инференса перестаёт быть нишевой экзотикой и в перспективе 1–2 лет может стать таким же стандартным выбором, как сегодня выбор между разными облачными GPU.

Latent Space — подкаст для AI-инженеров. Источник: видео «The Inference Frontier: from 100 to 10,000 tokens per second — Sean Lie, Cerebras CTO».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *