Когда в чат отправляется запрос на 200 000 токенов, между нажатием Enter и первым символом ответа происходит куда больше, чем кажется. Подкаст Latent Space поговорил с инженерами Baseten — Филипом Кили и Али Тахой — о том, как на самом деле устроен инференс языковых моделей в проде и почему ускорение вывода стало отдельной инженерной дисциплиной, а не побочным эффектом более быстрых чипов.
Что происходит с запросом до первого токена
Первый шаг — маршрутизация с учётом кэша: система ищет реплику, где уже лежит закэшированный префикс входных данных, чтобы не пересчитывать заново тысячи токенов истории агентного диалога. Дальше в дело вступает дисагрегация prefill и decode — обработка входа и генерация ответа разносятся на разные группы GPU, потому что у этих этапов принципиально разная нагрузка: prefill упирается в вычисления, decode — в память. Поверх этого работает спекулятивное декодирование: маленькая модель-«черновик» предсказывает сразу несколько токенов вперёд, а основная модель одним проходом проверяет, какие из них принять. Для кода и агентных сценариев процент принятия черновых токенов высокий — отсюда заметный прирост скорости именно на этом классе задач.
Квантование инференса LLM: почему сжатие иногда не портит, а улучшает результат
Главный источник потерь качества при оптимизации — квантование, перевод весов из 16 бит в 4. Интуиция подсказывает: чем больше слоёв сжато, тем хуже модель. Baseten показали, что это не всегда так. В своём исследовании они математически предсказывали, в каких слоях ошибки округления при квантовании компенсируют друг друга — «шаг вправо, шаг влево» — и получили модель, квантованную сильнее референсной реализации Nvidia, но при этом точнее по расхождению логит-распределений с оригиналом. Итог — на 20% выше пропускная способность без потери в качестве. Это иллюстрирует общий сдвиг: индустрия начинает измерять инференс не в кратных ускорениях, а в единицах, близких к финансовым «базисным пунктам» — сравнение с тем, как за полвека рынки количественных финансов ужались от различий в десятки процентов до долей процента.
Побочный эффект: недетерминизм при нулевой температуре
Отдельно интересен разбор бага, из-за которого модель зацикливалась на одном токене — воспроизводился он не на всех кластерах и оказался гонкой состояний (race condition) в CUDA-ядрах, а не проблемой весов или квантования. Хорошее напоминание: даже при temperature=0 результат может отличаться в зависимости от железа и версии рантайма.
Франкен-модель: зрение Kimi, веса GLM, внимание DeepSeek
Отдельный сюжет — то, как открытые модели заимствуют компоненты друг у друга. Инженер Baseten прикрутил к GLM 5.2, у которой изначально не было мультимодальности, encoder зрения от Kimi через отдельно обученный проектор — без единого изменения в оригинальных весах языковой модели. В похожем духе слои внимания одной модели меняют на более дружелюбные к KV-кэшу слои из другой архитектуры, когда родной механизм внимания создаёт слишком большой и неразреженный кэш. Получается модель-гибрид, которая наследует сильные стороны нескольких лабораторий сразу — и именно это авторы называют главной ценностью открытых весов: их можно рекомбинировать, а не только дообучать.
Почему это важно не только инженерам инференса
Разброс скорости у разных провайдеров одной и той же модели — это не маркетинг, а реальный результат описанной выше работы: квантования, обученного под конкретный трафик спекулянта, дисагрегации и тонкой настройки под конкретное железо. Базовый уровень без оптимизаций — 30–40 токенов в секунду, топовый результат при полном наборе техник — 300–400. Для тех, кто выбирает API-провайдера под агентные пайплайны или сам разворачивает открытые модели, это значит: разница в цене и скорости между вариантами — не случайность, а мера того, сколько именно инженерной работы вложено в конкретную конечную точку.
Latent Space — подкаст для AI-инженеров. Источник: видео «The Inference Frontier: 10x Faster Models to Self-Optimizing AI — Philip Kiely & Ali Taha, Baseten».

Добавить комментарий