Подкаст Latent Space запустил новый формат — Forward Deployed, разговоры с инженерами, которые не продают голосовых агентов, а каждый день чинят их у заказчиков. В первом выпуске собрались люди из Vapi, Daily (Pipecat), Smallest AI и Decagon, и получился редкий разговор без маркетингового глянца: что реально работает в 2026 году, когда голосовой агент должен звонить живому человеку и не облажаться.
Голосовые AI-агенты: почему каскад всё ещё бьёт speech-to-speech
Главный тезис выпуска звучит почти парадоксально: несмотря на два года разговоров про voice-to-voice модели, state-of-the-art в проде — это каскад. Речь превращается в текст (ASR), текст уходит в LLM, ответ LLM озвучивается синтезом (TTS). Три шва вместо одной сквозной модели — и именно эта негладкость оказывается фичей, а не багом.
Причина простая: голосовые AI-агенты в enterprise почти всегда обслуживают саппорт, коллекшены, запись на приём — сценарии, где цена ошибки высокая, а галлюцинация про дату записи или условия возврата стоит денег. Speech-to-speech модели пока не дают той же управляемости: между входом и выходом нет текстового слоя, который можно проверить, отфильтровать на prompt injection или прогнать через отдельную модель-супервизора. Каскад же превращается в конвейер: детект намерения, оптимизация контекста под конкретного клиента, проверка ответа на «заземление в реальности» — и только потом голос обратно в трубку.
Гибрид как компромисс
При этом никто не отрицает, что speech-to-speech — это будущее: он ближе к тому, как работает человеческий мозг, который думает, пока слушает, а не последовательно. Практический выход, который называют несколько спикеров, — гибрид: голосовая модель ведёт живой диалог, но в момент сложного запроса делегирует его в каскад, а после ответа забирает управление обратно.
Задержка голосового агента: борьба за миллисекунды и context rot
Отдельная тема — trade-off между интеллектом ответа и задержкой ответа голосового агента. Более умная модель почти всегда медленнее, а в голосовом канале любая пауза дольше секунды ощущается как баг. Решают это не одним трюком, а десятком мелких: параллелизация шагов конвейера (пока думает первая LLM, уже запускается вторая), классификаторы intent на маленьких моделях, которые успевают сработать, пока звучит filler-фраза «секунду, посмотрю», и разбиение одного гигантского системного промпта на ситуативные под-промпты, которые подключаются только когда нужны.
Любопытное наблюдение: голосовые агенты столкнулись с проблемой «расползания контекста» на год-два раньше, чем агенты для кода. Одна большая LLM всё ещё плохо помнит середину длинного промпта — это тот же эффект, из-за которого coding-агентам приходится делать компакцию контекста при приближении к лимиту. В voice это знали ещё когда модели держали 10–50 тысяч токенов, и решения — дробить промпт по стадиям диалога, подгружать только релевантный кусок базы знаний — переносятся на агентные системы почти один в один.
Turn taking и другие детали, которых нет в демо
Кажется тривиальным: человек замолчал — значит, можно отвечать. На практике это отдельная модель (voice activity detection плюс smart turn detection), которая отличает паузу «я обдумываю фразу» от паузы «я закончил говорить». Ошибка здесь превращает агента либо в того, кто перебивает, либо в того, кто повисает молчанием.
Мультиязычность и локальные особенности
Ещё один практический момент — универсального TTS/ASR-стека под все языки не существует: то, что отлично работает для английского и испанского, ломается на японском произношении или арабских именах собственных, и командам приходится подставлять кастомные модели синтеза под конкретный рынок вместо единого вендора.
Зачем это знать, если вы не строите голосового бота
Ценность выпуска не только для тех, кто делает call-центры на AI. Голосовые системы — это лаборатория, где инженеры уже прошли путь, к которому только подходят разработчики агентов для кода: жёсткие ограничения по латентности заставили их раньше остальных придумать компакцию контекста, ситуативную загрузку промптов и оркестрацию нескольких моделей вместо одной большой. Тем, кто сейчас проектирует агентные пайплайны на Claude Code или похожих инструментах, стоит подглядывать именно сюда — voice-инженерия на шаг впереди в вопросах, которые скоро встанут перед всеми.
Latent Space — подкаст для AI-инженеров. Источник: видео «⏭️ Forward Deployed: Voice AI on what works in 2026».

Добавить комментарий