Голосовые AI-агенты в 2026: почему инженеры до сих пор не доверяют speech-to-speech

Голосовые AI-агенты в 2026: почему инженеры до сих пор не доверяют speech-to-speech

Подкаст Latent Space запустил новый формат — Forward Deployed, разговоры с инженерами, которые не продают голосовых агентов, а каждый день чинят их у заказчиков. В первом выпуске собрались люди из Vapi, Daily (Pipecat), Smallest AI и Decagon, и получился редкий разговор без маркетингового глянца: что реально работает в 2026 году, когда голосовой агент должен звонить живому человеку и не облажаться.

Голосовые AI-агенты: почему каскад всё ещё бьёт speech-to-speech

Главный тезис выпуска звучит почти парадоксально: несмотря на два года разговоров про voice-to-voice модели, state-of-the-art в проде — это каскад. Речь превращается в текст (ASR), текст уходит в LLM, ответ LLM озвучивается синтезом (TTS). Три шва вместо одной сквозной модели — и именно эта негладкость оказывается фичей, а не багом.

Причина простая: голосовые AI-агенты в enterprise почти всегда обслуживают саппорт, коллекшены, запись на приём — сценарии, где цена ошибки высокая, а галлюцинация про дату записи или условия возврата стоит денег. Speech-to-speech модели пока не дают той же управляемости: между входом и выходом нет текстового слоя, который можно проверить, отфильтровать на prompt injection или прогнать через отдельную модель-супервизора. Каскад же превращается в конвейер: детект намерения, оптимизация контекста под конкретного клиента, проверка ответа на «заземление в реальности» — и только потом голос обратно в трубку.

Гибрид как компромисс

При этом никто не отрицает, что speech-to-speech — это будущее: он ближе к тому, как работает человеческий мозг, который думает, пока слушает, а не последовательно. Практический выход, который называют несколько спикеров, — гибрид: голосовая модель ведёт живой диалог, но в момент сложного запроса делегирует его в каскад, а после ответа забирает управление обратно.

Задержка голосового агента: борьба за миллисекунды и context rot

Отдельная тема — trade-off между интеллектом ответа и задержкой ответа голосового агента. Более умная модель почти всегда медленнее, а в голосовом канале любая пауза дольше секунды ощущается как баг. Решают это не одним трюком, а десятком мелких: параллелизация шагов конвейера (пока думает первая LLM, уже запускается вторая), классификаторы intent на маленьких моделях, которые успевают сработать, пока звучит filler-фраза «секунду, посмотрю», и разбиение одного гигантского системного промпта на ситуативные под-промпты, которые подключаются только когда нужны.

Любопытное наблюдение: голосовые агенты столкнулись с проблемой «расползания контекста» на год-два раньше, чем агенты для кода. Одна большая LLM всё ещё плохо помнит середину длинного промпта — это тот же эффект, из-за которого coding-агентам приходится делать компакцию контекста при приближении к лимиту. В voice это знали ещё когда модели держали 10–50 тысяч токенов, и решения — дробить промпт по стадиям диалога, подгружать только релевантный кусок базы знаний — переносятся на агентные системы почти один в один.

Turn taking и другие детали, которых нет в демо

Кажется тривиальным: человек замолчал — значит, можно отвечать. На практике это отдельная модель (voice activity detection плюс smart turn detection), которая отличает паузу «я обдумываю фразу» от паузы «я закончил говорить». Ошибка здесь превращает агента либо в того, кто перебивает, либо в того, кто повисает молчанием.

Мультиязычность и локальные особенности

Ещё один практический момент — универсального TTS/ASR-стека под все языки не существует: то, что отлично работает для английского и испанского, ломается на японском произношении или арабских именах собственных, и командам приходится подставлять кастомные модели синтеза под конкретный рынок вместо единого вендора.

Зачем это знать, если вы не строите голосового бота

Ценность выпуска не только для тех, кто делает call-центры на AI. Голосовые системы — это лаборатория, где инженеры уже прошли путь, к которому только подходят разработчики агентов для кода: жёсткие ограничения по латентности заставили их раньше остальных придумать компакцию контекста, ситуативную загрузку промптов и оркестрацию нескольких моделей вместо одной большой. Тем, кто сейчас проектирует агентные пайплайны на Claude Code или похожих инструментах, стоит подглядывать именно сюда — voice-инженерия на шаг впереди в вопросах, которые скоро встанут перед всеми.

Latent Space — подкаст для AI-инженеров. Источник: видео «⏭️ Forward Deployed: Voice AI on what works in 2026».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *