OpenAI показала агентный стек: быстрые решения, скорость и доступ к рабочему столу

На подкасте Latent Space команда OpenAI — Ари Вайнштейн (возглавляет продукт и инженерию computer use) и Никунджа Ханда (руководит продуктом API) — разложила по полочкам, из чего на самом деле складывается «агентный стек» компании. Главная новость — не одна модель, а связка из трёх вещей: Decisions API OpenAI, ускоренный computer use с доступом к полноценному рабочему столу через Dots, и инфраструктура под кодовым ярлыком UltraFast, которая должна сделать агентов ощутимо отзывчивее. Для тех, кто строит агентов на любом стеке — не только на OpenAI, — это скорее карта типовых узких мест, чем рекламный ролик.

Decisions API OpenAI: отдельный слой для быстрых решений

Идея Decisions API OpenAI простая: не каждое решение внутри агентной системы требует полноценного рассуждения дорогой reasoning-модели. Авторизовать платёж, промодерировать реплику, выбрать один из двух сценариев диалога, рассортировать тикет поддержки — это скорее классификация, чем генерация, и гонять такие задачи через тяжёлую модель расточительно и медленно. Decisions API построен на урезанной версии модели «Luna»: без отдельного обучения, с ограничением на структурированный вывод и батчевым параллельным инференсом, заточенным на минимальное время до первого токена. По словам команды, идея созрела не на пустом месте — на той же площадке раньше звучал запрос от инженеров Google на отдельный быстрый слой классификации рядом с тяжёлыми моделями, и именно такой разрыв между «подумать» и «быстро решить» Decisions API и закрывает.

Computer use быстрее человека: Dots открывает весь рабочий стол

Второй блок — computer use. Раньше облачный агент OpenAI получал доступ только к браузеру в песочнице; теперь продукт Dots даёт ему полноценную облачную Linux-машину — с настоящим рабочим столом, нативными приложениями и тем же браузером. Разница принципиальная: софт десятилетиями делали для людей, и агент, получивший доступ к такому же компьютеру, может пользоваться тем же софтом без специальных агентных API. По утверждению команды, на простых задачах модель уже обгоняет по скорости среднего человека-оператора, а следующая цель — обгонять экспертов настолько, что порог входа в автоматизацию рутины упадёт сам собой.

От скриншотов к дереву доступности

Самый важный технический сдвиг года, по словам Вайнштейна, — не рост модели, а смена канала восприятия. Старая схема «скриншот → один клик → снова скриншот → снова скролл» убивала скорость и легко рассыпалась на длинных задачах. Добавление доступа к дереву доступности (accessibility tree) и DOM вместо одних картинок позволило модели видеть всю страницу или приложение целиком и писать код, который выполняет несколько шагов за один ход, а не щёлкает по одному элементу зараз. Это и дало основной прирост надёжности — не точность самой модели, а то, что ей наконец дали нормальный «интерфейс для зрения».

UltraFast: что на самом деле ускоряет агентов

Третий пласт — инфраструктура под «ультрабыстрые» сценарии: модель GPT-5.3 Codex Spark, дистиллированная из более крупной модели с падением стоимости вывода на порядок, переход с обычных HTTP-запросов на WebSocket — полный дуплекс с моделью без пересоздания соединения на каждый шаг — и асинхронные вызовы инструментов: модель не блокируется на ожидании ответа от тула и может продолжать рассуждать или слать промежуточные сообщения. Отдельно команда дорабатывает кэширование промптов — от гарантии попадания в кэш в пределах получаса до прицела на много часов и предварительного «разогрева» кэша за отдельную плату. Каждая из этих мер по отдельности выглядит как техническая деталь, но вместе они и объясняют, почему агент ощущается «живым», а не как чат с задержкой в несколько секунд на каждый шаг.

Что это значит для тех, кто строит агентов

Собранные воедино, три слоя закрывают разные роли: Dots — это «руки и глаза» агента на реальном компьютере, Decisions API — быстрый «рефлекс» для простых развилок, а UltraFast-инфраструктура — то, что не даёт агенту тормозить между ними. Это не узкий вопрос про OpenAI: любой, кто собирает агентный харнес — хоть на Claude Code, хоть на собственном стеке, — рано или поздно упирается в те же три проблемы: где взять быстрые решения без дорогой модели, как дать агенту доступ к обычному софту без специального API, и как не потерять отзывчивость на цепочке из десятков вызовов инструментов. OpenAI показала один из возможных ответов; приживётся ли архитектура из трёх отдельных слоёв или индустрия сойдётся на чём-то другом — вопрос ближайшего года, а не этого анонса.

Latent Space — подкаст для AI-инженеров. Источник: видео «OpenAI’s New Agent Stack: Computer Use, Decisions API, UltraFast, Dots—Ari Weinstein & Nikunj Handa».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *