Агенты, которые кликают по экрану вместо человека, давно обещали избавить нас от рутины, но на практике терялись в меню и застревали на полпути. Консультант по внедрению ИИ Dylan Davis говорит, что месяц назад его опыт был именно таким. Теперь, по его словам, что-то изменилось: вышли модель GPT-5.6 и новое десктопное приложение ChatGPT, а ChatGPT computer use и встроенный браузер довели задачу до конца без присмотра. Автор проверял это на клиентских задачах около трёх недель. Для тех, кто живёт в Claude Code, это повод посмотреть, куда движется соседний лагерь: агент выходит из терминала в интерфейсы, сделанные для людей.
Две категории рутины, которые забирает агент
Dylan делит неприятную работу с софтом на два типа. Первый — перенос информации с одного экрана на другой. Типичный пример: биллинговый портал не умеет выгружать всё сразу, и данные по каждому клиенту приходится открывать, скачивать и переносить в Excel по одному. Речь не о двух-трёх разах, а о сотне и больше повторов.
Второй тип — редкий или незнакомый софт. Вы раз в год заходите в сервис, чтобы отключить автопродление подписки, и не помните, в каком из вложенных меню эта настройка спрятана. Здесь достаточно назвать программу и сформулировать цель, а агент сам исследует интерфейс. Критерий выбора задачи автор формулирует просто: она должна быть скучной, повторяющейся и понятной по результату.
Встроенный браузер или computer use: что выбирать
Тут главная практическая мысль ролика. Почти всё современное ПО живёт в браузере, поэтому в примерно 95% случаев хватает встроенного браузера ChatGPT. Он открывается через боковую панель, сохраняет ваши логины, а вызывается в чате командой @browser. Это быстрее и надёжнее, чем управлять всем компьютером.
Computer use нужен, когда работа идёт в сторонней десктопной программе на Mac или Windows. Его подключают как плагин, а вызывают через @computer. На Mac агент, по словам автора, может работать в фоне, пока вы занимаетесь своим, и показывает небольшое окно предпросмотра. У Windows схема иная, и пользоваться компьютером параллельно не выйдет.
Автор перечисляет и минусы. Даже в быстром режиме GPT-5.6 работает заметно медленнее привычного. Капча требует ручного решения и рушит идею полной автоматизации. Случайное всплывающее окно может сбить агента с курса. Из настроек он советует умную модель и высокий уровень усилий; быстрый режим имеет смысл включать на тарифах за $100–200, где токенов хватает с запасом.
Запись и воспроизведение: показать один раз
Самая необычная находка — плагин OpenAI для записи и воспроизведения в ChatGPT. Вы включаете запись экрана, выполняете задачу вручную, останавливаете запись, и агент превращает увиденное в навык, который можно повторять десятки и сотни раз. Автор советует брать процессы, где шаги стабильны, а решений в ходе работы минимум; нужные пояснения можно проговорить или дописать в промпте во время записи.
Ограничения серьёзные: сейчас плагин работает только на Mac и только в США, а в ЕС и Великобритании недоступен. При этом сам навык, созданный с его помощью, можно использовать и в других регионах.
Лестница доверия и промпт из четырёх частей
Как безопасно передавать агенту работу? Автор предлагает лестницу доверия. Сначала наблюдаете за каждым шагом и проверяете результат несколько раз. Затем разрешаете работу в фоне. Когда процесс стабильно проходит идеально, оформляете его как навык, а после проверки навыка ставите на расписание, например на каждый понедельник в 8 утра. Расписание, по словам автора, создаётся просто: достаточно попросить об этом сам ИИ.
Базовый промпт состоит из четырёх частей: куда идти, каким должен быть результат (например, таблица по активным клиентам за июнь), что делать, если что-то неясно, и как проверить итог. Третий пункт нужен против галлюцинаций: ИИ стремится дать ответ любой ценой, поэтому ему нужно прямо разрешить оставить поле пустым и объяснить причину. Четвёртый — самопроверка: пусть сравнит, сколько элементов найдено и сколько обработано. Если цифры не совпали, что-то пропущено.
Вывод
Идея, что агент работает через интерфейсы, а не только через API, перестаёт быть демонстрацией и становится рабочим инструментом. Но практический совет автора скромнее рекламы: начинайте со встроенного браузера, берите монотонные задачи с чётким результатом, требуйте самопроверки и расширяйте автономность постепенно. Эта логика годится для любого агента, включая Claude Code: доверие нужно зарабатывать повторяемыми результатами.
Dylan Davis — AI-автоматизация и рабочие процессы. Источник: видео «There’s a Version of ChatGPT You’ve Never Opened».
Добавить комментарий