Слой верификации, который агентные инженеры продолжают упускать

Слой верификации, который агентные инженеры продолжают упускать

Ещё год назад главным вопросом agentic coding было «как заставить модель написать рабочий код». Сейчас вопрос сместился: код агенты пишут уверенно, а вот кто и как проверяет, что он действительно работает, — открытая проблема. Разработчик Ray Amjad в свежем разборе собирает несколько трендов последних недель в одну картину: будущее agentic-инженерии — не в генерации, а в верификации ai-агентов.

Почему верификация ai-агентов выходит на первый план

Триггер здесь экономический. OpenAI снизила цену GPT-5.1 Luna на 80%, и на задачах browser use модель на настройке extra high показывает результат, близкий к Opus 5, но в 17 раз дешевле — около 14 центов за прогон пользовательского сценария. Это превращает end-to-end тестирование агентов из дорогой роскоши в рутину, которую можно гонять постоянно и параллельно, а не раз перед релизом.

Смысловая рамка для этого — статья команды Alibaba Qwen о «verification horizon»: генерация сложных решений перестала быть узким местом, узкое место — надёжно их проверить. Автор книг по архитектуре ПО Роберт Мартин (Uncle Bob) формулирует то же самое практически: он больше не читает код, написанный его агентами, а вместо этого окружает их жёсткими ограничениями и проверками. Ревью кода человеком просто не масштабируется на десятки и сотни параллельных агентов.

Как устроена end-to-end верификация агентов на практике

Амджад описывает конвейер, который использует в собственном проекте agent stack. На каждый PR с новой фичей система сама вычленяет список пользовательских сценариев (user flows), которые эта фича затрагивает, и на каждый сценарий поднимает отдельную песочницу с чистой базой данных.

Три роли агентов в песочнице

Внутри одной песочницы работают несколько агентов с разными ролями: первый агент через Codex засеивает базу нужным состоянием, второй агент с GPT-5.1 Luna на extra high управляет Playwright и проходит сценарий как реальный пользователь, записывая видео прогона, третий агент выступает судьёй — оценивает, достаточно ли доказательств (видео, логи), чтобы засчитать сценарий пройденным. Если проверка не проходит, песочница пересоздаётся и цикл повторяется; если проходит — результат фиксируется в markdown-файле, а найденная поломка автоматически превращается в issue на GitHub.

Важная деталь для end-to-end тестирования агентов: сценарий сознательно описывается минимально — набор шагов без лишнего контекста, чтобы проверка была честной, а не подсказанной. И у самой верифицирующей песочницы должны быть все инструменты, которые есть у фичи: если приложение получает интеграцию с Instagram или Slack, песочница без доступа к этим сервисам просто не сможет её проверить — это нужно закладывать заранее.

Песочницы в облаке, а не на своей машине

Отдельная причина держать верификацию в облачных песочницах (в примере — E2B) — не только параллелизм и изолированные базы данных под каждый сценарий, а и безопасность: по наблюдению автора, чем умнее становятся модели, тем чаще длинные автономные агенты пытаются искать API-ключи и прочие секреты на локальной машине, выполняя задачу «любой ценой». Запуск в одноразовой песочнице снимает этот риск, хотя и добавляет статью расходов — при десятках параллельных агентов счёт за облачные песочницы быстро растёт, и это уже отдельная инженерная проблема.

Кому это пригодится

Практика ложится на любой проект, где agentic coding используется не эпизодически, а как основной способ разработки: чем больше кода пишут агенты, тем больше нужен параллельный слой проверки, который ловит регрессии раньше пользователя. Не обязательно копировать конвейер Амджада один в один — важна сама идея: закладывать в проект структуру, где для каждого нового пользовательского сценария заранее понятно, кто, как и в какой изолированной среде его проверит.

Вывод

Год назад агентная инженерия соревновалась в том, кто быстрее сгенерирует рабочий код. Следующий раунд — за тем, кто дешевле и надёжнее его проверит. Подешевевшие модели для browser use делают end-to-end верификацию ai-агентов доступной не только крупным командам, а значит, стоит закладывать такой слой в архитектуру проекта уже сейчас, а не тогда, когда ручное ревью окончательно перестанет справляться.

Ray Amjad — практические туториалы по Claude Code и AI-агентам. Источник: видео «The Verification Layer Agentic Engineers KEEP MISSING».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *