Opus 5: агентные рекорды и почти нулевая уязвимость к prompt injection

24 июля Anthropic выкатила Opus 5 — и почти сразу же соцсети наполнились цифрами, которые обычно растягивают на неделю тизеров. За несколько часов команда и амбассадоры Claude Code выложили сразу три типа новостей: агентные бенчмарки, данные по безопасности и признание, что системный промпт Claude Code почти на 80% переписали заново. Разберёмся, что из этого действительно меняет правила игры, а что — красивые цифры для твиттера.

Claude Opus 5: бенчмарки, которые сложно игнорировать

Самая наглядная метрика — OSWorld v2, свежий бенчмарк на управление компьютером: с 55,7% результат подскочил до 70,6%. Это не косметическое улучшение, а качественный скачок в способности модели доводить многошаговые задачи в реальном интерфейсе до конца — кликать, переключаться между окнами, восстанавливаться после ошибок.

Ещё показательнее ARC-AGI-3 — бенчмарк, который специально проектировали «жестоким»: человек решает все среды на 100%, а по состоянию на март ни одна топовая модель не преодолевала 1%. Opus 5 выдал 30,2%. Задача далека от решённой, но разрыв между «почти нулём» и «почти третью» — это не инкрементальный прогресс, а признак того, что модель иначе справляется с новыми, невиданными раньше правилами игры, а не просто заучивает паттерны.

К этому добавляются более прикладные истории: таблицы и презентации, которые Opus 5 собирает на уровне консультанта, и общее позиционирование модели как SOTA на длинных агентных задачах — с оговоркой, что на части других тестов она лишь «близко подбирается», а не однозначно лидирует. Для пользователей Claude Code практический вывод простой: модель ощутимо лучше держит длинный контекст задачи и реже теряет нить на десятом шаге агентного цикла — а это ровно то, что определяет, можно ли доверить ей рефакторинг на несколько файлов без присмотра.

Prompt injection: тихий, но самый важный апгрейд

Формально это не бенчмарк, а строчка в системной карточке, но по значимости она перевешивает многое из перечисленного. Opus 5 — по собственной оценке Anthropic, наименее подверженная prompt injection модель за всю историю линейки. Причём эффект получен не одной мерой, а комбинацией: устойчивость самой модели к вредоносным инструкциям в чужом контенте, отдельные пробы на prompt injection поверх генерации, и Auto Mode в Claude Code как дополнительный слой контроля. При такой многослойной защите частота успешных атак падает почти до нуля.

Это важно именно потому, что prompt injection — системная уязвимость любого агента, который читает внешний контент: веб-страницы, тикеты, письма, чужой код. Не «баг, который когда-нибудь починят», а фундаментальный риск архитектуры LLM-агентов. Заметное движение к нулю здесь напрямую расширяет круг задач, которые можно доверить агенту без пристального надзора человека — от ревью пул-реквестов до работы с внешними API.

Системный промпт Claude Code похудел на 80%

Третья новость — внутренняя кухня, но полезная любому, кто пишет для Claude Code промпты, skills и CLAUDE.md-файлы. Команда сообщила, что убрала около 80% системного промпта Claude Code для новых моделей — и объяснила, чему это их научило в части написания инструкций для более способных моделей.

Смысл в том, что чем сильнее становится базовая модель, тем меньше ей требуется многословных инструкций и защитных формулировок «на всякий случай» — избыточный контекст скорее размывает фокус, чем помогает. Для практики это прямой сигнал: громоздкие CLAUDE.md и skills, написанные под более слабые модели, стоит пересматривать — короче и конкретнее почти всегда лучше, чем длиннее и подробнее.

Что это значит на практике

По отдельности каждая новость выглядит как рутинный апдейт launch day. Вместе они складываются в понятную траекторию: модель одновременно становится способнее на объективно сложных задачах, безопаснее в работе с недоверенным контентом и, как ни парадоксально, проще в промпт-инжиниринге. Для тех, кто строит агентные пайплайны на Claude Code, это означает одно: пора пересматривать не только выбор модели, но и то, сколько текста вы тратите, объясняя ей, что делать.

Источники дайджеста:

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *