Claude Opus 5.5: агентам можно доверять целые задачи

Вчера вышла Claude Opus 5.5 — и, судя по реакции в X, это не рядовой апдейт версии. Борис Черни (Anthropic) редко комментирует релизы моделей лично, но здесь сделал исключение: модель говорит понятнее, короче и при этом дешевле предыдущей. Саймон Уиллисон в тот же день опубликовал сравнение Opus 5.5 с GPT-6 Sol и GPT-6 Luna — по традиции, на пеликанах разной сложности рассуждений. Но самое интересное в этом дайджесте не сам факт релиза, а то, что с моделью уже успели сделать за первые сутки.

Что нового в Claude Opus 5.5

Кроме флагманской Opus, Anthropic готовит Sonnet 5.5 и Haiku 5.5 с теми же улучшениями производительности, эффективности и безопасности — об этом написал в X Адо из сообщества Claude. То есть апгрейд затронет всю линейку, а не только топовую модель, которую не все готовы себе позволить. Отдельно подвезли утилитарное: в мобильном приложении Claude наконец появилась поддержка нескольких аккаунтов — мелочь, но для тех, кто ведёт и личные, и рабочие чаты, это снимает раздражающее ограничение.

Формальная верификация кода: неожиданное применение Opus 5.5

Самый содержательный твит дайджеста — от Бориса Черни: он использовал Opus 5.5 для формальной верификации Claude Agent SDK с помощью Lean. Пара коротких промптов — и модель нашла материал на 16 pull request’ов, исправляющих баги и гонки состояний (race conditions). Для сложных случаев с параллелизмом и потоками данных он комбинирует Lean с TLA+.

Формальная верификация кода — не новая область, но исторически она требует узкой экспертизы и огромных трудозатрат, поэтому массово применяется разве что в авиации и криптографии. Черни прямо признаёт, что не эксперт ни в Lean, ни в TLA+, — но Claude компенсирует этот разрыв. Если LLM берёт на себя перевод кода в формальную модель и поиск противоречий в ней, порог входа резко падает. Это не замена тестам, а отдельный слой: формальные методы ловят именно те баги, что прячутся в конкурентном доступе и переходах состояний — там, где юнит-тесты обычно бессильны, потому что не угадывают нужную комбинацию входных данных.

Как работать с новой моделью: делегируй, а не микроменеджь

Официальный аккаунт для разработчиков ClaudeDevs выпустил короткий плейбук для первой сессии с Opus 5.5: отдавать модели задачу целиком, явно определяя критерий «готово» и точки, когда нужно свериться; не писать «think carefully» — модель и так думает по умолчанию; после долгого автономного прогона спрашивать, чего ей не хватает для продолжения. Это симптоматично: с ростом возможностей модели инструкция становится не подробнее, а короче.

В том же духе высказался Тарик из команды Claude Code: правильный способ использовать возросшие возможности модели — не штамповать в десять раз больше фич, а тратить освободившееся время на понимание пользователей, эксперименты и прототипы, чтобы делать вещи, которые действительно работают. Он же показал это на практике: попросил Opus 5.5 перебрать несколько редизайнов личного сайта через workflows с итерацией и критикой, остался доволен тем, как модель попала в нужную интонацию, — и в качестве вишенки попросил собрать трейлер из всех итераций.

Что это значит для тех, кто работает с Claude Code

Главный вывод дайджеста в том, что интересные истории про Opus 5.5 появились не в блоге релиза, а в том, как инженеры Anthropic и сообщество сразу начали её использовать иначе. Формальная верификация превращается из нишевой практики в доступный инструмент поиска багов. А сам стиль работы с агентом смещается от подробного пошагового промптинга к постановке задачи целиком и доверию модели в процессе. Для разработчиков, которые уже работают с Claude Code, это не абстрактная новость, а рабочий совет на сегодня: попробовать отдать агенту крупную, самостоятельную задачу — и посмотреть, что получится.

Источники дайджеста:

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *