Ещё год назад разговор об автономности Claude Code сводился к вопросу «а можно ли ему доверять командную строку». На этой неделе Anthropic ответила на него не декларацией, а числом: 89% против 13,6%. Именно с таким разрывом auto mode в Claude Code обошёл живых разработчиков в распознавании опасных команд — и с этого дня режим становится дефолтным для разрешений в тарифах Pro, Max и Team.
Auto mode в Claude Code: цифры вместо интуиции
Суть эксперимента, о котором рассказал @adocomplete: в реальные (не синтетические) coding-сессии подмешали опасные команды и посмотрели, кто их заметит. 1053 профессиональных разработчика, вычитывая diff и терминальный вывод глазами, поймали лишь 13,6% из них — усталость внимания, привычка доверять инструменту, банальный скролл мимо строчки с rm -rf в неожиданном месте. Auto mode — режим, в котором Claude Code сам оценивает риск команды и либо выполняет её, либо останавливается за подтверждением, — поймал 89%.
Это меняет расстановку сил в споре «человек в цикле = безопасность». На практике человек в цикле часто означает уставшего человека, механически нажимающего «да». Перенос дефолта на auto mode — это признание того, что систематическая проверка по чек-листу рисков (пусть и выполняемая моделью) статистически надёжнее выборочного human review. Не значит, что ревью не нужно вовсе — значит, что первая линия обороны теперь у модели, а не у человека боковым зрением.
Anthropic испытывает автономность на себе
Параллельно @bcherny (Boris Cherny, один из создателей Claude Code) рассказал о более смелом эксперименте: последние несколько недель Claude сам ведёт повседневное обслуживание приложений Anthropic — iOS, Android, десктоп, веб, CLI, Agent SDK. В Slack-канале proj-claude-maintains-apps «Claude Tag» ежедневно гоняет набор рутин: crash fuzzer (открывает приложение в симуляторе, тыкается в интерфейс, ищет падения и чинит их у корня), dup unifier (находит похожие, но разошедшиеся абстракции и присылает PR на унификацию), dead-code remover (вычищает недостижимый код, предварительно логируя подозрительные места, чтобы убедиться, что они правда мертвы) и «абстракционная полиция» — чинит протекающие абстракции.
Результат за несколько недель — 388 открытых PR, из них 180 смёржено после Claude Code Review и финального человеческого ревью. По словам Черны, Claude обычно попадает в цель с первой попытки; если нет — ему просто говорят подстроить рутину, и на следующий день результат лучше. Это не демо и не бенчмарк — это внутренний прод Anthropic, живущий на автопилоте по чисто механическим, но реальным задачам.
Мелкие штрихи той же тенденции
Остальные новости дайджеста складываются в ту же картину. В Claude Code для десктопа появился чекбокс auto-continue: упёрся в лимит использования — сессия сама продолжится, как только лимит сбросится, без ручного перезапуска. А команда Cowork зовёт на office hours не инженеров, а людей из маркетинга, продаж, финансов, юр- и операционных отделов — то есть намеренно расширяет круг тех, кто доверяет агенту самостоятельные многошаговые задачи за пределами кода.
Что это значит для тех, кто работает с Claude Code
Три новости порознь выглядят как рутинные апдейты. Вместе — как согласованный сдвиг: Anthropic одновременно снижает трение для длинных автономных сессий (auto-continue), поднимает планку доверия к решениям модели внутри сессии (auto mode по умолчанию) и на собственном примере показывает, где заканчивается разумная автономность — не «полностью без человека», а «человек проверяет результат, а не каждый шаг». Для тех, кто настраивает permission mode в своих пайплайнах, это сигнал пересмотреть дефолты: ручное подтверждение каждой команды не то что бы безопаснее — исследование Anthropic говорит об обратном.
Источники дайджеста:
- @trq212 — Тарик, инженер Claude Code в Anthropic: пост
- @simonw — Саймон Уиллисон, практика Claude и LLM-инструментов: пост 1, пост 2
- @bcherny — Борис Черни, инженер Claude Code: пост 1, пост 2, пост 3
- @ClaudeDevs — официальный аккаунт Anthropic для разработчиков: пост
- @adocomplete — Адо, сообщество Claude: пост

Добавить комментарий