Для тех, кто пишет расширения к Claude Code, главная новость последних суток — команда claude plugin eval. О ней рассказал @adocomplete, и появилась она в день выхода Opus 5.5. Совпадение удачное: новая модель как раз повод проверить, нужен ли вашему плагину хоть кто-то, кроме автора.
Claude plugin eval: плагин против «голой» модели
Механика простая. Команда запускает плагин на наборе тестовых кейсов и оценивает результаты. Затем каждый кейс прогоняется ещё раз, уже без плагина. В итоге вы видите не абстрактное «работает», а разницу между двумя вариантами на одних и тех же задачах.
Это классическая абляция, которой раньше в экосистеме плагинов не хватало. Плагины обычно пишут, чтобы закрыть слабое место модели: подсказать процесс, зашить соглашения, подсунуть нужный контекст. Модели при этом улучшаются быстрее, чем обновляются расширения. Часть костылей со временем перестаёт быть нужной, а иногда даже мешает. Это моё осмысление, а не цитата из поста, но именно поэтому фраза про Opus 5.5 в анонсе звучит как приглашение к ревизии: «проверьте, оправдывает ли плагин своё существование».
Практический вывод для авторов плагинов такой. Держите набор тестов рядом с плагином и перезапускайте его после каждой смены модели. Для тех, кто просто ставит чужие плагины, это способ отличить полезный инструмент от привычки.
Opus 5.5 в деле: мышцы и какапо
Пока рынок гадает о бенчмарках, в ленте появились личные «тесты на ощупь». У @adocomplete есть собственный аналог пеликана Саймона Уиллисона: интерактивная карта мышц, которую он строит каждой новой модели. Его вердикт по Opus 5.5: ни одна другая модель не подобралась близко, и тест, похоже, можно закрывать. Когда тест перестаёт различать модели, он просто выработал свой ресурс.
Сам @simonw использовал Opus 5.5 для пиксель-арт анимации. К докладу, где он упомянул рекордный сезон размножения какапо, Claude сделал праздничное видео для финального слайда. По его словам, модель на удивление хороша в пиксельной анимации. Это единичные впечатления, а не измерения, но они показывают, что опытные пользователи проверяют модели на творческих и визуальных задачах, а не только на коде.
Фабрика на автопилоте: +91,8 тысяч строк за день
Самая эффектная цифра дайджеста — из «полностью автономной фабрики ПО» @adocomplete. За 26 сентября ветка main выросла на 94 795 строк и потеряла 3 017, то есть чистый прирост около 91,8 тысячи. За этим стоят 44 влитых PR, 86 коммитов и 629 затронутых файлов.
Смотреть тут стоит не на строки: это плохая метрика ценности, и автор сам подаёт её с иронией. Интереснее 44 PR за сутки. При таком темпе человек физически не успевает прочитать всё, и узким местом становится не написание кода, а проверка. Здесь и пригодится идея вроде plugin eval: автоматизированная оценка вместо ручного взгляда.
А кто нажимает «выкатить»?
Тот же автор задал вопрос: какую часть рабочего процесса вы всё ещё не готовы отдать ИИ? Его собственный ответ — слияние в прод, ему нужен финальный взгляд перед выкаткой. Из материала неясно, как это соотносится с автономной фабрикой, то есть идёт ли она в прод сама. Но сам вопрос показателен: граница доверия проходит не по сложности задачи, а по цене ошибки.
Нужны ли ещё технические блоги
Отдельная реплика — про блоги. @adocomplete обновляет личный сайт и спрашивает, будет ли полезен формат для глубоких технических тем, хотя, по его словам, блоги читают всё реже. Вопрос честный, и на фоне потока коротких постов в X он звучит по делу: разбор того, как устроена «фабрика» или как оценивать плагин, в 280 символов не помещается.
Вывод
Появление claude plugin eval означает, что экосистема Claude Code взрослеет: расширения теперь можно измерять, а не только устанавливать. Если у вас есть свой плагин, самое время прогнать его на Opus 5.5 и сравнить с вариантом без него. Если плагин ничего не добавляет, его стоит убрать. И даже при 44 PR в день финальное слово о выкатке в прод многие пока оставляют человеку.
Добавить комментарий