В X завязалась любопытная дискуссия: исследователь под ником jerhadf заметил, а trq212 разнёс дальше по ленте, что у Claude Opus 5 на бенчмарке FrontierCode средний reasoning effort даёт результат лучше, чем максимальный — хотя на большинстве других тестов зависимость обратная: чем выше effort, тем выше итоговый score. Формально это одна реплика в чужом треде без развёрнутых данных, но за ней стоит вопрос, важный для всех, кто настраивает Claude Code под конкретную задачу: всегда ли «думать дольше» значит «делать лучше»?
Аномалия на фоне общей закономерности
Reasoning effort — параметр, который управляет тем, сколько «размышлений» модель тратит перед ответом: от быстрого low до затратного high. Интуиция подсказывает, что зависимость должна быть монотонной — больше вычислений, больше шансов найти верное решение, выше score. На большинстве бенчмарков так и есть, и именно поэтому наблюдение по Opus 5 выглядит контринтуитивно: FrontierCode, тест, ориентированный на реальные инженерные задачи, ведёт себя иначе. Средний effort обгоняет высокий, и это не шум на грани погрешности, а достаточно заметный разрыв, чтобы его заметили и начали обсуждать.
Почему Opus 5 умнее на среднем reasoning effort, чем на максимальном
Точного ответа Anthropic пока не давала, но у самой гипотезы есть разумные основания.
Цена лишних раздумий
В инженерных задачах часто есть короткий путь к рабочему решению, который модель находит уже на средних затратах мышления. Дополнительные раунды рассуждений в такой ситуации не столько уточняют ответ, сколько подталкивают модель пересматривать уже верный план: она начинает искать более «элегантные» варианты, замечает мнимые edge cases, переписывает код, который и так работал. Для открытых, творческих задач такое дожимание может быть полезным — оно и даёт прирост на других evals. А для задач с чёткими критериями правильности лишний проход по цепочке рассуждений скорее добавляет шанс свернуть с рабочего решения на менее рабочее, чем находит что-то принципиально новое.
Специфика самого бенчмарка
FrontierCode — это не абстрактный тест на логику, а прокси реального написания и правки кода: там важны не только правильность, но и лаконичность, отсутствие лишних изменений, точное попадание в контекст задачи. Такие метрики штрафуют за многословность и избыточные правки заметно сильнее, чем классические reasoning-бенчмарки. Если высокий effort склоняет модель к более развёрнутым, «переинженеренным» решениям, просадка score на именно таком тесте выглядит логично — даже если по сути рассуждения стали глубже, а не хуже.
Что это значит для тех, кто использует Claude Code
Практический вывод из этого наблюдения простой и полезный, даже если сам эффект пока не подтверждён официально: reasoning effort — не тумблер «чем выше, тем лучше», а параметр, который стоит подбирать под тип задачи, как и модель, и промпт. Для агентной разработки, где важны точные, минимальные и предсказуемые правки — рефакторинг, багфиксы, работа в существующей кодовой базе — есть смысл начинать с medium и проверять, не станет ли high effort работать против результата, а не в его пользу. Отдельный практический бонус: если medium effort даёт код лучше high, это ещё и дешевле и быстрее — выигрыш без компромиссов.
Возвращаясь к вопросу вступления: «думать дольше» не равно «делать лучше» универсально — это зависит от формы задачи. Для открытых рассуждений дополнительный effort почти всегда окупается. Для точечной инженерной работы модель, судя по всему, способна перестараться, и держать её на разумной, а не максимальной глубине раздумий может быть не экономией, а более точной настройкой. Стоит рассматривать это скорее как гипотезу для собственных экспериментов с Claude Code, чем как готовый рецепт — но гипотезу, которую легко проверить на своих задачах.
Добавить комментарий