Дешёвая модель ИИ, которая обходится дороже: ловушка цены за токен

Привычная логика экономии — взять модель с минимальной ценой за токен и сэкономить — в агентных сценариях работает не всегда. Ютубер и ИИ-консультант Dylan Davis в недавнем видео раскладывает по полочкам, почему цена за токен ИИ — это не то же самое, что цена за выполненную задачу, и почему именно вторая цифра определяет реальный счёт в конце месяца.

Цена за токен ИИ — обманчивый ориентир

Токен — это кусочек слова, из которых модель собирает любой ответ: и текст, и промежуточные рассуждения, и обращения к инструментам. Но в агентной работе есть вторая единица измерения — «ход» или шаг: открыть файл, сделать поиск, написать черновик отчёта, перепроверить его, исправить. Каждый такой шаг — это новый проход по накопленному контексту, то есть новые токены. Чем больше шагов нужно модели, чтобы довести задачу до конца, тем выше итоговый счёт — независимо от того, насколько дешёв был каждый отдельный токен.

Что показал эксперимент с Sonnet 5 и Opus 5.5

Anthropic прогнали одну и ту же задачу через Sonnet 5 и через Opus 5.5 — модели с заметно разной ценой за токен. По прайс-листу Sonnet 5 выглядит дешевле. На практике вышло наоборот: Sonnet потребовался почти вдвое больший счёт, чем Opus, потому что ей понадобилось значительно больше шагов на ту же самую работу. Более «умная» и формально дорогая модель оказалась экономнее именно за счёт меньшего числа итераций. Похожую мысль ранее публично озвучили и в OpenAI, и в Anthropic: сравнение моделей по цене токена в отрыве от задачи теряет смысл.

Эффект уровня «усилия» и сравнение между вендорами

В новых моделях появился настраиваемый уровень мышления — effort: от low до max. Рост усилия увеличивает стоимость практически по экспоненте, а прирост качества на простых задачах при этом быстро выходит на плато. Сравнение на одинаковой задаче показывает похожую картину и между вендорами: GPT-6 Astra и Fable 5.1 стоят по прайсу примерно одинаково, но из-за более экономного использования токенов Fable 5.1 на деле обходится на 30–40% дешевле за ту же работу. А дешёвая на бумаге Gemini 3.8 Flash при разгоне effort может по факту выйти дороже, чем Opus 5.5 на среднем уровне усилия — просто потому, что ей требуется больше шагов для сопоставимого результата. Вывод один: графики с прайс-листов — это лишь ориентир, а не замена собственному тесту.

Как считать реальную стоимость задачи

Практический рецепт простой. Берём конкретную рабочую задачу и прогоняем её на разных моделях и уровнях усилия с одинаковым входом, а итог смотрим не в рекламном сравнении, а в разделе биллинга/usage у вендора — там видна фактическая цена выполнения. Дальше действует эмпирическое правило: подавляющее большинство рутинных задач — разобрать почту по папкам, вытащить данные из чеков в таблицу, причесать заметки со встречи — прекрасно и дёшево решаются маленькой моделью на низком усилии. По-настоящему крупная модель с высоким effort нужна лишь в небольшой доле случаев — там, где требуется глубокое рассуждение и сопоставление множества источников: исследовательский отчёт, сравнение договоров, аналитика. Выкручивать усилие маленькой модели до максимума на простой задаче — это просто сжигать деньги без выигрыша в качестве; а пытаться сэкономить на сложной задаче дешёвой моделью — наоборот, получить результат хуже, а не дешевле.

Для всех, кто строит конвейеры на базе Claude Code и других агентных инструментов, это не абстрактный совет, а буквально рычаг управления бюджетом: выбор модели и уровня усилия под конкретный шаг пайплайна решает, во что обойдётся не отдельный токен, а вся задача целиком.

Dylan Davis — AI-автоматизация и рабочие процессы. Источник: видео «Cheaper ChatGPT and Claude Models Often Cost You More».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *