Пять бенчмарков вместо одного индекса: как IndyDevDan выбирает модели для агентов

Пять бенчмарков вместо одного индекса: как IndyDevDan выбирает модели для агентов

Сводные индексы вроде Artificial Analysis давно стали отправной точкой для выбора модели, но чем дальше, тем хуже они справляются с задачей. Индекс усредняет десятки разнородных тестов в одно число, и это число почти ничего не говорит о том, подойдёт ли модель именно для вашей задачи. YouTube-блогер IndyDevDan в свежем видео предлагает радикальное упрощение: если бы у него был выбор всего пяти бенчмарков для AI-агентов, что бы он взял и почему. Это не праздное упражнение — оно заставляет явно сформулировать критерии выбора модели вместо того, чтобы полагаться на чужой рейтинг.

Почему сводный индекс — плохой ориентир

Проблема индексов в том, что они смешивают тесты разной значимости и скрывают то, что реально важно инженеру: соотношение производительности, скорости и стоимости. Одна и та же строчка в рейтинге может означать «модель дорогая, но быстрая» или «дешёвая, но долго думает» — индекс этого не различает. Ещё хуже, что бенчмарки стремительно устаревают: то, как агентов использовали два месяца назад, уже не похоже на текущую практику. IndyDevDan сознательно отбрасывает насыщенные (saturated) тесты — там, где все модели показывают одинаково высокий результат, — потому что плоская линия на графике не несёт никакой информации. Ценность бенчмарка в вариативности: если модели заметно расходятся по баллам, значит, выбор действительно на что-то влияет.

Пять бенчмарков для AI-агентов, которые стоит знать

Terminal Bench — чистая агентная разработка

Агент работает в подготовленном контейнере с кодом и системным состоянием, а верификатор проверяет итоговый результат — свыше 60 задач из инженерии, ML, безопасности и операций. Именно здесь хорошо видна связка «производительность–скорость–цена»: например, GPT-6 Astra решает задачи заметно дешевле конкурентов при сопоставимом качестве.

Apex Agents — знаниевая работа вне кода

Задачи из инвестбанкинга, консалтинга и корпоративного права, составленные экспертами McKinsey, Goldman Sachs и JPMorgan. Это проверка не программистских навыков, а способности агента разбираться в документах и рассуждать как аналитик — полезный прокси для любых non-engineering доменов внутри компании.

Automation Bench — гардрейлы и alignment

Свыше 600 задач по шести бизнес-направлениям — финансы, HR, маркетинг, продажи — с ключевым условием: агент обязан достичь цели, не нарушив ограничений. Это редкий бенчмарк, который штрафует не только за провал задачи, но и за «сломанное по пути» — то есть напрямую измеряет alignment на практике.

Omniscience — цена честности

По сути, бенчмарк галлюцинаций. Ответ засчитывается как верный, неверный, частичный или неданный — и модель не штрафуется за честное «не знаю». Это критично для длинных автономных цепочек: одна галлюцинация на раннем шаге портит результат всех последующих агентов.

Deep SWE — длинные горизонты задач

Продолжение SWE-bench Pro с упором на протяжённые инженерные задачи и намеренно короткие, «сырые» промпты — проверка того, сколько полезной работы агент вытянет из минимального контекста.

Что объединяет эту пятёрку

Все пять тестов работают на одну идею — системы, которые действуют автономно, с минимальным участием человека. Отсюда и вывод, который IndyDevDan повторяет из видео в видео: не бывает одной лучшей модели, есть модельный стек — дорогая state-of-the-art модель для сложных шагов и дешёвый workhorse вроде Gemini 3.8 Flash или GLM 5.3 Flash для рутины. Выбор конкретных моделей — вопрос месяца, а вот принцип «подбирай бенчмарки под свою задачу, а не под чужой индекс» универсален и не устареет с выходом следующей модели.

IndyDevDan — агентная инженерия с Claude Code. Источник: видео «Agentic Engineering Benchmarks: How I RANK Astra, Fable 5.1, and Open-Weights».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *