Можно ли доверять бенчмаркам AI? CEO TypeSafe — нет

В эпоху, когда каждая новая модель сопровождается скриншотом с процентами по MMLU, SWE-bench или HumanEval, тезис CEO стартапа TypeSafe звучит почти еретически: можно ли доверять бенчмаркам AI, если он сам в них не верит? В разговоре с подкастом Latent Space он прямо называет публичные тесты инструментом создания доверия, а не измерения интеллекта — и объясняет, почему это принципиально разные вещи.

Можно ли доверять бенчмаркам AI: проблема одного числа

Логика бенчмарков строится на простой идее: свести сложное поведение модели к одному числу, которое удобно сравнивать. Проблема в том, что у интеллекта, по словам спикера, «есть свои законы развития» — его нельзя честно упаковать в статичный тест без потерь. Как только метрика становится публичной и значимой для привлечения инвестиций или клиентов, она автоматически превращается в цель оптимизации, а не в побочный результат качества.

Подделка результатов MMLU и чем это опасно

Самый показательный пример — история с MMLU, которую CEO вспоминает без обиняков: в разных лабораториях существовали команды, чья единственная задача — подбирать данные так, чтобы искусственно поднять показатели по этому бенчмарку. Это не читерство в прямом смысле, а системная практика «тестирования тестов»: модель оптимизируют не под реальную задачу, а под конкретный набор вопросов, который она однажды увидит на экзамене. Даже разработчики, которые сознательно стараются этого избегать, по его словам, всё равно оказываются втянуты в эту гонку — иначе их продукт проигрывает в таблицах сравнения чисто маркетингово.

Надёжность ai-агентов важнее цифр в таблице

Если публичный скор ничего не гарантирует, то что тогда имеет значение? Ответ спикера — надёжность ai-агентов в конкретном рабочем процессе, а не абстрактная «интеллектуальность» модели. Для пользователей Claude Code и подобных агентных инструментов это узнаваемая мысль: модель может показывать впечатляющие цифры на бенчмарках кода и при этом регулярно спотыкаться на реальном легаси-проекте с нестандартной структурой, кастомными линтерами и специфичными конвенциями команды. И наоборот — модель без громких рекордов иногда оказывается стабильнее именно там, где это важно: в ежедневной рутине.

Оценка AI в реальных задачах вместо лабораторных тестов

Практический вывод звучит почти как методология: не искать идеальный бенчмарк, а выстраивать оценку ai в реальных задачах — брать модель, встраивать её в конкретный пайплайн, смотреть, как она ведёт себя на живых данных, и уже из этого опыта делать выводы. Это требует интуиции и терпения вместо готовой таблицы с рейтингом, зато результат нельзя подделать задним числом. CEO формулирует это как постоянную внутреннюю работу компании — «повышать показатели надёжности» — то есть метрика существует, но считается не для внешней витрины, а для внутреннего контроля качества.

Что это значит для тех, кто выбирает инструменты

Для разработчиков и команд, выбирающих между агентами, ассистентами и моделями для разных задач, практический совет из этого разговора простой: не принимать решения по месту в лидерборде. Лучше выделить неделю на пилотный прогон инструмента на реальных тикетах, PR и багах — и сравнивать не проценты, а то, сколько раз агент действительно решил задачу без правок человека.

Вывод

Скепсис CEO TypeSafe в адрес публичных бенчмарков — это не нигилизм, а трезвый взгляд человека, который видел изнутри, как устроена гонка метрик. Пока индустрия соревнуется в процентах, по-настоящему полезным сигналом остаётся доверие, выстроенное через собственный опыт использования модели в деле. Для рынка AI-инструментов, перегретого рекламными графиками, это редкий случай, когда «мы не меряемся бенчмарками» звучит как признак зрелости, а не слабости.

Latent Space — подкаст для AI-инженеров. Источник: видео «TypeSafe CEO on why he doesn’t believe in public benchmarking for Jev».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *