AI выиграл золото по математике. Почему тогда врёт итог в вашем отчёте

AI выиграл золото по математике. Почему тогда врёт итог в вашем отчёте

Парадокс на первый взгляд звучит абсурдно: модель, способная взять золото на математической олимпиаде, тут же путает сумму в обычном отчёте о продажах. Но противоречия здесь нет. Проверка чисел в отчётах ИИ — это не вопрос того, умеет ли модель считать. Это вопрос того, где именно в потоке текста она решает посчитать, а где — предсказать следующее слово, похожее на правильный ответ.

Два пути для каждого числа

Когда AI генерирует отчёт, презентацию или сводку, у каждой цифры внутри есть два возможных пути. Первый — модель останавливается, пишет код и вычисляет число точно, как калькулятор. Второй — она продолжает предсказывать следующий токен, опираясь на то, что «обычно» стоит в таком месте текста, и выдаёт правдоподобную, но не обязательно верную цифру. Первый путь — это математика. Второй — это угадывание, замаскированное под математику, и именно по нему AI идёт по умолчанию внутри любой более крупной задачи, потому что вычисление там не выделено в отдельный шаг.

Два источника ошибок: копирование и расчёт

Числа в отчётах попадают туда двумя путями. Первый — простое извлечение: модель переносит цифру из таблицы, счёта или презентации без искажений. Второй — вычисление: сумма, доля, среднее, что-то посчитанное «по дороге» между источником и готовым документом. Ошибки прячутся именно на стыке — там, где нужно было явно вычислить, а модель вместо этого продолжила писать текст. Отсюда и практическое правило: если в задаче есть цифры, которые должны быть точными, расчёт должен стать отдельным шагом, а не побочным продуктом написания текста.

Три сценария проверки чисел в отчётах ИИ

Разовая задача

Для одноразового отчёта или презентации достаточно добавить в промпт финальный шаг: перед выдачей результата перечислить все числа, пересчитать те, что требуют вычислений, — явно указав модели использовать код, а не интуицию, — и вывести таблицу из трёх колонок: число, источник или формула, статус (совпало / не совпало / не проверено). Статус «не проверено» — не баг, а сигнал: он честно показывает человеку, куда посмотреть, вместо того чтобы модель тихо оставила подозрительную цифру как есть.

Регулярные задачи и project/skill-инструкции

Если похожие задачи повторяются, эту же логику стоит зашить в инструкцию skill или проекта — независимо от модели. Ключевое дополнение здесь — явная смена стимула: сказать модели, что отсутствие ответа лучше неверного ответа, а не наоборот. AI по умолчанию оптимизирован на то, чтобы дать хоть какой-то ответ и не разочаровать пользователя; фраза о том, что неверное число втрое хуже пустого поля, ломает этот стимул и заметно снижает долю тихих ошибок.

Высокие ставки: независимый субагент

Для длинных или финансово значимых задач — часов работы, сотен файлов, юридических или репутационных рисков — самопроверка ненадёжна: модель, которая делала расчёт, склонна и проверять его теми же допущениями. Здесь помогает subagent со свежим контекстным окном: ему передают черновик и исходники, и его единственная задача — перепроверить числа с нуля. Тот же принцип можно оформить как отдельный checker-skill, который подключается к любой числовой задаче, а не пишется заново под каждую.

Почему это важно для агентных пайплайнов

Для тех, кто строит автоматизацию на Claude Code, это не абстрактный совет, а конкретный паттерн проектирования агентов. Doer-skills, которые выполняют задачу, и checker-skills, которые её перепроверяют, — разные роли, и их не стоит совмещать в одном проходе модели. Если пайплайн регулярно генерирует отчёты, сводки или дайджесты с цифрами внутри, отдельный шаг верификации через subagent обходится дороже по токенам, но именно он превращает «модель, которая умеет считать», в «систему, которой можно доверять числа».

Вывод

Способность решать олимпиадные задачи и склонность ошибаться в простом отчёте — не противоречие, а следствие одного и того же механизма: AI считает точно только тогда, когда расчёт выделен в отдельный, явно обозначенный шаг. Проверка чисел в отчётах ИИ решается не более умной моделью, а более точной постановкой задачи — и это стоит нескольких минут на настройку промпта или skill, которые потом работают автоматически на каждом отчёте.

Dylan Davis — AI-автоматизация и рабочие процессы. Источник: видео «AI Won Gold at Math. Your Report Total Is Still Wrong».

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *