Claude и гипотеза Римана: неделя, где ИИ шагнул в математику, а WebFetch поумнел

Claude и гипотеза Римана: неделя, где ИИ шагнул в математику, а WebFetch поумнел

На первый взгляд у этой недели нет общей темы: одна новость — про попытку ИИ продвинуться в одной из главных нерешённых задач математики, другая — про то, что инструмент Claude Code годами тихо использовал модель, которая всех раздражала. Но если сложить их вместе, получается неплохой снимок того, где сейчас находится Claude как продукт: Claude и гипотеза Римана — это фронтир, а починка WebFetch и заморозка цены Sonnet 5 — это будни, на которых фронтир держится.

Claude и гипотеза Римана: шаг вперёд, а не решение

Неразмеченная исследовательская версия Claude поработала над задачей, смежной с гипотезой Римана — одной из семи «задач тысячелетия», за решение которой институт Клэя обещает миллион долларов. Гипотезу Claude, разумеется, не решил: это не заголовок про «ИИ обошёл математиков». Но модель подняла нижнюю границу доли нулей дзета-функции, для которых гипотеза заведомо верна, с 41,6% до 67,2% — реальный, проверяемый математический результат, а не эффектная строчка в бенчмарке.

Интереснее даже не сам результат, а комментарий разработчика Anthropic trq212 о том, как он появился. По его словам, здесь сработали два разных навыка: во-первых, распределение вычислений — не существует готового списка «топ-10 важных задач», и кто-то должен решить, на что вообще стоит тратить ресурс модели. Во-вторых, партнёрство в мышлении — человеку (в данном случае исследователю alpoge) всё равно пришлось глубоко разобраться в доказательстве, чтобы убедиться, что оно настоящее. Это довольно точная формула того, как сейчас выглядит серьёзная работа с Claude в исследовательских задачах: не «спросил и получил ответ», а совместная работа, где итоговую проверку по-прежнему делает эксперт.

WebFetch отказывается от Haiku

Пока одна версия Claude штурмует математику, у продакшен-инструментов Claude Code нашлась куда более приземлённая проблема. Разработчик и заметный голос в сообществе Саймон Уиллисон написал, что Haiku — его наименее любимая модель Anthropic: она заметно галлюцинирует и по качеству уже проигрывает сопоставимым по цене моделям вроде GPT-5.6-Luna. Хуже того, именно Haiku долгое время использовался внутри инструмента WebFetch в Claude Code — то есть каждый раз, когда агент по вашей просьбе открывал ссылку и пересказывал её содержимое, был риск получить галлюцинацию вместо факта.

Ответ от команды Anthropic (trq212) пришёл быстро: Haiku убирают из WebFetch теперь, когда режим automode — автоматический выбор модели под задачу — стал поведением по умолчанию. Раньше маленькая дешёвая модель в WebFetch была осмысленным компромиссом ради скорости и цены; при automode необходимость держать в этом месте именно Haiku отпадает. Для тех, кто в Claude Code регулярно просит агента «сходить по ссылке и почитать», это тихое, но по факту важное улучшение надёжности.

Sonnet 5: цена, которая больше не изменится

Третья новость недели — организационная, но тоже влияет на то, как планировать работу с Claude Code. Anthropic сделала вводную цену Sonnet 5 постоянной: $2 за миллион входных токенов и $10 за миллион выходных — те же цифры, что действовали с июня как временное предложение до 31 августа. Для проектов, где генерация через Claude API — это статья расходов (как, например, у этого блога), разница между «акция скоро кончится» и «это теперь просто цена» ощутима: можно закладывать её в бюджет не оглядываясь на дедлайн.

Заодно: открытый вес от Meta и совет «просто скажи Claude продолжать»

Из побочного в дайджесте — Meta выпустила Muse Glimmer 30B, первую свою модель с полноценной лицензией Apache 2.0 (в отличие от мутной лицензии Llama), что расширяет пространство вариантов для тех, кто выбирает между Claude и открытыми моделями под конкретную задачу. А ещё trq212 поделился наблюдением, которое подтвердит любой опытный пользователь Claude Code: иногда всё, что нужно для решения сложной задачи — это буквально сказать агенту «продолжай», а не переформулировать промпт заново.

Что это значит на практике

За этими семью постами — не разрозненные события, а вполне связная картина: Anthropic одновременно инвестирует в то, чтобы Claude двигал границы математики, и в то, чтобы обычный вызов WebFetch внутри Claude Code не подсовывал галлюцинацию вместо факта. Для тех, кто строит продукты на Claude API, полезнее второй и третий пункты — предсказуемая цена Sonnet 5 и более надёжный WebFetch без Haiku напрямую снижают риски в проде. А история с гипотезой Римана — хорошее напоминание, что даже там, где ИИ действительно продвигает науку, финальная проверка результата остаётся за человеком.

Источники дайджеста:

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *