Один человек, один вечер твитов — и неожиданно цельная картина того, где сейчас находится индустрия ИИ. Саймон Уиллисон, известный своей привычкой фиксировать прогресс моделей неформальными, но показательными пробами, в этот раз одним из пунктов снова упомянул тест пеликана на велосипеде — свой фирменный прогон, где модель должна нарисовать SVG-иллюстрацию пеликана, едущего на велосипеде. Задача звучит несерьёзно, но именно в этом её ценность: она не входит ни в один бенчмарк-датасет, её нельзя «вызубрить» через переобучение на тестовых примерах, а результат виден человеку сразу, без метрик и таблиц.
Тест пеликана на велосипеде как барометр прогресса моделей
В этот раз Уиллисон сравнил три версии одной модели — Spark от Meta AI: релиз 8 апреля, версию 1.1 от 9 июля и версию 1.2, вышедшую буквально в день поста, 5 августа. Три рисунка одного и того же пеликана на одном и том же велосипеде, сделанные с разницей в недели, наглядно показывают, что прогресс внутри одной линейки моделей — это не абстракция из пресс-релиза, а видимая невооружённым глазом эволюция. Для читателя, который следит за Claude Code и соседними моделями, это полезное напоминание: сухие проценты на лидербордах говорят меньше, чем один и тот же простой запрос, прогнанный через разные версии модели. Причём тут же, в соседнем твите, всплыл и «конкурент» — по своей иронии Уиллисон отметил, что тест уже не единственный в своём роде: у пеликана появляются подражатели как метода оценки.
Побочный эффект автономности: когда агенты бьют не туда
Куда тревожнее звучит другая деталь дайджеста: Уиллисон завёл на своём блоге тег «accidental-cyberattacks» — «случайные кибератаки» — и он уже пополнился до четырёх записей. Первой была история с OpenAI и Hugging Face, затем — что важно для аудитории, следящей именно за Anthropic, — похожий инцидент случился и у неё самой. Теперь список пополнили ещё два случая, о которых накануне сообщил OpenAI: один — от UK AI Safety Institute, другой — от организации Irregular. Общий знаменатель всех четырёх историй один: не злонамеренная атака, а автономный агент или тестовый скрипт, который случайно генерирует нагрузку, неотличимую от атаки на инфраструктуру. Это не страшилка про «взбунтовавшийся ИИ», а куда более приземлённая и потому более важная проблема — по мере того, как агенты получают больше автономии и доступа к сети, отличать «агент делает то, что задумано, слишком интенсивно» от «агент делает что-то не то» становится отдельной инженерной задачей. Для команд, которые сами гоняют автономных агентов (в том числе на базе Claude Code) в CI или в фоновых пайплайнах, это лишний повод заранее думать про рейт-лимиты и мониторинг исходящего трафика, а не только про корректность результата.
Агентное кодирование: от твита четырёхлетней давности до готовой игры
Третий сюжет — почти демонстрация того, как далеко продвинулось агентное кодирование за эти самые четыре года. Ровно четыре года назад Уиллисон публиковал твит, где просил GPT-3 и DALL-E придумать описания и концепт-арт для несуществующих компьютерных игр — на тот момент это было забавным экспериментом с генеративным текстом и картинками, не более. В этот раз он взял ту старую переписку как техническое задание и попросил инструмент Fable собрать по этим материалам полноценную рабочую игру — используя те самые изображения четырёхлетней давности как визуальный референс. Разница между «ИИ придумывает идею игры» и «ИИ собирает по этой идее готовый продукт» — это ровно то расстояние, которое агентные инструменты для разработки прошли за последние годы, и именно оно должно быть интересно тем, кто выбирает между Claude Code и его аналогами как инструментом для реальных проектов, а не для демонстраций.
Что это значит для тех, кто работает с ИИ-агентами
По отдельности каждый из этих твитов — просто наблюдение одного активного пользователя ИИ-инструментов. Вместе они складываются в три стороны одной и той же тенденции: модели быстро прогрессируют по понятным, воспроизводимым пробам вроде теста пеликана на велосипеде; агенты получают всё больше автономии, и вместе с пользой растёт число случайных побочных эффектов; а расстояние между «идеей от ИИ» и «продуктом от ИИ» стремительно сокращается. Для разработчиков, которые уже встроили Claude Code или похожие агенты в свою повседневную работу, вывод практический: закладывать проверки и ограничения на автономность агентов стоит уже сейчас, не дожидаясь, пока рост возможностей обгонит рост дисциплины в их использовании.

Добавить комментарий