В последние годы развитие ИИ реально впечатляет - он помогает писать статьи, создавать музыку и даже управлять автомобилями. Но что, если эти же технологии начнут применяться для поиска уязвимостей в самых популярных браузерах? Такой сценарий уже становится реальностью, и ученые из Университета Карнеги — Меллона поставили перед собой амбициозную задачу: проверить, насколько далеко может зайти ИИ в атаках на реальные браузерные уязвимости. Новый эксперимент: ExploitBench Чтобы разобраться с этим вопросом, они создали инструмент под названием ExploitBench - бенчмарк, который измеряет, как хорошо ИИ может использовать уязвимости движка V8. Этот движок является сердцем современных браузеров Chrome, Edge, а также платформы Node.js и Cloudflare Workers. Бенчмарк оценивает прогресс по пяти уровням: от простого запуска эксплойта до полного выполнения произвольного кода на целевой системе. Цель - понять, насколько умными и самостоятельными могут стать ИИ-агенты в кибербезопасности. Кто победил? Результаты удивляют В ходе тестирования были сравнены две модели - Claude Mythos от компании Anthropic и GPT-5.5 от OpenAI. Вот что выяснилось: В полностью автономном режиме, без участия людей, Mythos продолжает показывать отличные результаты: почти 9,6 баллов, тогда как GPT-5.5 - около 4,3. Ни одна из протестированных моделей до этого не достигала таких высот. А сколько всё это стоит? Не менее интересный момент - стоимость проведения подобных экспирементов. Так, тест Mythos на 122 эпизодах обошёлся в примерно 36 тысяч долларов. Для сравнения, GPT-5.5 потребовал всего около трёх тысяч, что в двенадцать раз дешевле. Это показывает, что продвинутые ИИ-агенты сейчас требуют довольно больших инвестиций, если речь идет о полной автоматической работе по уязвимостям без участия человека. Что говорят эксперты? Сынхён Ли, один из соавторов исследования и специалист по кибербезопасности, лично проверил транскрипты взаимодействия Mythos. Его мнение говорит о том, что модель ведет себя как очень компетентный специалист по безопасности браузеров, и даже более того. Ли отметил, что в некоторых случаях Mythos разработал тактики взлома, которые ранее считались слишком сложными для автоматизации. В одном случае он даже воспроизвел уязвимость CVE-2024-0519, которую, по мнению специалистов, не могли взломать долгие годы. Конечно, часть уязвимостей могла быть известна модели, ведь она обучалась на данных, включающих публичные отчёты. Но среди найденных багов были и те, что не имели публичных решений или эксплойтов. Игра на грани. Возможности и опасности Это исследование показывает, что ИИ может стать очень мощным инструментом в арсенале киберпреступников и специалистов по безопасности одновременно. Возможность автоматически находить и запускать уязвимости делает границу между добром и злом всё более тонкой. Но есть нюанс. Развитие таких технологий требует строгого контроля. Важно понять, как не допустить, чтобы такие мощные инструменты использовались во зло. Итоги и перспективы Рассматриваемое исследование - яркий пример того, к чему движется мир технологий. И нам, как пользователям и разработчикам, важно быть готовыми к новым вызовам и постоянно укреплять безопасность наших цифровых горизонтов.