WordPress получил критическую уязвимость, которую OpenAI-модель нашла за десять часов и примерно $25. Важна здесь не эффектная демонстрация возможностей модели, а новая экономика AppSec: первичный поиск дефектов стал достаточно дешевым, чтобы запускать его после каждого заметного изменения кода, а не по случаю аудита.
Одновременно тот же расчет работает для атакующего. Поэтому команда, которая выпускает продукт быстрее, чем проверяет его, теперь экономит не на безопасности, а на времени своего противника.
Что именно нашла модель
Как пишет Hacker News со ссылкой на данные Patchstack, Searchlight Cyber направила OpenAI GPT-5.6 Sol Ultra на код WordPress. За десять часов и примерно $25 модель построила рабочую цепочку от SQL-инъекции до удаленного исполнения кода без авторизации.
Цепочка объединяла две ошибки, исправленные в WordPress 7.0.2 от 17 июля. По отдельности они не давали захватить сайт, но вместе позволяли обойти обычную обработку параметров, создать администратора и перейти к исполнению кода.
Здесь нужна аккуратность. WordPress.org указал среди авторов отчета Адама Куеса из Assetnote и Searchlight Cyber. Это подтверждает происхождение находки, но не методику эксперимента и не цену в $25. Эти детали приводит Patchstack. Поэтому перед нами убедительный результат конкретного теста, а не доказательство, что любой репозиторий теперь можно полноценно проверить одной дешевой кнопкой.
Но и списать кейс на лабораторный фокус уже не получается. 6 августа WordPress выпустил 7.0.3 и рекомендовал установить обновление немедленно. Главным исправлением стала отраженная XSS-уязвимость на экране входа, доступная без авторизации и способная привести к исполнению PHP-кода. Ее обнаружила pwn.ai, работающая над автономным тестированием на проникновение. Еще одно исправление в этом релизе было отмечено за Anthropic.
Поток отчетов тоже вырос. По данным руководителя безопасности ядра WordPress Джона Блэкборна, которые приводит Patchstack, девять лет через HackerOne поступали десятки сообщений в месяц. В июле их стало 450. Сам по себе рост полезен: больше дефектов находят до того, как они остаются незамеченными. Проблема в том, что скорость выросла у обеих сторон.
Экономия на поиске переносит расходы на проверку
После выхода WordPress 7.0.2 первые попытки эксплуатации попали в сенсоры Patchstack примерно через 90 минут. Если считать с момента публикации исправления в основном репозитории, прошло три часа. Затем Patchstack заблокировал более 65 тысяч попыток с более чем 1,5 тысячи адресов. Эти цифры описывают заблокированные запросы к уязвимым версиям, а не подтвержденные взломы, но временное окно они показывают вполне ясно.
Для продуктовой команды это означает, что редкий ручной аудит перестает быть достаточной базовой практикой. AI-поиск уязвимостей экономически разумно запускать в CI/CD после каждого релиза или существенного изменения чувствительного кода. Не потому, что модель заменяет AppSec-инженера, а потому, что первичное просеивание кода теперь может стоить меньше, чем обсуждение бюджета на него.
Однако находка модели не равна подтвержденному багу. Рабочий процесс должен включать воспроизведение в изолированной среде, проверку достижимости уязвимого участка, оценку последствий, устранение дублей и человеческую приоритизацию. Иначе команда получит не защиту, а новый генератор срочных задач с убедительными формулировками.
История с WordPress показывает и другую ловушку автоматизации. Почти все WAF-правила, опубликованные в первые часы после июльского раскрытия, можно было обойти, включая правило самой Patchstack. Они искали маршрут атаки в URL, тогда как WordPress принимал тот же маршрут из тела POST-запроса. Быстро сгенерированная защита оказалась привязана к публичному примеру атаки, а не к механике уязвимости. AI способен ускорить такой карго-культ не хуже, чем поиск настоящих дефектов.
Что делать небольшой команде
Минимальный разумный контур теперь состоит из трех этапов: модель регулярно ищет подозрительные цепочки, автоматический стенд пытается их воспроизвести, человек решает, что исправлять и с какой срочностью. Первый этап резко подешевел. Два остальных никуда не исчезли.
Главный маркер на ближайшие месяцы не количество громких AI-находок, а доля отчетов, которые доходят до воспроизводимого эксплойта и исправления. Если инструменты начнут стабильно выдавать такие результаты на каждом релизе при сопоставимой цене, отдельный периодический аудит превратится в резервную проверку. А непрерывный AI-аудит станет такой же рутинной частью сборки, как тесты, только с более неприятной ценой пропуска.
