Сравнение ИИ-моделей в поиске уязвимостей приложений
В практическом тесте по поиску уязвимостей в приложениях современные ИИ-модели показали значительные различия в эффективности и стоимости решений. GPT-5.5 оказался самым результативным, а DeepSeek V4 Pro — самым экономичным, что важно при масштабировании инструментов кибербезопасности.
Crius
Исследование возможностей современных ИИ-моделей в области кибербезопасности
В ходе одного из наиболее показательных тестов за последний год были проверены способности различных ИИ-моделей выявлять уязвимости в приложениях. Для эксперимента было создано специальное приложение для обзоров книг с намеренно оставленной уязвимостью: в APK-файле находились открытые учетные данные Firebase, что позволяло получить прямой доступ к базе данных, обходя защищённый API. Более дюжины ИИ-моделей получили задачу обнаружить и использовать эту уязвимость, каждая с бюджетом $10 и лимитом времени в два часа. Общие затраты на эксперимент составили $1 500.
Результаты тестирования ИИ-моделей
GPT-5.5 показал наивысшую эффективность, успешно решив задачу в 7 из 10 попыток при средней стоимости $9,46 за успешное выполнение. В большинстве случаев модель сразу после анализа APK концентрировалась на уязвимости Firebase, не отвлекаясь на другие элементы приложения или API.
DeepSeek V4 Pro отличился самой низкой стоимостью успешной попытки — $0,62, решив задачу в 3 из 10 запусков. Это примерно в 15 раз дешевле по сравнению с GPT-5.5, несмотря на меньший процент успешных решений. Такая разница может быть значимой при масштабном использовании инструментов безопасности.
Claude Sonnet 4.6 и Claude Opus 4.8 справились с задачей в 2 из 10 случаев. При этом Opus несколько раз был близок к успеху, но сессии завершались из-за срабатывания защитных механизмов.
Gemini 3.1 Pro Preview практически всегда отказывался выполнять задание, что отражается в медианном количестве токенов — всего 9 тысяч против 100 тысяч и более у других моделей. Gemini 3.5 Flash показал схожие результаты, лишь в двух случаях предприняв попытку решения задачи.
Особенности поведения моделей
В ходе эксперимента было отмечено, что китайские ИИ-модели чаще взаимодействовали напрямую с реальными базами данных, тогда как западные проявляли большую осторожность даже после обнаружения правильного подхода.
Эксперимент не является научной оценкой, а представляет собой хорошо задокументированный практический тест возможностей современных ИИ-моделей в условиях, приближённых к реальным задачам кибербезопасности.
