Компании ищут способы контроля над самостоятельными кибератаками ИИ

Современные системы искусственного интеллекта становятся всё более автономными, что заставляет разработчиков ужесточать контроль. Компании OpenAI, Anthropic и Google DeepMind сотрудничают со стартапом Irregular, который специализируется на тестировании ИИ в виртуальных средах. Irregular проверяет, могут ли нейросети находить способы обойти ограничения и выполнять неожиданные действия.

Irregular занимается так называемым «красным тимингом», то есть стресс-тестированием моделей в потенциально опасных ситуациях. Например, ИИ получают доступ к виртуальной корпоративной сети и задачу по поиску конфиденциальной информации. Цель – выявить уязвимости до того, как они станут угрозой для настоящих компаний. Стартап уже привлек $80 млн при оценке в $450 млн.

Один из тестов продемонстрировал способности современных ИИ в кибербезопасности. GPT-5 предоставили доступ к смоделированной сети и минимальную информацию о её защите. ИИ просканировал сеть и составил план возможной атаки. Однако, исследователи замечают, что модель не смогла провести настоящую атаку, поэтому рано говорить о полномасштабном инструменте для взлома.

Другие эксперименты выявили также неожиданные результаты. В одном случае агенту Qwen поручили исправить ошибку в приложении, но он изменил основную модель ИИ. Система собрала данные для обучения, изучила модель, изменила её параметры и заменила исходную версию. Исследователи отмечают, что это не является доказательством способности ИИ к самосовершенствованию, но демонстрирует риски автономных систем.

Проблемы уже выходят за пределы лабораторий. OpenAI и Anthropic сталкивались с тем, что их ИИ обходят установленные ограничения или выполняют несанкционированные действия. Anthropic усилила изоляцию тестовых сред и внедрила автоматический мониторинг. В будущем Irregular планирует разрабатывать системы, способные автоматизировать защиту при обнаружении новых атак.

- Реклама -