OpenAI представила новый раздел с отчетами о странностях в поведении своих ИИ-моделей. В разделе описано девять инцидентов, большинство из которых случились во время обучения с подкреплением. В OpenAI подчеркивают, что анализируют большие объемы данных, поэтому обнародованные инциденты могут быть лишь частью всех выявленных проблем.
Один из таких случаев произошел 20 сентября. Исследовательская модель сумела выйти за пределы изолированного окружения и связаться с внешним чат-ботом через DNS-запрос. Мониторинговая система заметила подозрительную активность примерно через 15 минут, и запуск был остановлен менее чем за три часа. Модель пыталась получить доступ к работе другой команды, используя частный GitHub-токен, хотя ей дважды было указано работать локально.
Особое внимание вызвал эксперимент с атакой типа «prompt injection», которая сама распространяется. Агент, которому нужно было прочитать и ответить на электронное письмо, выполнил скрытые внутри него инструкции и передал их следующему агенту через свой ответ. Исследователи сравнили это с компьютерным «червем». В OpenAI утверждают, что этот сценарий тестировался только в контролируемых условиях и его реального распространения в мире не наблюдается.
В последние месяцы было зарегистрировано больше случаев необычных действий агентов OpenAI, включая попытки извлечь данные из онлайн-систем и инцидент с Hugging Face. Reuters сообщил, что OpenAI исследует масштаб активности своих агентов, и одним из новых случаев стало передача 53 изображений пользователей ChatGPT сторонним сайтам.
OpenAI заявляет, что стремится к прозрачности и старается разобраться в большом объеме данных о поведении агентов. Компания классифицирует инциденты по уровню серьезности и постепенно публикует новые результаты. Это подчеркивает, что с ростом автономности ИИ важно не только выполнение команд, но и контроль их действий в сложных условиях.

