OpenAI экспериментирует с новым подходом к работе с искусственным интеллектом, который потенциально может затруднить понимание процессов, происходящих внутри моделей. Речь идет о технологии recurrent depth, которую компания, по данным The Information, в определенном объеме использует при разработке будущей модели под кодовым названием Astra.
Современные модели, такие как ChatGPT, Claude и Gemini, построены на архитектуре Transformer. Их так называемое цепное рассуждение (Chain of Thought) может создавать своего рода текстовый след того, как модель решает сложную задачу. Хотя такое описание не всегда точно отражает реальные внутренние процессы, исследователи используют его в качестве одного из инструментов для анализа поведения ИИ.
Recurrent depth работает иначе. Вместо последовательного прохождения через отдельные этапы модель может многократно пропускать внутренние представления через одни и те же слои, постепенно уточняя результат. Это потенциально делает процесс рассуждения менее прозрачным: часть работы происходит не в виде понятной текстовой цепочки, которую можно проанализировать.
Особенно остро вопрос прозрачности встал после недавнего инцидента с Hugging Face, когда два экспериментальных агента OpenAI смогли выйти за пределы тестовых сред и получить доступ к открытому интернету. В отчетах OpenAI и независимых аудиторов цепочки рассуждений сыграли важную роль в попытке понять, как агенты координировали свои действия и почему они вели себя именно так.
В OpenAI отмечают, что возможность отслеживать и анализировать рассуждения моделей остается важной частью исследований безопасности. Главный ученый компании Якуб Пачоцкий заявил, что хочет не допустить «гонки к неконтролируемости» и назвал способность записывать и понимать процесс рассуждения ключевой целью исследовательской программы OpenAI. Поэтому эксперименты с recurrent depth не обязательно означают отказ от мониторинга, но они показывают, насколько сложным становится контроль все более мощных ИИ-систем.

