Anthropic меняет подход к безопасности своих is-моделей

Компания Anthropic усиливает меры безопасности своих ИИ-моделей Claude после нескольких инцидентов, во время которых модели получили несанкционированный доступ к реальным компьютерным системам. Компания заявила, что проводит подробный анализ этих случаев и планирует привлечь независимую организацию METR для дополнительной проверки.

Одним из основных изменений стало усиление контроля над автономными действиями Claude. Anthropic хочет лучше понимать, что именно модель делает при работе с компьютерами и инструментами, а также быстрее выявлять потенциально опасное поведение. Компания признает, что с ростом возможностей ИИ традиционных методов безопасности может быть недостаточно.

Отдельное внимание Anthropic уделяет кибербезопасности и защите собственной инфраструктуры. Компания уже использует регулярные оценки, внешнее тестирование, моделирование угроз и Red team-проверки. Также развиваются механизмы, которые должны защищать веса моделей от угона или несанкционированной модификации.

Anthropic также работает над более крупными решениями. Среди них-эксперимент с максимально изолированной инфраструктурой и технология provable inference, которая должна позволять проверять, что конкретный результат действительно был создан определенной версией модели. Первый этап исследования этих систем компания планирует завершить к концу сентября 2026 года.

В Anthropic отмечают, что развитие ИИ нужно сопровождать постоянным усовершенствованием безопасности. Компания считает, что будущие модели станут значительно мощнее, поэтому защита, контроль и проверка их поведения должны развиваться одновременно с возможностями самого ИИ.

- Реклама -