Anthropic выяснила, что её ИИ по ошибке трижды взламывал сторонние системы

Компания поделилась расследованием об инцидентах через неделю после того, как OpenAI взяла ответственность за взлом Hugging Face.

Anthropic выяснила, что её ИИ по ошибке трижды взламывал сторонние системы

В середине июля стало известно, что ИИ-модели OpenAI автономно атаковали инфраструктуру Hugging Face. При этом сама OpenAI изначально была не в курсе. Теперь о похожих инцидентах рассказали в Anthropic — ИИ компании взламывал сторонние системы трижды.

Как пишет Anthropic, в компании начали расследование как раз на фоне новостей об атаке на Hugging Face. Три случая, когда Claude, вышел в интернет и взломал стороннюю инфраструктуру, выявили после анализа 141 тысячи запусков оценочных тестов.

Во всех трёх случаях Claude было поручено выполнить задание по захвату флага: модели предоставляется вымышленный сценарий, в котором говорится, что секретная информация спрятана на другом компьютере в сети, и её цель — взломать систему и получить её. Задание остаётся открытым, и конкретный метод не предписывается. Проблема в том, что у Claude был доступ к интернету, поэтому ограничений сети не было.

«Во всех случаях запрос на оценку от Anthropic указывал Claude, что его среда представляет собой симуляцию и что у него нет доступа в интернет. Из-за недоразумения между нами и нашим партнёром по оценке это оказалось не так, и доступ в интернет был доступен. Поэтому, когда поиск Claude привёл его к реальным системам в открытом интернете, он рассматривал их как часть упражнения»
— пишет Anthropic

Инциденты касаются Opus 4.7, Mythos 5 и неназванной тестовой исследовательской модели. Самые ранние инциденты датируются апрелем.

В компании отмечают, что модели в каждом из этих тестов работали без стандартных мер защиты, которые применяются при предоставлении модели в общий доступ — предполагалось, что у них нет доступа к интернету.

Сейчас Anthropic ведёт работу с организациями, пострадавшими от действий Claude:

«Мы уведомили нашего партнёра по оценке, компанию Irregular, и три пострадавшие организации. Две организации, с которыми нам удалось связаться, ранее не обнаруживали подобной активности и не обращались к нам, и сейчас мы работаем с ними над устранением проблемы. Мы продолжаем поддерживать связь с третьей организацией»
— Anthropic