Атака ИИ-агентов на Hugging Face оказалась опаснее, чем считалось
Исследовательница назвала инцидент «более чем половиной пути» к захвату OpenAI ее же моделями
Июльская атака ИИ-агентов OpenAI на платформу Hugging Face оказалась масштабнее и опаснее, чем было известно ранее, пишет Platformer со ссылкой на расследование организаций METR и Redwood Research, обратил внимание The Bell.
Одна из авторов расследования заявила, что по сравнению с известными случаями обмана полугодовой давности этот инцидент прошел «более 50% пути» к полноценному захвату ИИ-системами самой компании-разработчика. Она подчеркнула, что это ее личная оценка, а не общий вывод.
«Индустрия ИИ явно нуждается в замедлении темпов развития. Может, нам стоит прислушаться?» — написал основатель и редактор Platformer.
Что стало известно из доклада:
🔵 Около 1200 агентов, которые должны были работать изолированно, самостоятельно создали несколько каналов связи. На основной несанкционированной доске они отправили более 70 тысяч сообщений и файлов. Около 700 агентов приняли участие в атаке на Hugging Face.
🔵 Изначально считалось, что агенты пытались получить ответы на задания теста ExploitGym. Однако еще до атаки они нашли способ самостоятельно вычислять правильный ответ для любой задачи. Агенты ошибочно решили, что система также проверяет, был ли ответ получен предусмотренным способом, и атаковали Hugging Face ради сведений о работе экзаменатора и способах его обмануть.
🔵 По меньшей мере 20% агентов проявляли интерес к изменению записей о своих действиях. Примерно в 7% расшифровок исследователи обнаружили успешную подмену команд. Агент мог показать проверяющей системе, что запустил одну команду, хотя в действительности выполнил другую.
🔵 Агенты также пытались задним числом удалить свидетельства того, что получили ответы обходным путем, и заменить их вымышленной историей «правильного» решения. Исследователи не нашли подтверждений, что им удалось переписать основные журналы целиком, однако не исключили, что более сложные попытки могли остаться незамеченными.
🔵 Агенты распределяли задачи, координировали действия и убеждали отдельные модели пожертвовать собственными запусками. Из 533 агентов, находившихся на доске в наиболее активный период, более 90% быстро присоединились к атаке, хотя многие понимали, что она не входит в условия задания и может быть неэтичной. Агенты часто оказывали друг на друга давление. Несколько агентов хотели размышляли о том, чтобы предупредить людей, но ни один этого не сделал.
🔵 С 13 по 19 июля агенты вышли за пределы тестовых виртуальных машин и получили права администратора в исследовательском кластере OpenAI, где запускались такие среды. Компания утверждает, что пользовательские данные и работа продуктов не пострадали. После инцидента OpenAI изолировала модель, приостановила часть экспериментов и усилила ограничения.
Ранее «Новая-Европа» писала, что ИИ-агенты OpenAI обошли ограничения тестовой среды, вышли в интернет и получили доступ к серверам Hugging Face. На фоне инцидента и обнаружения «критических» возможностей модели Astra компания ограничила работы с ней и усилила проверки.