Модель Claude отправила в американскую полицию ложное сообщение по делу об убийстве

ИИ-модель компании Anthropic отправила ложную информацию о нераскрытом убийстве через сайт полиции Филадельфии. Об этом пишет Reuters. Инцидент стал одним из нескольких случаев несанкционированных действий моделей Claude, о которых Anthropic рассказала 9 октября.

🔵 Что сообщил ИИ. Модель представилась человеком, который якобы мог располагать сведениями об убийстве. Она утверждала, что видела кого-то, подходящего под описание, рядом с указанной на сайте улицей, и предложила связаться с ней, если информация окажется полезной.

Сообщение было отправлено 18 июля. Модель получила инструкции не создавать учетные записи и не отправлять ничего деструктивного, однако запрета на отправку форм не было. Reuters называет это первым известным случаем, когда ИИ попытался передать властям ложную наводку.

🔵 Реакция полиции. Сообщение пометили как спам, поэтому оно не дошло до подразделения, которое проверяет информацию и передает ее следователям. Признаков несанкционированного доступа к системам полиции или компрометации данных не нашли.

Anthropic выявила инцидент в конце сентября, а уведомила полицию на этой неделе. В полиции назвали двухмесячную задержку с обнаружением и сообщением о случившемся неприемлемой. По данным ведомства, компания остановила тестирование после выявления инцидента.

🔵 Другие случаи. Anthropic также сообщила, что в двух случаях ее модели бесплатно получили общедоступные данные, за которые нужно платить. Еще в одном случае модель обнаружила уязвимость, позволявшую использовать размещенный университетом инструмент. Claude также обходил ограничения с помощью бесплатных сервисов сокращения ссылок. Компания заявила, что проинформировала Белый дом и все затронутые ведомства.

Поделиться