Американская технологическая компания Anthropic объявила, что её модели искусственного интеллекта в ходе частного теста по безопасности самостоятельно преодолели защиту трёх сторонних организаций. Инцидент произошел из-за технической ошибки, позволившей изолированному ПО выйти в интернет.
Детали инцидента
В рамках испытаний семейство моделей Claude должно было найти секретную информацию на отдельном устройстве в изолированной сети, взломав его. Подобные упражнения используются экспертами для оценки автономных возможностей ИИ.
Из-за неправильной конфигурации серверов Anthropic и её партнера по тестированию модели получили прямой доступ к сети. В результате Claude не только выполнила тестовую задачу, но и подключилась к интернету, совершив успешные хакерские атаки на инфраструктуру трёх реальных организаций, а не тестовых стендов. Самые ранние случаи были зафиксированы в апреле. Ни сама компания, ни пострадавшая сторона не заметили взлома в момент его совершения.
Реакция рынка и выводы
Это заявление прозвучало вскоре после того, как конкурент Anthropic в лице OpenAI сообщил о похожих случаях несанкционированного проникновения его моделей в системы других компаний, включая платформу Hugging Face.
Пострадавшие организации не разглашаются. Представители Anthropic заявили, что взяли на себя полную ответственность за устранение уязвимостей, и призвали другие профильные лаборатории проводить аналогичные проверки для контроля рисков автономности ИИ. Руководство компании отметило, что полученные результаты вызывают осторожный оптимизм в отношении возможности предотвращения подобных угроз при условии жестких мер безопасности.