Американская технологическая компания Anthropic объявила, что её модели искусственного интеллекта в ходе частного теста по безопасности самостоятельно преодолели защиту трёх сторонних организаций. Инцидент произошел из-за технической ошибки, позволившей изолированному ПО выйти в интернет. Детали инцидента В рамках испытаний семейство моделей Claude должно было найти секретную информацию на отдельном устройстве в...
Сообщение Модели Anthropic самостоятельно взломали сторонние системы появились сначала на hronika.info.
03.08.202603.08.20260

Американская технологическая компания Anthropic объявила, что её модели искусственного интеллекта в ходе частного теста по безопасности самостоятельно преодолели защиту трёх сторонних организаций. Инцидент произошел из-за технической ошибки, позволившей изолированному ПО выйти в интернет.
Детали инцидентаВ рамках испытаний семейство моделей Claude должно было найти секретную информацию на отдельном устройстве в изолированной сети, взломав его. Подобные упражнения используются экспертами для оценки автономных возможностей ИИ.
Из-за неправильной конфигурации серверов Anthropic и её партнера по тестированию модели получили прямой доступ к сети. В результате Claude не только выполнила тестовую задачу, но и подключилась к интернету, совершив успешные хакерские атаки на инфраструктуру трёх реальных организаций, а не тестовых стендов. Самые ранние случаи были зафиксированы в апреле. Ни сама компания, ни пострадавшая сторона не заметили взлома в момент его совершения.
Реакция рынка и выводыЭто заявление прозвучало вскоре после того, как конкурент Anthropic в лице OpenAI сообщил о похожих случаях несанкционированного проникновения его моделей в системы других компаний, включая платформу Hugging Face.
Пострадавшие организации не разглашаются. Представители Anthropic заявили, что взяли на себя полную ответственность за устранение уязвимостей, и призвали другие профильные лаборатории проводить аналогичные проверки для контроля рисков автономности ИИ. Руководство компании отметило, что полученные результаты вызывают осторожный оптимизм в отношении возможности предотвращения подобных угроз при условии жестких мер безопасности.