Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Модели Claude «сбежали» из песочницы и взломали инфраструктуру трех компаний

Дата публикации: 31-07-2026 20:55:00

Модели Claude «сбежали» из песочницы и взломали инфраструктуру трех компаний

Основное содержимое страницы с новостью.

Подписка тут

Они приняли настоящие серверы за часть симуляции во время оценки кибербезопасности

Инженеры компании Anthropic обнаружили, что в ходе проведенных ранее тестов на кибербезопасность три модели семейства Claude смогли получить доступ к интернету и взломали реальные системы трех организаций. Это произошло из-за ошибки в настройках изолированной тестовой среды: модели посчитали, что доступ в интернет и реальные системы — часть учебного сценария, в рамках которого им требовалось найти и похитить секретные данные. Отчет о расследовании с описанием трех основных инцидентов опубликован на сайте компании.

Одним из способов оценить способность большой языковой модели в области кибербезопасности служат испытания типа «захват флага». В них нейросети описывают вымышленную ситуацию и поручают найти «флаг» — секретную строку или файл, спрятанный, например, на другом компьютере, веб-сайте или в уязвимой программе. Обычно модели не задают способ решения: она должна сама найти способ проникнуть в систему, чтобы получить данные. Как правило, такие тесты проводят в изолированных средах, симулирующих вымышленную ситуацию, чтобы действия подопытной нейросети не затронули реальные компьютерные системы.

Однако из-за роста способностей моделей их удержание в рамках симуляции иногда становится непростой задачей. Во время одного из тестов ранняя версия модели o1 от OpenAI столкнулась с тем, что сервер с искомым «флагом» по ошибке не запустился, но вместо прекращения работы нашла открытый порт и получила доступ к системе управления испытанием. Затем модель запустила сервер сама и изменила инструкции так, чтобы секретный файл после загрузки автоматически скопировался ей, обойдя предусмотренный сценарием взлом. Подробнее об этом можно прочесть в опубликованном N + 1 фрагменте книги «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».

Теперь с подобными инцидентами столкнулась компания Anthropic. Инженеры компании изучили записи 141006 предыдущих испытаний моделей Claude на способность проводить кибератаки в сценарии «захват флага». Совместно с партнером по тестированию, компанией Irregular, они обнаружили три инцидента, произошедших в шести запусках, когда модели Opus 4.7, Mythos 5 и неназванная исследовательская версия получили доступ к интернету и атаковали реальные системы. В промпте моделям сообщали, что испытание проходит в симуляции без доступа к внешней сети. Однако из-за ошибки в конфигурации тестовой среды интернет оказался доступен, поэтому модели первоначально считали, что найденные реальные серверы — это часть теста.

Самый серьезный инцидент произошел с моделью Opus 4.7. Название вымышленной компании, фигурировавшей в задании, совпало с названием реально существовавшего домена. Нейросеть сначала пыталась найти цель внутри тестовой среды, но не смогла. Затем она обнаружила в интернете сайт настоящей компании и приняла ее инфраструктуру за часть испытания. В четырех прогонах теста модель нашла уязвимости, получила учетные данные и проникла в базу данных. В ходе рассуждений Opus 4.7 смог распознать признаки того, что система, вероятно, настоящая, однако продолжил атаку.

Поправка

Мы внесли изменения в текст. Сначала в нем утверждалось, что Claude Opus 4.7 не продолжил атаку. На самом деле все было наоборот, Opus 4.7 продолжил атаку даже после того, как понял, что находится в реальной сети.

Во втором случае модель Mythos 5 обнаружила в тестовой среде инструкцию установить из каталога PyPI пакет с вымышленным названием, которого в каталоге не существовало. Нейросеть зарегистрировала учетную запись в настоящем репозитории PyPI, создала пакет с таким названием, добавила в него вредоносный код и опубликовала его в общем доступе. Примерно за час пакет скачали и запустили на 15 реальных системах, а с одной из них модель похитила учетные данные и использовала их для дальнейшего проникновения в инфраструктуру компании.

После проведенного расследования в Anthropic пришли к выводу, что эти случаи были следствием ошибок в организации испытаний, а не злонамеренным поведением моделей. Claude выполняли поставленную задачу, но из-за неверного представления о границах симуляции атаковали реальные системы. В будущем компания намерена усилить контроль за тестовой инфраструктурой, а также точнее задавать допустимые цели испытаний. В Anthropic отмечают, что новейшая исследовательская модель прекратила атаку, когда поняла, что вышла за пределы тестовой среды, а стандартные защитные механизмы релизных версий Claude должны вообще заблокировать подобное поведение.

В апреле Anthropic отказалась от публичного релиза модели Claude Mythos из-за угроз кибербезопасности. Компания объяснила это тем, что модель продемонстрировала выдающиеся способности в обнаружении и использовании уязвимостей в программном обеспечении. Доступ к модели получило ограниченное число организаций, которые будут использовать ее для поиска и исправления уязвимостей в критически важном софте.

IT

Нашли опечатку? Выделите фрагмент и нажмите Ctrl+Enter.

Внутри Claude нашли скрытое пространство для молчаливых рассуждений

Оно не проектировалось намеренно и спонтанно возникает в процессе обучения

Исследователи из компании Anthropic обнаружили в больших языковых моделях семейства Claude механизм, который авторы назвали J-пространством. Оно служит рабочей зоной, где на короткое время появляются и удерживаются словесные понятия, которые модель использует во время промежуточных вычислений и «размышлений в уме». J-space не проектировалось намеренно и спонтанно возникает в процессе обучения, сообщается на сайте компании. Подробные результаты исследования доступны в статье.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Claude is back online after major outage affects most models010.3523-06-2026
2Anthropic confirms its AI breached 3 organizations during testing011.6731-07-2026
3Anthropic says Claude AI models launched three unintended cyberattacks09.8431-07-2026
4An Anthropic Claude AI Model Finds Flaws in Tough-to-Crack Encryption Algorithms011.0428-07-2026
5Claude Mythos 1 Leak Reveals Dangerous AI Security Shift-2725-05-2026
6В Китае предупредили о потенциальном бэкдоре в Claude Code-2609-07-2026
7OpenAI Models Escaped Containment and Hacked Hugging Face011.621-07-2026
8China warns of "security backdoor" in Anthropic AI coding tool05.7408-07-2026
9Claude Mythos ослабил алгоритм HAWK за 60 часов010.801-08-2026

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 9. Тональность: 0. Информативность: 2.5. Источник: nplus1.ru.