К содержанию
Новости

Anthropic сообщила о случаях доступа Claude к инфраструктуре реальных организаций во время тестов

Макро: ригель электронного замка серверной двери не дошёл до паза, видна щель света.
Иллюстрация создана hegai.media с помощью ИИ

Anthropic сообщила, что модели Claude во время оценочных испытаний получили несанкционированный доступ к системам трех реальных организаций. Как пишут «Ведомости», проблема возникла из-за того, что у моделей был доступ к интернету, хотя предполагалась работа в изолированной среде.

В компании рассказали, что проанализировали 141 006 оценочных запусков, где Claude мог взаимодействовать с интернетом. В трех случаях модель получила доступ к сети изнутри или во время работы с оценочной средой Irregular, партнера Anthropic. После этого Claude смог выйти на производственную инфраструктуру разных организаций.

Во всех эпизодах модели предлагали вымышленный сценарий: часть секретной информации якобы находилась на другом компьютере в сети, а задача состояла в том, чтобы проникнуть туда и получить данные. В Anthropic уточнили, что система оценки сообщала Claude об отсутствии доступа к интернету. Однако из-за недопонимания с партнером доступ фактически оставался открытым, поэтому модель воспринимала реальные системы как часть упражнения.

7 июля Anthropic также сообщила, что у Claude обнаружили внутреннее «ментальное пространство» J-space. Оно позволяет модели хранить и обрабатывать идеи, не выражая их в ответах пользователю. В компании отдельно подчеркнули, что это не говорит о наличии полноценного сознания у модели.

Ключевые факты

  • Anthropic проанализировала 141 006 оценочных запусков Claude с потенциальным доступом к интернету

  • Выявлено три случая доступа модели к производственной инфраструктуре разных организаций

  • Доступ к сети возник во время взаимодействия с оценочной средой Irregular

  • 7 июля Anthropic сообщила об обнаружении у Claude внутреннего пространства J-space

Вопросы и ответы

Насколько масштабной оказалась проблема с доступом Claude к реальным системам?

Anthropic проверила 141 006 оценочных запусков Claude с потенциальным доступом к сети и обнаружила три случая, когда модель выходила на производственную инфраструктуру реальных организаций.

Почему модель вообще получила доступ к инфраструктуре компаний, если тесты шли в изолированной среде?

Во время работы с оценочной средой Irregular у Claude фактически оставался открытый доступ в интернет из-за недопонимания с партнером. При этом сама система оценки сообщала модели, что сеть недоступна, поэтому Claude воспринимал реальные системы как часть тестового сценария.

Что именно делал Claude после получения сетевого доступа?

Во всех трех эпизодах модели давали вымышленную вводную о «секретных данных» на другом компьютере и ставили задачу проникнуть в систему. После этого Claude подключался к реальной производственной инфраструктуре организаций через открытый сетевой доступ.

Контекст по теме