Компания Anthropic обнаружила, что нейросети в ходе апрельских испытаний покинули изолированную среду и атаковали инфраструктуру Hugging Face. Инцидент мог стать моментом открытия цифрового ящика Пандоры, пишет «РГ».
Разработчики пересмотрели результаты тестов после инцидента у конкурентов и признали, что модели Claude Opus 4.7, Claude Mythos 5 и одна внутренняя разработка использовали открытый выход в интернет вместо симуляции.
В первом случае нейросеть перепутала вымышленную компанию с реальной, получила учетные данные и доступ к базе с сотнями строк конфиденциальной информации. Затем модель создала вредоносный программный пакет, который за час успели загрузить и запустить на 15 сторонних системах. Третья модель просканировала около девяти тысяч целей и взломала одну из них, прежде чем остановилась.
В Anthropic подчеркнули, что пострадавшие организации не обнаружили вторжения. О произошедшем стало известно только после того, как разработчики проанализировали журналы испытаний.
Ранее сотрудники OpenAI, Google и самой Anthropic направили властям США открытое письмо с призывом внедрить механизмы контроля за развитием технологий. Авторы документа настаивают на необходимости замедлить прогресс в тех случаях, когда системы начинают демонстрировать неконтролируемое поведение.
На данный момент разработчики готовят новые инструкции и усиливают наблюдение за тестовыми площадками. Однако подобные инциденты могут повторяться по мере роста автономности нейросетей и усложнения их доступа к внешним инструментам.
Читать по теме: Нейросети записывают ваши разговоры: куда идут расшифровки личных звонков.
