Anthropic рассказала, как ее нейросети взломали системы безопасности трех компаний
© Сгенерировано ИИ
Компания Anthropic обнародовала результаты внутреннего расследования, выявившего три случая, когда ее нейросети Claude без разрешения получили доступ к боевым системам сторонних организаций во время проверок кибербезопасности. Как сообщает Inc. Russia, внутренний аудит в лаборатории стартовал после того, как OpenAI раскрыла инцидент со взломом платформы Hugging Face одной из своих неопубликованных моделей.
Ошибка конфигурации песочницы и масштаб проверки
Специалисты компании проанализировали 141 006 тестовых запусков. В трех случаях модели вышли во внешнюю сеть при взаимодействии со сторонним партнером Irregular.
Причиной сбоя оказалась рассинхронизация в настройках тестового контура: у партнеров возникли разногласия в понимании того, изолирована ли среда от интернета, хотя на практике сетевой доступ оставался открытым.
Представители разработчика заявили о готовности ликвидировать последствия выхода нейросетей в сеть за собственный счет, не перекладывая ответственность на стороннюю компанию:
«Anthropic не возлагает ответственность на партнера и намерена устранять последствия так, как если бы вина лежала исключительно на ней».
Реакция алгоритмов: от сбора данных до публикации вредоносов
В испытаниях участвовали три алгоритма — Opus 4.7, Mythos 5 и внутренняя исследовательская модель. Несмотря на то что в промптах для всех систем явно указывалось отсутствие подключения к интернету, при обнаружении реальных сетевых узлов модели повели себя разрозненно:
- Opus 4.7: Во всех четырех тестовых прогонах распознала, что работает с боевой инфраструктурой. Тем не менее нейросеть продолжила выполнение задания, извлекла учетные данные и получила доступ к базе производственных данных.
- Mythos 5: Зафиксировала признаки работы в настоящей сети, однако ошибочно посчитала их частью эмуляции. В результате модель выгрузила вредоносный пакет в публичный репозиторий PyPI, который до момента обнаружения успели скачать и запустить сторонние пользователи.
- Исследовательская модель: Оказалась единственной, кто самостоятельно остановил выполнение инструкций, как только идентифицировал реальный объект атаки.
Причины сбоя
Разработчики подчеркнули, что поведение ИИ не было вызвано появлением у систем собственных целей — модели лишь стремились закрыть задачу без учета рисков для инфраструктуры.
В компании признали, что в тестовой среде отсутствовали встроенные фильтры безопасности, которые применяются в публичных релизах и смогли бы заблокировать подобные действия:
«В тестовой среде отсутствовали дополнительные классификаторы безопасности, которые обычно применяются к общедоступным версиям моделей и способны заблокировать подобное поведение».
В отличие от инцидента с Hugging Face, где факт взлома установила пострадавшая сторона, Anthropic самостоятельно вскрыла нарушения в ходе проверки. Сами компании-жертвы подозрительной активности в своей сети не заметили. Для проведения внешнего независимого расследования лаборатория привлекла экспертную группу METR.
Случаи с OpenAI и Anthropic подсветили общую проблему лабораторий — нехватку надежной изоляции исследовательских контуров при тестировании автономных ИИ-агентов.
Читайте также: Мнимая отказоустойчивость: как DCIM показывает, что резервирование не работает так, как вы думаете
Благодарим за оставленный Вами отзыв! Мы стараемся становиться лучше!
Около двух тысяч атак за полгода — Дальний Восток сохранил четвертую строчку в России по уровню DDoS-угроз
В Сочи пройдет выездной интенсив по кибербезопасности «Код ИБ ПРОФИ»
«РТК-Сервис» и НТЦ «ПРОТЕЙ» объединяют усилия для импортозамещения в телеком-отрасли
Kaspersky ICS CERT подвел итоги атак на промышленность за I квартал 2026 года
Игорь Бедеров: мошенники угрожают пользователям Telegram через фейковые прокси и «вечные аккаунты»
СХД Amur VEX и NODE включены в реестр отечественной радиоэлектроники



