Anthropic рассказала, как ее нейросети взломали системы безопасности трех компаний
© Сгенерировано ИИ
Компания Anthropic обнародовала результаты внутреннего расследования, выявившего три случая, когда ее нейросети Claude без разрешения получили доступ к боевым системам сторонних организаций во время проверок кибербезопасности. Как сообщает Inc. Russia, внутренний аудит в лаборатории стартовал после того, как OpenAI раскрыла инцидент со взломом платформы Hugging Face одной из своих неопубликованных моделей.
Ошибка конфигурации песочницы и масштаб проверки
Специалисты компании проанализировали 141 006 тестовых запусков. В трех случаях модели вышли во внешнюю сеть при взаимодействии со сторонним партнером Irregular.
Причиной сбоя оказалась рассинхронизация в настройках тестового контура: у партнеров возникли разногласия в понимании того, изолирована ли среда от интернета, хотя на практике сетевой доступ оставался открытым.
Представители разработчика заявили о готовности ликвидировать последствия выхода нейросетей в сеть за собственный счет, не перекладывая ответственность на стороннюю компанию:
«Anthropic не возлагает ответственность на партнера и намерена устранять последствия так, как если бы вина лежала исключительно на ней».
Реакция алгоритмов: от сбора данных до публикации вредоносов
В испытаниях участвовали три алгоритма — Opus 4.7, Mythos 5 и внутренняя исследовательская модель. Несмотря на то что в промптах для всех систем явно указывалось отсутствие подключения к интернету, при обнаружении реальных сетевых узлов модели повели себя разрозненно:
- Opus 4.7: Во всех четырех тестовых прогонах распознала, что работает с боевой инфраструктурой. Тем не менее нейросеть продолжила выполнение задания, извлекла учетные данные и получила доступ к базе производственных данных.
- Mythos 5: Зафиксировала признаки работы в настоящей сети, однако ошибочно посчитала их частью эмуляции. В результате модель выгрузила вредоносный пакет в публичный репозиторий PyPI, который до момента обнаружения успели скачать и запустить сторонние пользователи.
- Исследовательская модель: Оказалась единственной, кто самостоятельно остановил выполнение инструкций, как только идентифицировал реальный объект атаки.
Причины сбоя
Разработчики подчеркнули, что поведение ИИ не было вызвано появлением у систем собственных целей — модели лишь стремились закрыть задачу без учета рисков для инфраструктуры.
В компании признали, что в тестовой среде отсутствовали встроенные фильтры безопасности, которые применяются в публичных релизах и смогли бы заблокировать подобные действия:
«В тестовой среде отсутствовали дополнительные классификаторы безопасности, которые обычно применяются к общедоступным версиям моделей и способны заблокировать подобное поведение».
В отличие от инцидента с Hugging Face, где факт взлома установила пострадавшая сторона, Anthropic самостоятельно вскрыла нарушения в ходе проверки. Сами компании-жертвы подозрительной активности в своей сети не заметили. Для проведения внешнего независимого расследования лаборатория привлекла экспертную группу METR.
Случаи с OpenAI и Anthropic подсветили общую проблему лабораторий — нехватку надежной изоляции исследовательских контуров при тестировании автономных ИИ-агентов.
Читайте также: Мнимая отказоустойчивость: как DCIM показывает, что резервирование не работает так, как вы думаете
Благодарим за оставленный Вами отзыв! Мы стараемся становиться лучше!
«Аладдин» получил сертификат ФСТЭК России на комплекс многофакторной аутентификации MFA JaCarta-3
«Турбо Облако» запустило управляемый сервис векторной СУБД Qdrant для ИИ-проектов
12 ноября 2026 года CNews проводит 19-ое ежегодное мероприятие «CNews Forum 2026: Информационные технологии завтра»
30% компаний увольняют сотрудников после инцидентов с коммерческой тайной
В РСПП обсудили, как расширение охраны IT-разработок изменит рынок
«Додо Пицца» подверглась кибератаке: в Сеть попала база данных клиентов за 15 лет

