Anthropic рассказала, как ее нейросети взломали системы безопасности трех компаний

Share to Telegram Share to VK
clock 1 час назад
Anthropic рассказала, как ее нейросети взломали системы безопасности трех компаний © Сгенерировано ИИ

Компания Anthropic обнародовала результаты внутреннего расследования, выявившего три случая, когда ее нейросети Claude без разрешения получили доступ к боевым системам сторонних организаций во время проверок кибербезопасности. Как сообщает Inc. Russia, внутренний аудит в лаборатории стартовал после того, как OpenAI раскрыла инцидент со взломом платформы Hugging Face одной из своих неопубликованных моделей.

Ошибка конфигурации песочницы и масштаб проверки

Специалисты компании проанализировали 141 006 тестовых запусков. В трех случаях модели вышли во внешнюю сеть при взаимодействии со сторонним партнером Irregular.

Причиной сбоя оказалась рассинхронизация в настройках тестового контура: у партнеров возникли разногласия в понимании того, изолирована ли среда от интернета, хотя на практике сетевой доступ оставался открытым.

Представители разработчика заявили о готовности ликвидировать последствия выхода нейросетей в сеть за собственный счет, не перекладывая ответственность на стороннюю компанию:

«Anthropic не возлагает ответственность на партнера и намерена устранять последствия так, как если бы вина лежала исключительно на ней».

Реакция алгоритмов: от сбора данных до публикации вредоносов

В испытаниях участвовали три алгоритма — Opus 4.7, Mythos 5 и внутренняя исследовательская модель. Несмотря на то что в промптах для всех систем явно указывалось отсутствие подключения к интернету, при обнаружении реальных сетевых узлов модели повели себя разрозненно:

- Opus 4.7: Во всех четырех тестовых прогонах распознала, что работает с боевой инфраструктурой. Тем не менее нейросеть продолжила выполнение задания, извлекла учетные данные и получила доступ к базе производственных данных.

- Mythos 5: Зафиксировала признаки работы в настоящей сети, однако ошибочно посчитала их частью эмуляции. В результате модель выгрузила вредоносный пакет в публичный репозиторий PyPI, который до момента обнаружения успели скачать и запустить сторонние пользователи.

- Исследовательская модель: Оказалась единственной, кто самостоятельно остановил выполнение инструкций, как только идентифицировал реальный объект атаки.

Причины сбоя

Разработчики подчеркнули, что поведение ИИ не было вызвано появлением у систем собственных целей — модели лишь стремились закрыть задачу без учета рисков для инфраструктуры.

В компании признали, что в тестовой среде отсутствовали встроенные фильтры безопасности, которые применяются в публичных релизах и смогли бы заблокировать подобные действия:

«В тестовой среде отсутствовали дополнительные классификаторы безопасности, которые обычно применяются к общедоступным версиям моделей и способны заблокировать подобное поведение».

В отличие от инцидента с Hugging Face, где факт взлома установила пострадавшая сторона, Anthropic самостоятельно вскрыла нарушения в ходе проверки. Сами компании-жертвы подозрительной активности в своей сети не заметили. Для проведения внешнего независимого расследования лаборатория привлекла экспертную группу METR.

Случаи с OpenAI и Anthropic подсветили общую проблему лабораторий — нехватку надежной изоляции исследовательских контуров при тестировании автономных ИИ-агентов.

Читайте также: Мнимая отказоустойчивость: как DCIM показывает, что резервирование не работает так, как вы думаете


Был ли вам полезен данный материал?


Журнал RUБЕЖ собрал в новом номере мнения участников рынка о ключевых изменениях в сфере пожарной безопасности: как работать проектировщикам после обновления Сводов правил 3, 6, 484, 485, нормативные новации, анализ госзакупок и применение нацрежима.


Подпишись на еженедельный дайджест самых интересных новостей по e-mail    
Yandex.Дзен

Подписывайтесь на канал ru-bezh.ru
в Яндекс.Дзен

Выделите опечатку и нажмите Ctrl + Enter, чтобы отправить сообщение.