«Это не революция, а эволюция»: как ИИ меняет работу DLP-систем

Share to Telegram Share to VK
clock 6 часов назад
«Это не революция, а эволюция»: как ИИ меняет работу DLP-систем

Искусственный интеллект уже используется в средствах информационной безопасности, но разные технологии решают разные задачи. Машинное обучение применяется для классификации данных и поведенческого анализа, большие языковые модели — для работы с текстами и большими массивами информации. Одновременно сами ИИ-сервисы становятся новым каналом утечки корпоративных данных.

О том, где ИИ действительно полезен для информационной безопасности, как он меняет работу DLP-систем и какие задачи безопасника в ближайшие годы можно будет автоматизировать, журнал RUБЕЖ поговорил с Алексеем Дроздом, начальником отдела безопасности «СёрчИнформ».

RUБЕЖ: ИИ в защитных решениях часто называют просто маркетинговой уловкой. Где машинное обучение действительно меняет результат в средствах защиты информации уже сегодня, а где основную работу по-прежнему выполняют традиционные методы?

Алексей Дрозд: Здесь корень проблемы в том, что есть ожидание, а есть реальность. Ожидание, по сути, такое: есть какая-то единая кнопка, некий ИИ-помощник. Самая близкая аналогия, которую я обычно привожу, — Джарвис из фильма «Железный человек»: управляется голосом, что ни скажи — все сам пошел и сделал.

По факту ИИ — это область знаний. Но за счет маркетинга и PR этот термин начали добавлять везде, не сильно разбираясь, что это такое. Для человека просвещенного это звучит немного дико. Приходит человек с проблемой и говорит: «Как мне сделать свою работу легче?» Ему отвечают: «Используй ИИ». Как мне улучшить анализ документов? Используй ИИ. Это из разряда: «Как мне лучше четырехтактный двигатель построить?» — «Физику используй».

В основном знак равенства сейчас ставят между ИИ и большой языковой моделью, считая ее универсальной палочкой-выручалочкой, которая все сама сделает, проанализирует и поймет.

RUБЕЖ: А если разделить машинное обучение и большие языковые модели, для каких задач они подходят?

Алексей Д.: Машинное обучение хорошо работает там, где есть конкретная задача. Например, мне надо быстро классифицировать картинки, не тратя много ресурсов. Заранее обучается нейронная сеть на большом объеме данных распознавать определенный признак: например, что на изображении есть подпись и печать, а значит, это какой-то официальный документ. Или классифицировать, чем занимался сотрудник: это игры, это фильмы, а это что-то связанное с работой.

С нейросетями все хорошо, но их долго и муторно обучать. Зато потом они не требуют больших мощностей, видеокарт и прочего. Большие языковые модели имеют более универсальное применение, и их обычному пользователю особо не надо обучать: бери готовую модель, тестируй и пробуй.

Одна из основных задач больших языковых моделей — обработка текста. Например, распознавание именованных сущностей (NER). Традиционно у нас есть неструктурированная информация — какой-то текст — и нужно понять, важен он или нет.

Допустим, мы должны контролировать, отправляют ли сотрудники персональные данные через мессенджеры. Для себя определили, что персональные данные — это связка фамилии, имени и телефона. Традиционно это смотрелось регулярными выражениями: одно подсвечивает фамилию, имя, отчество, второе — телефон.

Но что произойдет, если человек, который хочет вынести информацию, немного ее модифицирует? Например, заменит все буквы «О» на нули или наоборот. Если регулярное выражение изначально не писалось с учетом подобных замен, оно не отработает. Большие языковые модели в том числе используют для того, чтобы ловить такие трюки, когда человек пытается замаскировать именованную сущность.

RUБЕЖ: Где еще большие языковые модели могут быть полезны специалистам по ИБ?

Алексей Д.: Еще одна задача — ИИ-помощники. Я имею в виду связку большой языковой модели для генерации ответа и какой-то базы знаний, то есть RAG-систему. Здесь для информационной безопасности тоже открывается простор. Это может быть помощник по документации, классификатор, первая линия техподдержки или первая линия аналитиков: у нас есть событие — на что оно похоже, что следующим проверить?

Наконец, большие языковые модели интересны, когда мы хотим выявлять разговоры на определенную тему, а эти разговоры завуалированы. Например, откаты или взятки. Традиционно DLP-системами это пытаются ловить по словарю, ключевым словам и фразам.

Здесь две проблемы. Первая — неполнота словаря: невозможно учесть весь сленг. Вторая — система не учитывает контекст. Она только может показать: было такое слово или фраза в разговоре или не было. Такой подход дает большое количество ложноположительных срабатываний.

Грубо говоря, «биток» в контексте обсуждения бильярда — легитимная вещь, неинтересная безопасникам. В контексте криптовалют это уже может быть чем-то интересным. Большие языковые модели учитывают контекст, а словарь вообще не нужно составлять: можно на естественном языке задать промпт, и система будет работать.

RUБЕЖ: Одна из старейших проблем DLP — ложные срабатывания. Как подходы на основе ИИ меняют баланс между точностью и «шумом» в реальных внедрениях?

Алексей Д.: Там, где раньше работало машинное обучение, оно продолжает работать, потому что последующая эксплуатация дешевле и оно качественно решает свою задачу, если нейросеть изначально нормально обучена. Сюда относятся статистические аномалии, поведенческий анализ, классификация картинок.

Большие языковые модели дают универсальность и гораздо более низкий порог входа. Чтобы что-то делать с ML, нужны большие объемы данных и понимание, что ты вообще делаешь. Для использования большой языковой модели тебе, грубо говоря, нужны видеокарта и правильно написанный промпт. Дополнительных тренингов модели проводить не надо. Поэтому по распространению я бы сказал, что сейчас соотношение примерно 80 на 20 в пользу LLM.

Но это не революция в духе «забудьте все, чему вас учили, теперь все по-другому». Это эволюция. Большие языковые модели помогают видеть больше.

Невозможно написать регулярное выражение, которое учтет все трюки пользователя. А если он запишет все задом наперед? А если столбиком? А если не букву «О» на ноль поменяет, а тройку на букву «Е»? Невозможно все способы предугадать, а описать задачу в промпте, в принципе, можно попробовать.

RUБЕЖ: Насколько ИИ способен сократить нагрузку на специалистов при расследовании инцидентов?

Алексей Д.: LLM, с одной стороны, помогают больше видеть, с другой — быть эффективнее. Один человек в единицу времени делает больше задач или выполняет их быстрее.

Есть конкретные примеры. Аналитик встречает в перехвате разговор или документ на языке, которым не владеет. Россия — многонациональная страна. Например, сотрудники обсуждают что-то на русском, а когда дело доходит до вещей из серой зоны морали, переходят на татарский.

Аналитик может не владеть татарским, но большие языковые модели поддерживают офлайн-перевод. Можно сразу отправить кусок документа или весь документ на перевод. Он не уйдет в интернет, все разворачивается офлайн. Не нужно тратить время на поиск человека со знанием языка или рисковать, передавая часть корпоративных данных в публичные переводчики.

Еще одна функция — саммаризация, краткий пересказ. Аналитики тратят много времени, чтобы глазами пробежать большой документ или километровую переписку. Здесь саммаризация работает довольно неплохо, потому что модели не надо ничего выдумывать: пересказ идет на основе исходного текста. Это тоже экономит безопаснику много времени.

RUБЕЖ: Сейчас появляется много исследований о том, что сотрудники передают данные посредством использования ИИ. Что чаще приводит к утечкам: злонамеренные действия сотрудников или обычные ошибки?

Алексей Д.: У нас есть конкретные цифры, потому что такие вопросы мы регулярно задаем в исследованиях. Баланс между намеренными и случайными утечками колеблется. По данным исследования, 66% инцидентов по вине сотрудников происходят случайно, 30% - намеренно, 4% - одинаково часто. 

Общий тренд такой: когда искусственный интеллект начал массово использоваться, стало больше случайных утечек. Люди не до конца осознают, что ИИ — это третья сторона.

Условно, загружая документ в Алису или GigaChat, пользователь уже куда-то дальше передает этот документ, он покидает пределы компании. То же самое с онлайн-переводчиком: текст или документ загружен туда — автоматически улетает дальше.

Люди увидели пользу: чтобы самостоятельно не переделывать документы, не переписывать, не саммаризировать, они начали перекладывать это на бесплатную третью сторону. Тем самым пошел рост утечек. Сотрудник, не до конца понимая, что это не свой внутренний сервис, спокойно загружает документ непонятно куда и оставляет там навеки вечные.

Сюда же относится код. Стало модно быстрее писать код, и разработчики начали отправлять его в ИИ-инструменты — Copilot, Cursor и другие.

RUБЕЖ: Как компании пытаются контролировать такие сценарии?

Алексей Д.: В результате появился новый класс задач для аналитиков — препятствовать подобным вещам. Компании, которые серьезно к этому относятся, разворачивают свои локальные модели и разрешают сотрудникам пользоваться ими, но только своей «коробкой». Остальные либо запрещают внешние сервисы, либо вообще не уделяют этому внимания и морально готовы к тому, что что-то сольется.

Наши клиенты сразу попросили ряд политик, которые позволяют мониторить взаимодействие сотрудников с внешними ИИ-сервисами и в нужный момент его останавливать. Просто писать с помощью ИИ что-то нейтральное можно. Но если в качестве промпта отправляется документ, содержащий чувствительные данные, или сотрудник копирует и вставляет туда такие данные, это нужно прекращать.

RUБЕЖ: Но если действия сотрудника привели к утечке, вопрос прежде всего к службе безопасности: почему существующая степень защиты позволила передать данные?

Алексей Д.: Потому что что-то новое не контролировали. Это бесконечная война брони и снаряда.

Сначала появляется запрос, потом появляется ответ со стороны безопасности. Глобально существует два подхода: запрещено все, что не разрешено, то есть белые списки, или разрешено все, что не запрещено. Естественно, особенно в коммерции применяется второй подход, потому что иначе безопасность сама создает риски для бизнеса.

Самые популярные сценарии из коробки можно блокировать или, если не блокировать, контролировать. Но нужно понимать, что степень проникновения ИИ разная и способы передачи информации тоже разные.

Например, я открыл сайт и общаюсь с ИИ-помощником — это один вариант. Второй: ИИ уже встроен на уровне какого-то ПО, и даже открывать ничего не надо. Как в Photoshop: выделяешь кусок картинки, пишешь описание, и что-то сразу улетает на уровне софта. С контролем первого сценария все понятно. 

Что касается второго сценария, когда ИИ интегрирован на уровне ПО или вообще операционной системы, гораздо сложнее выявлять и блокировать подобные вещи. Тогда нужно непосредственно заходить в каждое приложение и блокировать часть функций.

Давайте по аналогии с мессенджерами. Когда-то мессенджеры были только приложениями — их можно было блокировать и контролировать. Потом появились веб-версии и мобильные версии. А затем мессенджеры стали непосредственно встраиваться в браузеры. С точки зрения контроля средствами защиты информации это уже принципиально другой способ общения.

Так же и здесь. Сейчас идет очередная итерация: самые популярные сценарии мы ловим и блокируем, наступает время экзотических.

RUБЕЖ: А может ли современная DLP-система заранее прогнозировать потенциальный инцидент? Какие практики помогают выявлять подозрительное поведение до того, как произойдет утечка?

Алексей Д.: Если мы говорим про превентивные меры, сначала рождается мотив, а потом идут конкретные действия. Человек, допустим, собирается уволиться или на кого-то обиделся. Сначала он этим преисполнился, а потом начинает делать какую-то конкретную гадость: копировать данные, подбивать кого-то на саботаж или еще что-нибудь.

Традиционно работа ведется, когда у сотрудника уже происходят конкретные действия. Есть описанные бизнес-процессы: такому-то человеку в такие-то папки нельзя, такие-то документы должны обращаться определенным образом, их нельзя забирать на флешке или загружать в облака.

Настраиваются соответствующие правила, которые выявляют, если что-то с информацией стало происходить по-другому: документ загружается не туда, к нему получают доступ люди, которым он изначально не нужен, и так далее.

Эта работа более-менее понятна. А выявление мотивов — более тонкая вещь. И здесь в том числе могут помогать большие языковые модели.

Любой начальник, кого ни спроси, в идеале хочет знать, когда его сотрудник собирается уволиться. Но редко бывает, что у человека просто что-то щелкнуло — и все, он уходит. Обычно это процесс: сотрудник может жаловаться, потихоньку искать вакансии или прямо с рабочего места общаться с ИИ на тему: «Возьми мое резюме, перепиши с такими-то навыками».

За счет современных средств фокус смещается в сторону такого предотвращения. ИБ начинает работать не только во имя ИБ, но и в интересах управленцев и кадров.

Если человек уже пришел с заявлением на стол, наверное, он все решил. И это плохо. Любой кадровик вам скажет: пока найдешь нового сотрудника, пока введешь его в курс дела, пока он начнет работать на том же уровне, это гораздо дороже, чем попытаться сохранить старую команду.

Поэтому появляются задачи для ИБ по работе в интересах управленцев и кадров — просто потому, что необходимые инструменты находятся у безопасников.

RUБЕЖ: Если представить типичную компанию через пять лет, как изменится информационная безопасность? Что уйдет в автоматизацию, а что останется зоной ответственности человека?

Алексей Д.: На мой взгляд, автоматизируются рутинные задачи: написать служебку, документ, составить инструкцию, провести тренинг по фишингу, подготовить памятку сотрудникам.

С этим уже достаточно нормально справляются большие языковые модели. Они могут написать текст, сгенерировать картинки и прочее. Если раньше для памятки по фишинговым письмам и сайтам нужны были аналитические способности и писательский талант, иначе все получалось очень сухо и неинтересно и никто это не запоминал, теперь достаточно желания — нейронки помогут что-то написать и нарисовать. Служебки, рапорты и подобные вещи тоже вполне автоматизируются.

RUБЕЖ: А что может измениться непосредственно в работе с DLP?

Алексей Д.: Через пять лет верю, что мы дойдем до того, что появится такой ИБ-ассистент. Это, по сути, смесь RAG и большой языковой модели, только в качестве базы знаний используется перехват.

Допустим, произошла утечка информации по определенному тендеру. Я ставлю задачу: «Собери мне информацию, кто за последний месяц обсуждал этот тендер, и нарисуй граф связей с привязкой к календарю — кто, в какие дни и с кем его обсуждал».

То есть на естественном языке формулируется задача. Система сама думает, какие поисковые фильтры лучше использовать и как найти релевантную информацию, отсеивает ее. А дальше запускаются дополнительные навыки — например, построить граф.

Плюс у больших языковых моделей есть reasoning — режимы, когда они объясняют, на основе чего были сделаны те или иные выводы. Получается, такой ИБ-ассистент будет помогать безопаснику быстрее перелопачивать большие объемы данных.

Сейчас главная проблема в чем? Если я беру DLP-систему и хочу сформулировать инцидент, то должен сначала придумать, что является аномалией, а потом описать ее. Например: нельзя отправлять данные за границу. Дальше я должен определить, что значит «за границу», по каким каналам это может происходить, какие почтовые ящики учитывать, какие регулярные выражения использовать. Я начинаю описывать это в конкретных условиях поискового запроса.

Возможно, через пять лет подобные задачи можно будет ставить на естественном языке и не знать досконально, какие атрибуты и куда прописывать. Система сможет делать это самостоятельно.

Читайте также: ИИ: помощник или угроза? Как защитить корпоративные данные


Был ли вам полезен данный материал?


Журнал RUБЕЖ собрал в новом номере мнения участников рынка о ключевых изменениях в сфере пожарной безопасности: как работать проектировщикам после обновления Сводов правил 3, 6, 484, 485, нормативные новации, анализ госзакупок и применение нацрежима.


Подпишись на еженедельный дайджест самых интересных новостей по e-mail    
Yandex.Дзен

Подписывайтесь на канал ru-bezh.ru
в Яндекс.Дзен

Выделите опечатку и нажмите Ctrl + Enter, чтобы отправить сообщение.