ГОСТ по безопасной разработке ИИ может появиться в начале следующего года
© Изображение сгенерировано ИИ
Разработчикам систем искусственного интеллекта потребуется учитывать не только точность моделей, но и их устойчивость к изменению данных, предвзятости, ошибкам и преднамеренным атакам. Об этом на заседании научно-технического совета НИИАС рассказал руководитель исследовательского центра доверенного искусственного интеллекта Института системного программирования РАН Денис Турдаков. По его словам, стандартизация должна создать базовые правила безопасной разработки ИИ, после чего потребуются отраслевые требования — в том числе для решений, работающих с критической инфраструктурой.
Модели теряют точность
Турдаков разделил подходы к созданию интеллектуальных систем на экспертные модели и машинное обучение. Во втором случае алгоритм обучается на примерах, а потому его работа зависит от качества, полноты и актуальности данных. Одной из ключевых проблем он назвал дрейф данных: модель, которая показывала приемлемый результат на обучающей выборке, может быстро потерять эффективность при изменении внешней среды.
В качестве примера он привел опыт анализа тональности банковских сообщений в социальных сетях в 2015 году. Участники соревнования получили тренировочные данные в июне, а в октябре их решения проверили на новой выборке. Точность всех систем оказалась ниже 60%. Из-за изменений в общественно-политическом и экономическом контексте, в частности появления новых смысловых оттенков у слова «санкции», ранее работоспособные модели перестали корректно интерпретировать сообщения.
«За четыре месяца система, решение из рабочего превратилось в абсолютно нерабочее»,— отметил Денис Турдаков.
Атака через изображение
Помимо дрейфа данных, к рискам относятся предвзятость моделей, непрозрачность их решений и состязательные атаки. Последние предполагают намеренное изменение входных данных таким образом, чтобы алгоритм допустил ошибку. Например, система компьютерного зрения может перестать распознавать человека из-за специально созданного изображения на одежде. В другом эксперименте исследователи смогли заставить зависнуть коммерческую систему контроля доступа, показав ей подготовленную картинку.
По словам Дениса Турдакова, надежность ИИ нельзя сводить к проверке исходного кода. Для машинного обучения критичны также процессы подготовки наборов данных, обучения и последующего сопровождения моделей. В ИСП РАН разработали платформу, позволяющую тестировать модели на устойчивость к атакам, выявлять аномалии и дрейф данных, а также применять защитные механизмы. При анализе популярных фреймворков TensorFlow и PyTorch исследователи, по его словам, обнаружили более 100 ошибок; часть из них была исправлена или передана сообществу разработчиков.
ГОСТ для алгоритмов
В начале лета завершилась разработка расширения ГОСТ по безопасной разработке программного обеспечения для технологий искусственного интеллекта, сообщил Денис Турдаков. В проекте выделены два дополнительных процесса: создание датасетов и безопасное обучение моделей. Документ завершил общественное обсуждение, по итогам которого разработчики получили 937 замечаний. Ожидается, что стандарт может появиться к началу следующего года.
В дальнейшем, считает он, общий стандарт должен дополняться прикладными требованиями для отдельных отраслей. Для систем компьютерного зрения и больших языковых моделей потребуются разные методы оценки рисков и наборы тестов.
«Сделать так, чтобы у нас итоговая система стала доверенной, безопасной, гарантированно безопасной, не получится. Даже с программным обеспечением так не получается»,— заявил Денис Турдаков.
Агентов предлагают ограничить
Отдельной проблемой он назвал быстрое развитие агентных систем, которые способны самостоятельно обращаться к файлам. Для таких решений пока больше вопросов, чем готовых механизмов защиты, признал Денис Турдаков. Базовым подходом остается ограничение полномочий агента конкретной задачей и отзыв разрешений после ее выполнения, однако окончательная надежность будет зависеть не только от технологии, но и от того, как ею управляет человек.
Читайте также: Positive Technologies и Петербургский нефтяной терминал будут совместно развивать кибербезопасность.
Благодарим за оставленный Вами отзыв! Мы стараемся становиться лучше!
«Россети» направят 140 млн рублей на модернизацию ИБ-инфраструктуры и импортозамещение в ЦИУС ЕЭС
BI.ZONE провела оценку компрометации инфраструктуры техцентра «ЛУКОМ-А» перед подключением к SOC
Artezio выпустила решение на базе многослойного ИИ для проверки защищенности бизнеса
TECH WEEK 2026: технологии, искусственный интеллект и цифровая трансформация бизнеса
В России обсуждают введение льготных кредитов и лизинга на закупку оборудования для ИИ
В России рассчитывают в восемь раз увеличить рынок сверхбезопасного ПО и оборудования


