В СПбГЭТУ «ЛЭТИ» разработали алгоритм для быстрого и эффективного обнаружения «слабых мест» в нейросетях, используемых в автопилотах. Созданная композиционная структура оптимизирует подбор инструментов для поиска уязвимостей моделей компьютерного зрения. Об этом сообщили в пресс-службе вуза.
Сегодня в системах автоматического или полуавтоматического управления транспортом используются модели компьютерного зрения. Эти технологии снижают нагрузку на оператора, будь то в авиации, на морском транспорте или в автомобилях. Нейросети работают на основе распознавания и классификации объектов по изображениям.
Однако главным препятствием для безопасного использования таких систем являются атаки злоумышленников, которые применяют специальные фильтры к изображениям. Эти фильтры незаметны для человеческого глаза, но вызывают ошибки в классификации объектов моделью. В критических ситуациях, например, при распознавании пешеходов или дорожных знаков, даже небольшая ошибка может привести к трагическим последствиям.
В настоящее время оценка устойчивости моделей проводится вручную. Специалисты подбирают параметры и методы для конкретной модели. Этот метод не позволяет систематически исследовать все возможные атаки, что приводит к тому, что часть уязвимостей остаётся незамеченной, а результаты зависят от субъективного опыта специалистов.
Учёные предложили разбить процесс поиска уязвимостей на шесть основных модулей: инициализаторы, функции потерь, планировщики и градиенты моделей. Каждый из этих модулей состоит из взаимозаменяемых инструментов. На основе этого подхода был создан программный комплекс и общая база инструментов. Подбор конфигураций был переведён в задачу оптимизации, используя байесовскую оптимизацию и эволюционные алгоритмы.
Для проверки эффективности этого подхода учёные обучили собственную модель компьютерного зрения на основе свёрточной нейросети для распознавания и классификации изображений. Затем они сравнили устойчивость модели, используя ключевые методы и стандарты машинного обучения, а также конфигурации, созданные предложенным алгоритмом.
Оценка проводилась по двум основным параметрам: доле изображений, на которых модель совершала ошибки, и заметности внесённых изменений для человеческого глаза.
«Результаты показали, что созданная композиционная структура находит более скрытые способы обмана нейросетей. Если обычный алгоритм смог обмануть нейросеть лишь в 13% случаев из тысячи картинок, то новый подход, подобранный программой, сработал в 58%. При этом искажения, вносимые в изображения удалось снизить примерно на 15% по сравнению с обычным методом. Визуально они выглядят просто как легкий шум на несколько раз пересохраненной фотографии, а не как грубая подделка. Таким образом мы создаем инструмент аудита безопасности, который позволит разработчикам до выпуска модели в открытый доступ проверить ее, выявить наиболее серьезные уязвимости и заранее устранить их», — младший научный сотрудник лаборатории ФОИС, аспирант кафедры ИБ СПбГЭТУ «ЛЭТИ» Роман Радионов.
В дальнейшем учёные планируют перейти от моделей «белого ящика» к моделям «чёрного ящика», а также расширить подход на большие языковые модели.
Учёные активно работают над безопасностью нейросетей в автопилотах, но водители всё чаще сомневаются в их пользе. Как сообщила интернет-газета «ЖУК» со ссылкой на исследование, дорогие системы автопилота часто разочаровывают своих владельцев. Более того, 35% водителей никогда не включали даже экран, который расположен перед пассажиром.
