В НГТУ НЭТИ создали нейросеть для систем цифровой криминалистики
В Новосибирском государственном техническом университете НЭТИ разработана методика, позволяющая автоматически определять, является ли цифровое изображение реальной фотографией или было создано нейросетью. Технология основана на анализе скрытых частотных «отпечатков», которые оставляют алгоритмы генерации, и может применяться в системах цифровой криминалистики, проверки достоверности визуальной информации и защиты от мошенничества.
С развитием генеративных моделей, таких как Stable Diffusion, Midjourney и DALL?E, визуально отличить синтетическое изображение от реальной фотографии становится все сложнее. Это создает риски распространения фейков, подделки улик и нарушения авторских прав. Ученые НГТУ НЭТИ провели масштабное сравнение классов алгоритмов, от классических методов машинного обучения до современных трансформерных архитектур, и выявили, что наилучший результат дает подход на основе Vision Transformer (ViT), который анализирует изображение глобально, а не по отдельным фрагментам.
«Мы не просто обучили нейросеть, а исследовали, как разные модели «видят» картинку. Установили, что сверточные сети фокусируются на локальных текстурах, а трансформеры улавливают взаимосвязи во всем кадре. Это позволяет им замечать и равномерно распределенные артефакты, характерные для генерации. Такой подход оказался особенно эффективным при небольшом объеме обучающей выборки», — рассказал руководитель проекта, ассистент кафедры автоматизированных систем управления НГТУ НЭТИ Егор Антонянц.
Существующие системы обнаружения часто требуют десятков тысяч размеченных примеров, теряют точность при сжатии изображений или изменении разрешения. Обученная нейронная сеть лишена этих недостатков: предварительное тестирование ViT Tiny показало точность 89%.
«Наш метод не требует миллионных датасетов и показывает стабильную работу даже на ограниченных данных. Это особенно важно для задач криминалистики, где непросто собрать размеченные примеры синтетических изображений. Кроме того, мы визуализировали, какие области изображения анализирует модель: трансформер охватывает весь кадр, тогда как сверточная сеть «цепляется» за мелкие текстуры, которые легко исчезают при обработке», — рассказали разработчики — студенты третьего курса факультета автоматики и вычислительной техники Виталий Заозернов и Александр Леонтьев.
Технология предназначена для внедрения в системы верификации мультимедийного контента, используемые новостными агентствами, социальными сетями и правоохранительными органами. Она также может быть интегрирована в платформы для проверки авторских работ. В перспективе полученные наработки лягут в основу гибридных пространственно-частотных детекторов, способных противостоять новейшим генеративным моделям, а также адаптироваться к различным форматам сжатия и постобработке изображений.

