Дипфейк (Deepfake)
Дипфейк (от англ. deepfake, сложение слов deep learning - "глубокое обучение" и fake - "подделка") - технология создания реалистичного аудио-, видео- или графического контента методами глубокого обучения и искусственного интеллекта, а также сам такой сгенерированный контент, который правдоподобно имитирует действия, речь, голос или внешность реальных людей, не совершавших этих действий в действительности.
Что означает термин
Термин "дипфейк" образован слиянием английских слов deep learning ("глубокое обучение") и fake ("подделка") и используется в двух связанных значениях: как название технологии синтеза медиаконтента и как обозначение самого полученного результата - реалистичного ролика, аудиозаписи или изображения. Границы понятия остаются предметом дискуссии: часть источников относит к дипфейкам только синтез изображений лиц и видео с участием людей, тогда как расширенные определения включают любые высокореалистичные медиа, созданные автоматизированными методами на основе ИИ, в том числе произвольные объекты и географические изображения.
Как устроено
В основе технологии лежит глубокое обучение - метод искусственного интеллекта, использующий несколько уровней алгоритмов машинного обучения, способных обучаться на неструктурированных данных, в том числе на изображениях лиц. Часто применяются генеративно-состязательные сети (GAN, Generative Adversarial Network) - системы из двух нейросетей, которые состязаются друг с другом: изучают характеристики обучающих наборов данных и создают на их основе новые. Современные генераторы используют генеративный ИИ и модели синхронизации губ (lip-sync), что позволяет собирать реалистичные ролики с говорящей головой из одного эталонного изображения и текстового сценария - без камеры, актёра или студии. Для создания дипфейкового аудио применяется технология преобразования голоса (Voice Conversion, VC), которая изменяет запись речи так, чтобы она звучала как голос другого человека; исследования в этой области с 2016 года развиваются в рамках серии Voice Conversion Challenge. Распознавание дипфейка формализуется как задача бинарной классификации: система относит изображение или аудио к одному из двух классов - "подлинное" или "сгенерированное". Видимыми признаками подделки нередко служат рассинхронизированная с видеорядом речь, несоответствия на фоне, неестественные движения конечностей или лица, видеоартефакты и размытость отдельных участков изображения, однако эти признаки со временем становятся менее заметными по мере развития генеративных моделей, а надёжное выявление требует покадрового анализа и специализированного программного обеспечения.
Где применяется
Дипфейки используются в кинопроизводстве и видеопродакшене, где на готовое видео накладывается мимика и внешность другого человека, и итоговый ролик выглядит так, будто этот человек снимался в кадре. Технология применяется для клонирования голоса и синтеза речи: записанные образцы голоса конкретного человека используются для генерации новых аудиофраз, которые он никогда не произносил. На основе дипфейков создаются учебные и маркетинговые ролики с цифровыми аватарами, а также синтезируются спутниковые снимки и географические изображения, не существующие в реальности ("дипфейк-география"). Одновременно та же технология активно применяется для мошенничества и дезинформации: подмена голоса и внешности позволяет имитировать конкретных людей, что повышает риск финансового и репутационного ущерба и подрывает доверие к аудио- и видеодоказательствам в целом. В одном из массовых тестов лишь около 17% участников смогли правильно определить, являются ли видео со знаменитостями реальными или поддельными, что показывает, насколько трудно отличить подделку от оригинала без специальных инструментов.
База знаний организована при поддержке делового сообщества. Спираль?!

