Аутсорсинговый центр

Неземной
аутсорсинг

Дипфейк (Deepfake)

Дипфейк (от англ. deepfake, сложение слов deep learning - "глубокое обучение" и fake - "подделка") - технология создания реалистичного аудио-, видео- или графического контента методами глубокого обучения и искусственного интеллекта, а также сам такой сгенерированный контент, который правдоподобно имитирует действия, речь, голос или внешность реальных людей, не совершавших этих действий в действительности.

Что означает термин

Термин "дипфейк" образован слиянием английских слов deep learning ("глубокое обучение") и fake ("подделка") и используется в двух связанных значениях: как название технологии синтеза медиаконтента и как обозначение самого полученного результата - реалистичного ролика, аудиозаписи или изображения. Границы понятия остаются предметом дискуссии: часть источников относит к дипфейкам только синтез изображений лиц и видео с участием людей, тогда как расширенные определения включают любые высокореалистичные медиа, созданные автоматизированными методами на основе ИИ, в том числе произвольные объекты и географические изображения.

Как устроено

В основе технологии лежит глубокое обучение - метод искусственного интеллекта, использующий несколько уровней алгоритмов машинного обучения, способных обучаться на неструктурированных данных, в том числе на изображениях лиц. Часто применяются генеративно-состязательные сети (GAN, Generative Adversarial Network) - системы из двух нейросетей, которые состязаются друг с другом: изучают характеристики обучающих наборов данных и создают на их основе новые. Современные генераторы используют генеративный ИИ и модели синхронизации губ (lip-sync), что позволяет собирать реалистичные ролики с говорящей головой из одного эталонного изображения и текстового сценария - без камеры, актёра или студии. Для создания дипфейкового аудио применяется технология преобразования голоса (Voice Conversion, VC), которая изменяет запись речи так, чтобы она звучала как голос другого человека; исследования в этой области с 2016 года развиваются в рамках серии Voice Conversion Challenge. Распознавание дипфейка формализуется как задача бинарной классификации: система относит изображение или аудио к одному из двух классов - "подлинное" или "сгенерированное". Видимыми признаками подделки нередко служат рассинхронизированная с видеорядом речь, несоответствия на фоне, неестественные движения конечностей или лица, видеоартефакты и размытость отдельных участков изображения, однако эти признаки со временем становятся менее заметными по мере развития генеративных моделей, а надёжное выявление требует покадрового анализа и специализированного программного обеспечения.

Где применяется

Дипфейки используются в кинопроизводстве и видеопродакшене, где на готовое видео накладывается мимика и внешность другого человека, и итоговый ролик выглядит так, будто этот человек снимался в кадре. Технология применяется для клонирования голоса и синтеза речи: записанные образцы голоса конкретного человека используются для генерации новых аудиофраз, которые он никогда не произносил. На основе дипфейков создаются учебные и маркетинговые ролики с цифровыми аватарами, а также синтезируются спутниковые снимки и географические изображения, не существующие в реальности ("дипфейк-география"). Одновременно та же технология активно применяется для мошенничества и дезинформации: подмена голоса и внешности позволяет имитировать конкретных людей, что повышает риск финансового и репутационного ущерба и подрывает доверие к аудио- и видеодоказательствам в целом. В одном из массовых тестов лишь около 17% участников смогли правильно определить, являются ли видео со знаменитостями реальными или поддельными, что показывает, насколько трудно отличить подделку от оригинала без специальных инструментов.

Возврат к списку

База знаний организована при поддержке делового сообщества. Спираль?!