# От аудио- и видеоданных к доказательствам: AI-аналитика, биометрия и детекция спуфинга и дипфейков Михаил Инкин · ООО ЦРТ MOSCOW FORENSICS DAY ’25 · День 2 — пятница, 12 сентября 2025: день информационной безопасности · По программе 17:20–17:50 · В записи 08:50:23–09:26:43 Саммари выступления · https://2025.moscow-forensics-day.workers.dev/summary/20-inkin Расшифровка: https://2025.moscow-forensics-day.workers.dev/transcript/20-inkin · Слайды: https://2025.moscow-forensics-day.workers.dev/slides/19-crt-ot-audio-i-videodannyh-k-dokazatelstvam · Смотреть с 08:50:23: https://youtu.be/4V7Wez3L_58?t=31823 --- ## Кратко Заключительный доклад конференции, по жанру вендорская презентация: три продукта ЦРТ вдоль цепочки «сырые аудио → поиск → экспертиза → протокол» — AVIS, ИКАР Лаб, Нестор AI. Все числа — из демонстраций. Суть: синтез голоса на слух неотличим, новых алгоритмов десятки и сотни в год, поэтому детектор синтеза ненадёжен сам по себе — вопрос ставится об аутентичности фонограммы, с классикой и ручной фиксацией признаков. Вопросы из зала вышли содержательнее доклада. ## Главное - ЦРТ: более 35 лет, более 5000 проектов, конкурсы NIST и CHiME Challenge; по LLM — GigaChat и свободные модели. - Биометрия языко- и текстонезависимая, есть и ручные методы: выводы автоматики нуждаются в экспертном подтверждении. В голосе более 70 частей тела, фоноскопия более 30 лет — судебная экспертиза, идентификация по формантам и основному тону. - Вход — перехват, микрофонные записи, голосовые из изъятого устройства; AVIS — анализ, «комплексы ИКАР Лаб 3» — доказательство (применимость фонограммы, шумоочистка, разделение дикторов, идентификация, монтаж), Нестор AI — протокол. - AVIS: пол и язык, 18 языков распознавания (русский, украинский, казахский, арабский), биометрический поиск, перевод, графы; LLM дают сводку и находят «кодовые слова, сленг». - Демо — мошенническое голосовое про аварию на М4; спуфинг оценивается по всей фонограмме и посекундно скользящим окном: подделывают часть. - Вендор синтеза: в демо 99,6 % и ElevenLabs, всего четыре; новых алгоритмов «десятки, а может быть даже и сотни» в год — отсюда вопрос об аутентичности и классика: фаза, передискретизация, фоновый шум, постоянная составляющая. - История синтеза: «yes»/«no» конца XIX века, прибор 1979 года, синтез 2000-х без эмоций, прошлогодний синтез голоса Байдена; нынешний копирует дыхание и интонации. - Видео Джессики Альбы: зал разделился «примерно поровну», синтезом было верхнее. Дипфейк-модуль: покадровая вероятность, маска «возбуждения нейронов» (внимание сети, не подделка), «допуск» по наклонам головы; на фейке 97 %. - Нестор AI: потоковое аудио и файлы (Zoom, диктофон), протокол строгой формы по дикторам, LLM-аннотации, ИИ-агент. ## Инструменты, артефакты, технологии - Предлагаются заказчикам: **AVIS** (ЦРТ) — поиск и аналитика; **ИКАР Лаб** («ИКАР Лаб 3» один раз) — экспертиза, спуфинг, видеодипфейки, ручные модули, экспорт в ряд стран; **Нестор AI** — ПАК протоколирования. - Используются: **GigaChat**, свободные LLM, свой speech-to-text; **NIST** и **CHiME Challenge** — конкурсы; **ElevenLabs** — вендор из демо (три других не названы); **Multi-Tacotron** — назван из зала. - **Zoom** и диктофоны — вход Нестор AI; **серверные видеокарты** — ускорение транскрибирования. Техники дипфейков (из зала): **face swapping, puppet-master, lip-syncing**, синтез усов, родинок, серёг, «оживление» фото; **ультразвуковые подавители** — критикуются. ## Правовой и организационный контекст Законы, статьи и ведомства не назывались; терминология процессуальная — «фоноскопическая экспертиза», «заключение эксперта», «законный перехват». Фоноскопия более 30 лет — вид судебной экспертизы в РФ и за рубежом; выводы автоматики требуют экспертного подтверждения, отсюда модули ручной фиксации признаков под заключение. AVIS — поиск, ИКАР Лаб — доказательство. Развёртывание — закрытый контур заказчика, on-prem, офлайн, роли и уровни доступа. ## Вопросы из зала Зал без микрофона и без разметки говорящих; имена не назывались, атрибуция — по контексту. - **Другие техники дипфейков — puppet-master, lip-sync, родинки?** (он же — два следующих) → Элементы лица не проверял; «оживление» фото — 98 % на базах ЦРТ. - **Зачем вендор, если в основе «Multi-Tacotron какой-нибудь»?** → Косвенная улика: сайт подозреваемого и место генерации. - **Prompt injection через аудио?** → Модели в цепочке разные; маловероятно, «заказчики заинтересованы… чтобы данные были чистыми». - **Защита продукта от утечки?** → Закрытый контур, on-prem. - **Шумоочистка при подавлении микрофона ультразвуком?** → «Из разряда мифов»; за пределом по ОСШ — ручные методы. - **Нестор — девайс или лицензия?** → ПАК: микрофоны с ПО либо только ПО. - **Скорость транскрибирования?** («Ольга») → На серверных видеокартах 1000 секунд речи в секунду. - **Экспертизы на других языках?** (та же) → Ручное транскрибирование носителем; экспорт в ряд стран. ## Позиция спикера Тон вендорской презентации: «всемирно признанные», «работает на высоком достаточном качестве». Автоматика при этом не подаётся как замена эксперту: её выводы требуют подтверждения, классика аутентичности работает, детекторы синтеза проигрывают гонку алгоритмам. С залом спорит о вендоре синтеза: оппонент — определять надо ветки инструментов, спикер — вендор как улика. Ограничения частью признаёт сам: элементы лица не проверял, 98 % — на своих базах, при падении ОСШ точность падает. ## Цитаты - «…выводы любой автоматической системы нуждаются в экспертном подтверждении.» - «…большинство слушателей не отличают голос синтезированного человека от голоса человека живого.» - «…это из разряда мифов, что такие решения очень серьезно защищают дикторов от записи.» - «…чем больше шума, тем ниже будет вероятность верного определения…»