Кратко
Заключительный доклад конференции, по жанру вендорская презентация: три продукта ЦРТ вдоль цепочки «сырые аудио → поиск → экспертиза → протокол» — AVIS, ИКАР Лаб, Нестор AI. Все числа — из демонстраций. Суть: синтез голоса на слух неотличим, новых алгоритмов десятки и сотни в год, поэтому детектор синтеза ненадёжен сам по себе — вопрос ставится об аутентичности фонограммы, с классикой и ручной фиксацией признаков. Вопросы из зала вышли содержательнее доклада.
Главное
- ЦРТ: более 35 лет, более 5000 проектов, конкурсы NIST и CHiME Challenge; по LLM — GigaChat и свободные модели.
- Биометрия языко- и текстонезависимая, есть и ручные методы: выводы автоматики нуждаются в экспертном подтверждении. В голосе более 70 частей тела, фоноскопия более 30 лет — судебная экспертиза, идентификация по формантам и основному тону.
- Вход — перехват, микрофонные записи, голосовые из изъятого устройства; AVIS — анализ, «комплексы ИКАР Лаб 3» — доказательство (применимость фонограммы, шумоочистка, разделение дикторов, идентификация, монтаж), Нестор AI — протокол.
- AVIS: пол и язык, 18 языков распознавания (русский, украинский, казахский, арабский), биометрический поиск, перевод, графы; LLM дают сводку и находят «кодовые слова, сленг».
- Демо — мошенническое голосовое про аварию на М4; спуфинг оценивается по всей фонограмме и посекундно скользящим окном: подделывают часть.
- Вендор синтеза: в демо 99,6 % и ElevenLabs, всего четыре; новых алгоритмов «десятки, а может быть даже и сотни» в год — отсюда вопрос об аутентичности и классика: фаза, передискретизация, фоновый шум, постоянная составляющая.
- История синтеза: «yes»/«no» конца XIX века, прибор 1979 года, синтез 2000-х без эмоций, прошлогодний синтез голоса Байдена; нынешний копирует дыхание и интонации.
- Видео Джессики Альбы: зал разделился «примерно поровну», синтезом было верхнее. Дипфейк-модуль: покадровая вероятность, маска «возбуждения нейронов» (внимание сети, не подделка), «допуск» по наклонам головы; на фейке 97 %.
- Нестор AI: потоковое аудио и файлы (Zoom, диктофон), протокол строгой формы по дикторам, LLM-аннотации, ИИ-агент.
Инструменты, артефакты, технологии
- Предлагаются заказчикам: AVIS (ЦРТ) — поиск и аналитика; ИКАР Лаб («ИКАР Лаб 3» один раз) — экспертиза, спуфинг, видеодипфейки, ручные модули, экспорт в ряд стран; Нестор AI — ПАК протоколирования.
- Используются: GigaChat, свободные LLM, свой speech-to-text; NIST и CHiME Challenge — конкурсы; ElevenLabs — вендор из демо (три других не названы); Multi-Tacotron — назван из зала.
- Zoom и диктофоны — вход Нестор AI; серверные видеокарты — ускорение транскрибирования. Техники дипфейков (из зала): face swapping, puppet-master, lip-syncing, синтез усов, родинок, серёг, «оживление» фото; ультразвуковые подавители — критикуются.
Правовой и организационный контекст
Законы, статьи и ведомства не назывались; терминология процессуальная — «фоноскопическая экспертиза», «заключение эксперта», «законный перехват». Фоноскопия более 30 лет — вид судебной экспертизы в РФ и за рубежом; выводы автоматики требуют экспертного подтверждения, отсюда модули ручной фиксации признаков под заключение. AVIS — поиск, ИКАР Лаб — доказательство. Развёртывание — закрытый контур заказчика, on-prem, офлайн, роли и уровни доступа.
Вопросы из зала
Зал без микрофона и без разметки говорящих; имена не назывались, атрибуция — по контексту.
- Другие техники дипфейков — puppet-master, lip-sync, родинки? (он же — два следующих) → Элементы лица не проверял; «оживление» фото — 98 % на базах ЦРТ.
- Зачем вендор, если в основе «Multi-Tacotron какой-нибудь»? → Косвенная улика: сайт подозреваемого и место генерации.
- Prompt injection через аудио? → Модели в цепочке разные; маловероятно, «заказчики заинтересованы… чтобы данные были чистыми».
- Защита продукта от утечки? → Закрытый контур, on-prem.
- Шумоочистка при подавлении микрофона ультразвуком? → «Из разряда мифов»; за пределом по ОСШ — ручные методы.
- Нестор — девайс или лицензия? → ПАК: микрофоны с ПО либо только ПО.
- Скорость транскрибирования? («Ольга») → На серверных видеокартах 1000 секунд речи в секунду.
- Экспертизы на других языках? (та же) → Ручное транскрибирование носителем; экспорт в ряд стран.
Позиция спикера
Тон вендорской презентации: «всемирно признанные», «работает на высоком достаточном качестве». Автоматика при этом не подаётся как замена эксперту: её выводы требуют подтверждения, классика аутентичности работает, детекторы синтеза проигрывают гонку алгоритмам. С залом спорит о вендоре синтеза: оппонент — определять надо ветки инструментов, спикер — вендор как улика. Ограничения частью признаёт сам: элементы лица не проверял, 98 % — на своих базах, при падении ОСШ точность падает.
Цитаты
- «…выводы любой автоматической системы нуждаются в экспертном подтверждении.»
- «…большинство слушателей не отличают голос синтезированного человека от голоса человека живого.»
- «…это из разряда мифов, что такие решения очень серьезно защищают дикторов от записи.»
- «…чем больше шума, тем ниже будет вероятность верного определения…»