Подводка ведущего

Кликер только можно мне вернуть. И наша следующая тема, она закрывающая сегодняшнего дня, но она будет актуальна как никогда, потому что, по-моему, в прошлом году искусственный интеллект не внедрил только ленивый. Сегодня, в принципе, с этим пришло очень много всего полезного, очень много всего интересного, но также пришли всякие различные вызовы и угрозы. О чем нам сегодня расскажет непосредственно представитель компании-партнера конференции ЦРТ Михаил Инкин. Пожалуйста, Михаил, вам слово. Давайте поддержим аплодисментами. Кликер нижний.

Доклад и вопросы

Добрый день всем. Да, здравствуйте. У нас тут технические проблемы. Можно с первого слайда?

Давайте я сам полистаю, куда-то мы перескочили здесь. Ну вот сразу все слайды посмотрите мои, тоже неплохо. Анонс. Да, такой небольшой анонсик. Почему-то мы начали с конца, а не сначала.

Спасибо. Добрый день, еще раз. Зовут Михаил, компания ЦРТ, руководитель группы проектов. И сегодня с удовольствием расскажу вам про то, как мы с помощью нашей технологии биометрии помогаем решать криминалистические задачи. Пару слов о компании ЦРТ. На рынке больше 35 лет. Выпускаем продукты решения на основе голосовой биометрии, технологии распознавания лиц и интеллектуальных речевых технологий. Внедрили уже более 5000 проектов по всему миру, включая Российскую Федерацию и многие другие страны. Отдельно хочу отметить, что наши алгоритмы сегодня являются всемирно признанными, регулярно участвуют в международных научных и технологических конкурсах и доказывают свою эффективность на международной арене. Вот здесь на слайде некоторые из конкурсов приведены. NIST, CHiME Challenge.

Имеем достаточно широкую экспертизу в работе с большими языковыми моделями, в том числе с моделью GigaChat от Сбера и также со свободно распространяемыми моделями большими языковыми. Плюс ко всему имеем экспертизу по настройке больших языковых моделей под запрос конкретного заказчика под его практическую прикладную задачу. И сегодня я хотел в своем докладе сделать акцент на том, как аудиоданные могут обогащать работу эксперта, какие дополнительные инсайты эти аудиоданные могут экспертам предоставлять. И, наверное, начну я с вопроса вообще голосовой биометрии. И коротко надо сказать, что в целом голосовую биометрию можно разделить на несколько основных методов. Это автоматические методы распознавания, где работа происходит в автоматическом режиме с минимальным участием оператора.

Сегодня мы выпускаем системы языконезависимые и текстонезависимые. Неважно, на каком языке говорит диктор, наша биометрия этого диктора узнает. И, конечно, есть такой принцип, что выводы любой автоматической системы нуждаются в экспертном подтверждении. Конечно, следуя этому принципу, мы также предлагаем нашим заказчикам и автоматизированные методы идентификации дикторов, и полностью ручные методы. В наших продуктах они реализованы. Здесь примеры технологий, которые мы используем в наших автоматических алгоритмах. И надо сказать, что наши технологии работают на разных типах микрофонов, достаточно хорошо себя показывают в разных акустических условиях.

Буквально пару слов про речь и про вообще истоки биометрии. Следует отметить, что в формировании голоса участвует более 70 частей человеческого тела. Тело каждого человека уникально. Благодаря этому синтезируемый голос каждого человека уникален, что позволяет их отличать записи дикторов автоматическими методами, ручными методами. Ну и вот, например, более 30 лет фонограммы, фоноскопические экспертизы используются в качестве судебной экспертизы как в России, так и за рубежом. Я, наверное, пропущу вопрос векторизации голоса, пропущу вопрос, как работают автоматические модели. Чуть-чуть побольше расскажу про ручные подходы к определению дикторов. Здесь больше криминалистическое сообщество. Понятно, что у голоса представлены разные изображения. Голоса, осциллограмма, спектрограмма, кепстрограмма – это все разные представления одного и того же звукозаписи человеческого голоса. И следует отметить, что у голоса имеются идентифицирующие характеристики, например, такие, как форманты, которые исследуются, например, такие, как основной тон, которые позволяют при работе с ними приходить к однозначным выводам в процессе выполнения экспертизы фоноскопической.

Также нельзя обойти стороной вопрос сложности этой задачи, потому что как одна из таких легко доступных для получения биометрических модальностей, голос легко записать, диктофон положили, микрофончик, телефонную запись взяли. При этом эта задача по идентификации диктора достаточно сложная и осложняется она большой группой факторов. Это как сами дикторские факторы, технологические, например, разные микрофоны имеют разную АЧХ. Коммуникативные, ну вот один случай я там с ребенком говорю, другой случай с своим подельником, третий случай там с членом банды, например, если я преступник. И совершенно по-разному мой голос будет звучать в каждой из этих коммуникативных ситуаций. Ну и плюс это группа технических факторов, там ОСШ, наличие помехи, расстояние диктора микрофон. Все это вносит большое разнообразие в те аудиоданные, которые у наших пользователей могут быть. И, конечно, отметим, что наши алгоритмы сегодня достаточно успешно эти сложности могут преодолевать и выполнять идентификацию даже в сложных акустических условиях.

В наших продуктах используются такие методы основные для проведения идентификации. Это аудитивный метод прослушивания, акустический, фонетический метод анализа мелодического контура основного тона, спектрографический метод и автоматический. И я сегодня хочу рассказать, как разные продукты ЦРТ решают криминалистические задачи. Наверное, на каком-то прикладном кейсе можно себе представить, что есть набор аудиоданных. Они могли быть получены разными способами. Может быть, это законный перехват телефонный, может быть, это микрофонные записи, может быть, это изъятое устройство, из него загрузили голосовые сообщения. Есть какой-то массив данных, мы хотим его поанализировать. Там содержатся разные необработанные голоса, какие-то диалоги, какие-то речевые сообщения.

Что наши решения позволяют с этими массивами данных делать? Прежде всего скажем, что мы предлагаем продукты на всех ключевых этапах криминалистического процесса. Сегодня акцент основной сделаем на анализ данных продукта AVIS, на получение доказательства. Это криминалистические комплексы ИКАР Лаб 3 и также на решении это Нестор AI. Вопрос сбора данных сейчас касаться не будем, потому что это тема отдельная, про нее тоже можно много и долго говорить. Начнем с вопроса анализа данных. Эти массивы данных могут быть проанализированы, например, на комплексе AVIS. Это наш поисково-аналитический комплекс, который в автоматическом режиме из сырых, необработанных аудиоданных может извлекать большое количество информации. Что, например, можно делать? К примеру, можно в автоматическом режиме получать информацию о поле диктора, о языке общения.

Можно получать распознанный текст. Сегодня мы 18 языков поддерживаем. Русский, естественно, языки СНГ: украинский, казахский язык и некоторые другие. И также, например, иностранный, арабский язык. Можно осуществлять биометрический поиск, выполнять перевод текста из иностранного языка на русский и при получении необходимых данных можно выполнять дальше функции анализа, например, это кластерный анализ, статистический анализ и проводить аналитику связей. На дальнейших слайдах я покажу несколько примеров того, как подобная система работает. Вот здесь приведен экран работы приложения и показан процесс, как пользователь системы из большого количества данных проводит фильтрацию.

Система обнаруживает только те записи, которые соответствуют поисковым критериям. Например, это записи, где содержится определенный голос, где содержатся определенные ключевые слова. Вот они подсвечены на осциллограмме. Имеется текстовка данного сообщения. Все эти записи можно провести анализ связей. Например, вывести вот такие аналитические графы. И как один из примеров аналитического графа, есть возможность продемонстрировать связь тем, на какие темы интересующие нас голоса общались. Здесь выделена такая фонограмма. Это точно не она. Вторая у него была молодая такая наркоманка.

Точно не она. Здесь есть пример этой фонограммы. У нас, может быть, можно немножко добавить будет голоса для следующих примеров. Вот здесь видно, что ключевое слово сработало. И, соответственно, нужно вернуть.

Спасибо. Ну и вот это найденное ключевое слово позволило отнести данную беседу к какой-то интересующей отдельной тематике. Пропустим следующие картинки. Далее я хочу рассказать о том, как большие языковые модели позволяют улучшать работу таких поисково-аналитических систем, основанных на речевой биометрии. Наверное, основные возможности LLM достаточно широко уже известны. Я не буду здесь на этом слайде концентрироваться и покажу несколько практических кейсов применения больших языковых моделей в таких биометрических поисково-аналитических системах.

Один из подходов – это подключение LLM больших языковых моделей для выделения интересующей информации из массива данных. То есть пользователь с помощью определенного промпта может проанализировать найденный массив данных и получить краткую сводку по всем найденным фонограммам с выделением только тех фонограмм, которые для него представляют наибольший интерес. То есть пользователь читает коротенькую сводку, вместо того, чтобы прослушивать все фонограммы и читать содержимое каждой фонограммы, понимает, какие из этих фонограмм представляют для него наибольший интерес и дальше работает с каждой индивидуальной фонограммой для дальнейшего исследования. Еще один сценарий применения, вот сейчас тоже он на экране здесь показан, это суммаризация текста разговора. То есть процесс следующий. Из аудио получается текст, дальше текст поступает на вход языковой модели, и с помощью промпта возвращается результат в виде некоторого сжатого текстового представления.

Тоже отдельно хочу показать на этом слайде, например, наши эксперименты работы с большими языковыми моделями показывают, что большие языковые модели достаточно хорошо могут извлекать интересующую информацию для нас с вами. Как один из примеров, здесь предлагаю посмотреть на пункт номер 5. Использованы кодовые слова, сленг. То есть, к примеру, большие языковые модели сегодня достаточно хорошо обнаруживают те фонограммы, где используется какой-то скрытый язык, где маскируются какие-то объекты или предметы. И это позволяет давать новые инсайты пользователям таких систем.

Конечно, здесь хочется отметить, что поисково-аналитические системы решают задачи поиска, а задачи доказательства, для этого у нас есть другой комплекс, это экспертный комплекс ИКАР Лаб, в котором выполняется судебная фоноскопическая экспертиза. И я хочу рассказать о возможностях этого комплекса в рамках решения этой задачи. Из комплекса AVIS интересующие нас записи мы можем выгрузить в комплекс ИКАР Лаб и провести детальный анализ этой записи. Например, провести предварительную оценку качества, вынести решение о применимости этой фонограммы в судебной экспертизе и дальше выполнить полноценную фоноскопическую экспертизу, начиная с шумоочистки, извлечения текстового содержания, разделение фонограммы по дикторам и проведение идентификационного исследования полноценного с помощью разных методов, в том числе это поиск следов монтажа и в том числе поиск неситуационных изменений сигнала.

Я хочу отдельное внимание, вот здесь я сейчас буду звук воспроизводить, можно там, пожалуйста, чуть-чуть прибавить громкости.

Одна из фонограмм, которую я нашел в комплексе AVIS, она звучит следующим образом. Она почему-то нам показалась интересной, мы ее скачали и мы хотим ее прослушать. Я воспроизведу сейчас эту фонограмму, давайте послушаем. Слушай, я только что в аварию попал на трассе М4, уже под Москвой. Бэха в меня влетела, машина всмятку, срочно нужны деньги.

Возможно, те из вас, кто работает с аудио, смогли заметить, что здесь присутствуют некоторые неестественные нотки. Но как наша практика показывает, на самом деле большинство слушателей не отличают голос синтезированного человека от голоса человека живого. То, что мы сейчас с вами услышали, это синтезированный голос. Как это происходит? Был взят образец какого-то человека, загружен в систему, и дальше пользователь этой системы ввел какой-то произвольный текст, в нашем случае явно мошеннического характера, и система озвучила голосом целевого диктора интересующий мошенника текст. Понятная классическая ситуация, отправляется голосовое сообщение родителям, родители в панике, срочно ищут деньги, отправляют их и так далее.

Это достаточно серьезная современная угроза, вызов фоноскопическим системам: подделка голоса, синтез, перезапись, модификации голосовых сообщений. И хочу отметить, что комплекс ИКАР Лаб сейчас оснащен полноценным функционалом детекции спуфинга. Спуфинг – это такой термин, который применяется для описания синтезированного голоса, либо для описания модифицированного голоса. И хочу показать процесс. Здесь на экране мы видим, что программа умеет оценивать как общую оценку для всей фонограммы, оценку вероятности наличия спуфинга, так и оценивать вероятность наличия подделки на коротких участках. То есть есть скользящее окно, и каждую секунду вы видите распределение вероятности на нижнем графике о вероятности наличия поддельного голоса на том или ином участке фонограммы. Потому что сейчас мошенники могут подделывать не всю фонограмму, а только часть ее, какую-то наиболее важную часть.

ИКАР Лаб позволяет обнаруживать такие подделки. Более того, новейшие версии этого продукта умеют определять не только сам факт наличия спуфинга, но и в том числе конкретного вендора. Здесь, надеюсь, видно, на слайде написано, что с вероятностью 99,6% на этой фонограмме присутствует синтез производства вендора ElevenLabs. Сегодня определяем четырех основных вендоров. В будущем этот список будет расширяться. Отдельно хочется отметить, что вообще спуфинг — это достаточно нетривиальная задача. Детекция синтезированного голоса — это достаточно интересная и в то же время сложная задача. Не лишним будет отметить, что алгоритмы синтеза развиваются семимильными шагами, ежегодно появляются десятки, а может быть даже и сотни новых алгоритмов синтеза, поэтому здесь, конечно, происходит такое соревнование между детекторами синтеза и, собственно, сами алгоритмами синтеза речи. И зачастую в криминалистическом исследовании чаще ставится вопрос не факта наличия спуфинга, а в целом вопрос проверки аутентичности фонограммы, потому что зачастую следы наличия синтеза установить достаточно затруднительно бывает ввиду его совершенствования и ввиду того, что современные алгоритмы детектируют его очень качественно и очень хорошо.

Поэтому ИКАР Лаб позволяет более широко подходить к этой задаче и в том числе отвечать на вопрос на наличие следов монтажа с помощью классических методов, например, анализа фазы, анализа фонового шума и так далее. На этих слайдах я хотел показать очень коротко историю синтеза, чтобы немножко погрузиться в вопрос. Это вообще-то не вчерашнее изобретение. Первый синтезированный голос — это конец XIX века. Вот такое было устройство механическое, которое умело произносить два таких речеподобных слова «yes» или «no». Там даже ссылка на статью есть, можно ее посмотреть, если будет интересно. Ну и вот такие массовые примеры синтеза. Мы сейчас тоже, наверное, прослушаем пару таких примеров.

Если можно, чуть-чуть потише сделать, совсем немножко, просто они будут неприятные такие на слух, эти примеры. Вот, например, вариант синтеза 79-го года, это такой первый массовый прибор, куда был встроен синтез человеческой речи. Давайте я воспроизведу.

Ну, здесь все понятно, тут даже ребенок слегка найдет, что это синтез. Вот, например, уровень синтеза 2000-х годов, тоже послушаем фрагмент.

В целом он уже более похож на речь живого человека, но, однако, здесь нет эмоций, нет дыхания, ну, просто какие-то речеподобные звуки. Их тоже легко отличить от речи живого человека. Один здесь я вот пропущу. И вот, например, текущее состояние – это пример, взятый с новостных сайтов, это прошлогодний пример, когда на президентской кампании в США синтез голоса на тот момент президента Байдена, вот он активно использовался для такого черного пиара, вот воспроизведу фрагмент.

Я, наверное, не буду всю фонограмму воспроизводить, она к тому же на английском языке. Но самое важное здесь, на что я хочу обратить внимание, что с каждым годом речь звучит все более и более естественно. И вот если я вернусь назад к тому фрагменту, который мы с вами слушали с BMW, мы там услышим и дыхание, имитацию дыхания, естественно, и паузы, и интонации. Все это системы научились копировать с речи диктора, а наша система антиспуфинга умеет защищаться и детектировать такие подделки. Дополнительно отмечу, что в ИКАР Лаб есть функционал проведения ручной экспертизы для того, чтобы эксперт вручную мог обнаружить и зафиксировать те признаки, которые дальше сможет включить в состав своего заключения для подтверждения выводов автоматической системы.

И, как я уже упомянул, есть модули для такого классического технического анализа. Это анализ фазы, анализ передискретизации, анализ фонового шума, анализ постоянной составляющей. Эти методы живут и до сих пор помогают экспертам решать задачи в поиске следов нарушения аутентичности.

Еще один такой интересный пример. Мы получили эти записи из свободных источников. И здесь мы уже немножечко тему с голосовой биометрией разовьем до темы мультимодальной биометрии, и посмотрим на то, что в рамках лица наша система умеет делать. Так у нас последнее выступление, потом дальше какие-то тоже будут активности. Чтобы немножко вас включить, я хочу небольшую загадку предложить вам. Я сейчас воспроизведу два видео одновременно. Одно из них – это видео живого человека, а второе видео – это видео синтеза. То есть это поддельное лицо, ненастоящая картинка. И вот я вас попрошу ответить на вопрос, какое видео, на ваш взгляд, настоящее, верхнее или нижнее. Потом просто проголосуем, посмотрим, как голоса распределятся. Вот посмотрите, пожалуйста, внимательно. Это Джессика Альба. Мне тут подсказывают мои коллеги.

Давайте посмотрим, как это выглядит.

Здесь нет речи, здесь только картинка. Я сейчас еще раз воспроизведу.

Давайте еще раз посмотрим.

Вот первый тогда вопрос такой. Поднимите, пожалуйста, руки, кто думает, что настоящее видео верхнее. Спасибо. Теперь попрошу поднять руки тех, кто думает, что настоящее видео нижнее. Ну, примерно поровну, примерно поровну, чуть-чуть побольше тех, кто за верхнее видео голосует. Вам сейчас правильный ответ сказать или попозже? Сразу. Да, настоящее видео внизу, да, сверху — это синтез. Ты… Молодцы те, кто сказал «внизу». Спасибо тем, кто участвовал и сказал «сверху». Сверху — это синтез. И я хочу показать, каким образом наш продукт может помогать эксперту отвечать на такой вопрос.

В ИКАР Лаб появился модуль детекции дипфейков. Это покадровый анализ видео лиц. Я на этом куске воспроизведу видео из реального интерфейса, как это происходит. То есть эксперт может анализировать видео прямо в своем экземпляре программы ИКАР Лаб.

Система проводит покадровый анализ. Для каждого кадра выводится оценка вероятности наличия подделки. Ну и дополнительно накладывается маска, которая показывает, какие участки лица вызвали наибольшее возбуждение нейронов в сети. Это не говорит о том, что эти части лица поддельные. Это в целом указывает на то, что они почему-то у нейросети вызывают наибольшее внимание. Для этого видео мы с вами видим справа в интерфейсе, у нас появилась вероятность подделки 97%.

И дополнительно к этому программа оценивает, там написано в допуске, вероятность допуска. То есть она оценила также количество кадров, где имеются избыточные повороты или наклоны головы. То есть программа дополнительно оценивает, смотрит ли лицо прямо в камеру, либо оно наклонено, повернуто и так далее.

Для оригинального видео тоже вам продемонстрирую — ситуация обратная. Это видео с живым человеком, с настоящим изображением госпожи Джессики Альбы. Ну и здесь видно, что вероятность оценки очень низкая. Это позволяет приходить к выводу, что это видео живого человека. Ну и также выводится вероятность оценки для всех проанализированных кадров, также и для тех кадров, которые у нас оказались в допуске. То есть вот такой инструментарий тоже мы сейчас своим заказчикам предлагаем, потому что дипфейки, спуфинг и синтез – это действительно серьезный на сегодняшний день вызов, с которым мы сталкиваемся, и поэтому наши решения оснащаются методами противодействия таким решениям.

Дополнительно отмечу, что в экспертной криминалистической системе ИКАР Лаб имеется также модуль ручной оценки признаков видеосинтеза, для того чтобы эксперт уже в свой отчет, в свои заключения мог включать свои наблюдения в структурированном виде.

И, наверное, последний пример здесь я хотел бы привести. Это наша система Нестор AI. Когда мы поискали данные из массива, нашли некоторые интересующие нас фонограммы либо мультимедиафайлы, вручную их проверили, получили какие-то сначала домыслы, потом подозрения, задержали подозреваемого, проходятся разбирательства. И эти разбирательства могут быть зафиксированы, но они будут зафиксированы на камеру, на микрофон. Мы также предлагаем систему, это система Нестор AI, которая умеет в автоматическом режиме протоколировать официальные заседания. То есть она может работать как с потоковыми аудио, так и с файлами, полученными из системы, например, телефонных конференций, таких как Zoom, либо диктофонных записей.

Результатом работы такой системы является протокол строгой формы, где содержится текстовка этой встречи, разбитая по дикторам. Ну и также отмечу, что в такие системы мы встраиваем большие языковые модели, которые также позволяют суммировать результаты встреч, выводить краткие сжатые аннотации этих встреч для удобства работы с такого рода протоколами. Вот здесь вы видите пример интерфейса системы. То есть это и количество дикторов было определено, пол этих дикторов. Вот представлена текстовка, и сейчас будет продемонстрирован результат работы ИИ-агента.

Вот такой протокол совещания. Причем с помощью промптинга, конечно, можно настраивать выводы этих агентов в зависимости от потребности наших заказчиков. Наверное, в качестве заключения хотел сказать, что мы работаем на разных этапах криминалистического процесса и привносим новую модальность к тем данным, которые у вас есть, позволяя находить новые инсайты. Спасибо. У нас, наверное, есть время на вопросы небольшое. Да, конечно, есть. Михаил, большое спасибо. Итак, коллеги.

— У меня два вопроса есть, они не связаны друг с другом. Но вот первый вопрос относительно видеодипфейков. По приведенным примерам, я бы сделал вывод, что это face swapping изначально, как техника применялась. Хорошо, детектите. А пробовали ли вы и как себя ведет продукт на остальных техниках? Puppet-master, lip-syncing и синтез чего-нибудь? Усов, родинок, серег и так далее.

По поводу синтеза элементов лица, я лично этого не проверял, например, наложение родинок и так далее, но для всех остальных ситуаций это лицевая маска, подмена лица в реальном времени, мы проверяли, это все работает на высоком достаточном качестве. Нет, не только подмена. Lip-syncing, подмена — это часть лица, когда основное лицо и мимика его сохраняются, но только часть меняется, в основном это треугольник. Один из примеров – это, например, когда оживляют фотографию какого-то известного человека. То есть вот есть фотография, мы накладываем движение маски, ну, злоумышленник накладывает движение маски губ, и в целом, да, такие подделки легко детектируются. На наших базах мы добиваемся результата 98%. Понятно, что для остальных данных надо смотреть, проверять на данных. Но в целом результат очень хороший.

Ну да, то есть тут в целом странно было слышать, что вы конкретных вендоров определяете. Я думал, там в основе тех же аудиодипфейков Multi-Tacotron какой-нибудь сидит все равно. И в основном-то ветки инструментов тогда имеет смысл определять, а не вендора, который взял бесплатное и там перелицевал чуть-чуть. Почему важно определение вендора? Ну вот мы тут тоже с экспертом это обсуждали, с нашим экспертом. Конечно, это дополнительные косвенные доказательства при работе с делом. Потому что если мы можем определить, что наш подозреваемый ходил на такой-то сайт, например. Если мы можем обнаружить, что синтез был сгенерирован с этого же сайта, мы получаем дополнительные доказательства к работе эксперта.

Спасибо. И вот второй вопрос, исключительно из праздного любопытства. Проверяли ли вы возможность вашей распознавалки, которая потом нейронит все это дело, относительно отравления данных? То есть что будет, если я, грубо говоря, на неслышимом уровне в аудиосигнал добавлю системный промпт из разряда «слушай меня» LLM, который будет сейчас разбирать. И, соответственно, голос совести ей диктует что-нибудь дальше сделать. Так, ну здесь мы конкретно про промптинг с вами говорим. Отравление. Просто у вас входные данные — это аудио. При этом как именно у вас speech-to-text работает? То есть, может быть, я могу внедрить верхний слой, например, изначально первую часть в какой-нибудь паузе достаточно большой вставить, чтобы дальше все игнорировать, используя только этот частотный диапазон и, собственно, дальше навставлять остальное. Спасибо за вопрос. Здесь надо сказать, что в этой цепочке используются несколько моделей, и они разные.

То есть для преобразования речи в текст это одни модели, наши собственные разработки. Для дальнейшего LLM-анализа используются другие модели. Поэтому, что касается превращения фонограммы в текстовку, здесь маловероятно, если учитывать то, как эти данные у наших заказчиков появляются. Обычно они заинтересованы в том, чтобы данные были чистыми. И там, как правило, нет заинтересованности у пользователя в том, чтобы эти данные исказить. Обычно возникает вопрос другой. Давайте мы на какую-то специфическую модальность их настроим. Например, дикторы у нас говорят на какие-то строго определенные темы, каким-то странным языком, выдуманным или школьным, фантастическим. И тогда они уже к нам идут и говорят, пожалуйста, допилите и докрутите модель так, чтобы она вот этот сленг узкой группы людей хорошо распознавала. И такую задачу мы решаем. А то, что касается обработки, как правило, заказчик заинтересован в том, чтобы данные были чистыми.

Как правило, таких ситуаций не бывает.

— У меня будет маленький вопрос, я волнуюсь, но хочу задать. Есть ли какие-то внутренние методы защиты программного продукта от утечки? Так-то это вообще можно воспринимать как оружие, когда есть возможность распознания и анализа речевых данных.

— Спасибо за вопрос. Обычно все эти системы, они разворачиваются всегда в закрытых контурах наших заказчиков. И вот этот вопрос по защите данных, он решается тем, что система работает в закрытом контуре, ну и плюс ко всему там используются технические решения для того, чтобы данные, там это разграничение доступов, например, роли, привилегии, разграничение уровней доступа, для того, чтобы пользователь видел только те данные, которые ему нужны. Ну и я тоже отмечу, что те модели, которые мы предлагаем, это как и LLM-модели, так и модели преобразования речи в текст, биометрические модели. Они все работают on-prem, то есть они не требуют никакого выхода к интернету. И они могут и разворачиваются всегда офлайн на решениях, на железе наших заказчиков.

Так, Ольга Александровна, подождите секундочку. Я вот тоже вижу тут вопрос.

Спасибо большое за доклад. Такой практический вопрос. Скажите, насколько эффективно ваша система борется с… Если есть у нас образец аудио, на который подавляли микрофон с помощью ультразвука. Насколько эффективна идет шумоочистка?

— Спасибо за вопрос. Вопрос большой. Если отвечать в формате конференции, времени мало, поэтому отвечу сжато. Здесь, конечно, во-первых, возникает вопрос получения этих данных. Вы говорите про подавление ультразвуком или чем-то. Это вообще отдельная тема, на которой можно подискутировать, потому что в нашей практике мы очень редко сталкиваемся с ситуациями, когда реально такие подавители могут хорошим микрофонам какую-то серьезную помеху поставить. Начнем с этого, что, как правило, это из разряда мифов, что такие решения очень серьезно защищают дикторов от записи. Второй момент, который надо указать, конечно, алгоритмы достаточно устойчивы к изменению акустической обстановки, ОСШ, реверберация, отношение сигнал-шум, уровень реверберации и так далее. Безусловно, при разработке этих алгоритмов мы всегда закладываем, что акустические условия, в которых производится запись, как я там писал, это не только ближний, но и дальний микрофон может быть.

Они могут быть неидеальными. Поэтому здесь до определенного предела, какого-то значения ОСШ, вероятность очень высокая. Конечно, надо честно сказать, что чем меньше ОСШ, чем больше шума, тем ниже будет вероятность верного определения для автоматического метода. Но здесь мы можем сказать о том, что есть ручные системы, экспертные, такие как ИКАР Лаб, где уже с помощью ручных методов и других подходов, например, лингвистического, либо какого-то еще, можно такие проблемы успешно преодолевать. Спасибо. И второй вопрос, больше коммерческий, наверное. Ваш продукт Нестор, он подразумевает девайс или лицензионное продление? Это программно-аппаратный комплекс. Возможны разные варианты поставки. Это и микрофоны плюс ПО, так и просто ПО. То есть ПО может использовать те микрофоны, на которых у заказчика стоят микрофоны, микрофонные массивы. Такие решения тоже мы предлагаем. То есть это можно приобрести как программу.

— Так, Ольга Светлановна, помню, был вопрос. А насколько быстро у вас идет транскрибирование речи? Просто я знаю системы, которым нужны очень большие мощности, чтобы качественно транскрибировать соответствующий аудиофайл. Спасибо. Вопрос понятный, но здесь тоже нет простого ответа.

Надо сказать следующее, что скорость транскрибирования зависит как от объема, понятно, так и от железа. И, конечно, в первую очередь от железа. И вот такой пример приведу, что на современных, например, видеокартах, на серверных решениях ускорение превращения речи в текст может достигать тысячи и даже десятков тысяч раз. Ну, условно, тысячу секунд речи преобразуется в текст за одну секунду. То есть здесь надо садиться и смотреть объем данных и какое оборудование есть у заказчика. Ну, то есть вот в реальном режиме времени транскриптация… Значительно быстрее, чем в реальное время. Прекрасно. И еще в самом начале вы сказали, что у вас там несколько языков. Насколько я знаю фоноскопические методики, у нас здесь как бы востребован русский язык, в общем, там, где есть носители. И фоноскопист не может делать экспертизу, если он не является носителем данного языка. А кем востребовано исследование по другим языкам?

— Да, отвечу так, что мы эти комплексы… Во-первых, в ИКАР Лаб имеется возможность ручного транскрибирования, для того чтобы носитель языка, например, какого-то регионального, если он не поддержан в сесомо-автоматическом режиме, мог бы делать вручную транскрибирование. Ну и во-вторых, мы скажем, что и ИКАР Лаб экспортируется в ряд стран, и эти языки довольно применимы там.

— Михаил, большое спасибо. Это был заключительный доклад и заключительный вопрос у нас в сегодняшней конференции. Спасибо.