Расшифровка · Диаризация

Что такое диаризация и как делят говорящих в записи

Диаризация это разметка записи по говорящим: программа отвечает, кто и когда говорил, и подписывает отрезки «Спикер 1», «Спикер 2». Слова в текст переводит расшифровка речи, диаризация раскладывает готовый текст по голосам. Ниже, как она работает, где ошибается и чем её заменяет запись созвона двумя дорожками.

Что делает диаризация

На входе запись, где говорят несколько человек. На выходе список отрезков: с 00:00 до 00:14 говорил первый голос, с 00:14 до 00:31 второй, потом снова первый. Имён программа не знает, поэтому пишет «Спикер 1» и «Спикер 2». Кто есть кто, подписывает человек, прослушав пару реплик.

Диаризацию путают с двумя соседними задачами. Расшифровка речи отвечает, что сказано. Опознание говорящего отвечает, кто это по имени, и для него нужны заранее записанные образцы голоса. Диаризация стоит посередине: голоса она различает, имён не знает. Про саму расшифровку и стенограмму на странице что такое транскрибация.

Как работает диаризация

  1. Программа находит в записи участки с речью и отбрасывает тишину и шум.
  2. Режет речь на короткие отрезки.
  3. Для каждого отрезка считает отпечаток голоса: набор чисел, в котором похожие голоса оказываются рядом.
  4. Группирует похожие отпечатки: сколько групп, столько голосов.
  5. Склеивает соседние отрезки одной группы в реплики и совмещает их по времени с расшифровкой речи.

Отпечаток голоса строится по тембру, высоте и манере звучания. Слова для него значения не имеют: одну фразу разные люди произносят с разными отпечатками, разные фразы одного человека дают похожие.

Число говорящих программе или задают заранее, или она оценивает его сама. Во втором случае она может слить двух похожих людей в одного или разделить одного человека на двух, если он отошёл от микрофона. Как устроены шаги самой расшифровки, на странице как работает расшифровка речи.

Сколько говорящих различает диаризация

Твёрдого предела нет, он зависит от модели и от записи. Проще всего различить двух говорящих с непохожими голосами у хорошего микрофона. Чем больше людей, чем короче их реплики и чем хуже звук, тем чаще голоса сливаются и дробятся. Если число участников известно заранее, его стоит задать: так программе не придётся угадывать, сколько групп искать.

Где диаризация ошибается

На записи совещания с одного микрофона эти ошибки видны сразу: реплика начинается у одного спикера и заканчивается у другого. Правят их вручную, прослушивая спорные места.

Как проверить разметку говорящих

Кабинет Sonaro, раздел «Запись»: сведения о записи, две дорожки, вкладка и микрофон, с уровнями и весом, длительность и число кадров
Две дорожки одной встречи: звук вкладки и микрофон записаны порознь.

Как говорящих делит Sonaro

Разметку по голосу в расшифровке Sonaro мы выключили. Говорящих делит сама запись. Расширение пишет звук вкладки со встречей и ваш микрофон в два разных файла, и сервис расшифровывает их отдельно. Всё, что пришло с микрофона, подписано «я». Всё, что играло во вкладке, подписано «собеседник».

Отсюда два следствия. Ваша фраза никогда не уедет к собеседнику: она записана в другой файл. Если вы и собеседник заговорили разом, обе фразы останутся, каждая в своей дорожке. В файле расшифровки роль стоит прямо в строке реплики, рядом со временем и дорожкой, например «00:12 · я · микрофон».

Предел тоже честный. Если с той стороны говорят три человека, они приходят одной ролью «собеседник». Кто из них сказал фразу, понятно по смыслу или по звуку: нажмите реплику, и звук встанет на её секунду.

С вашей стороны правило то же. Если коллега сидит рядом и говорит в ваш ноутбук, его голос попадёт в ваш микрофон и будет подписан «я». Чтобы его реплики стояли отдельно, пусть он подключится к встрече со своего компьютера из соседней комнаты: тогда его голос придёт во вкладку ролью «собеседник».

Микрофон лучше слушать в наушниках. Так он не подхватывает голос собеседника из колонок, и дорожки остаются чистыми. Как ответить на вопрос «кто это сказал», если спор возник через месяц, описано на странице что сказал клиент на созвоне.

Когда без диаризации не обойтись

Когда запись сделана одним микрофоном на всех: совещание в переговорной, диктофон на столе, подкаст с тремя гостями в одной студии. Дорожка там одна, и делить её можно только по голосу. То же, если с той стороны созвона в одной комнате сидят несколько человек и важно, кто из них что сказал. Такие записи расшифровывают сервисы с разметкой говорящих. Для интервью, где у каждого свой микрофон и своя дорожка, диаризация не нужна: роли уже разделены записью. Если встречу ещё только предстоит записать, дайте каждому участнику свой микрофон с отдельной дорожкой: делить запись по голосу потом не придётся.

Как выглядит результат на одном примере

Возьмём короткий обмен на созвоне. Вы спрашиваете: «А сроки там откуда берутся?». Собеседник отвечает: «Из таблицы по городам, я её сейчас покажу». Вы говорите: «Угу».

После диаризации общей записи это три отрезка с метками «Спикер 1», «Спикер 2» и снова «Спикер 1». Короткое «угу» может уйти ко второму спикеру: для отпечатка голоса оно слишком короткое.

В записи Sonaro те же реплики лежат в двух дорожках. Вопрос и «угу» пришли с микрофона и подписаны «я», ответ пришёл из вкладки и подписан «собеседник». Короткое «угу» остаётся вашим, потому что его записал ваш микрофон. Если оно прозвучало поверх чужой фразы, в ленте оно стоит сбоку и фразу пополам не рвёт.

Кабинет Sonaro: лента реплик с временами и кадр экрана с таблицей справа
Лента встречи: у каждой реплики роль и время, роль взята из дорожки.

Что получится и чего не будет

Пишется звук вкладки

Роль «собеседник» получает то, что играло во вкладке со встречей, роль «я» то, что слышал ваш микрофон.

Встречу открывают в браузере

Две дорожки получаются у созвона, открытого по ссылке в браузере.

Запись начинается по вашему нажатию

Реплики и роли появятся с той секунды, когда вы нажали «Начать запись».

Текст с кадров не читается

Имена участников на экране площадки в разметку не попадают: подписи на кадре сервис не читает.

Соседняя вкладка в запись не попадёт

Голос из второй вкладки не станет третьим говорящим: пишется одна вкладка.

Когда Sonaro не нужен

Если вам важны имена нескольких людей с одной стороны созвона, нужна диаризация: Sonaro отдаст их одной ролью. Если запись уже лежит файлом с одного микрофона, делите её сервисом с разметкой говорящих, в кабинет готовые файлы не загружаются. Такие сервисы собраны на странице российские сервисы расшифровки встреч.

Вопросы

Чем диаризация отличается от расшифровки речи?

Расшифровка переводит речь в слова. Диаризация отвечает, кто и когда говорил, и подписывает отрезки «Спикер 1», «Спикер 2».

Может ли диаризация подписать говорящих именами?

Сама нет: имён она не знает. Имена ставит человек, прослушав реплики, или отдельная система опознания по заранее записанным образцам голоса.

Почему диаризация путает говорящих?

Похожие голоса, короткие ответы, речь одновременно, шум и смена микрофона. На записи с одного микрофона ошибок больше всего.

Как Sonaro отличает мой голос от собеседника?

По дорожке, без диаризации. Микрофон и звук вкладки пишутся в разные файлы, поэтому ваши реплики подписаны «я», реплики с той стороны «собеседник».

Нужна ли диаризация для созвона один на один?

Если ваш голос и собеседник записаны отдельными дорожками, нет: роли уже разделены. Для общей записи с одного микрофона нужна.

Что дальше

Как получить расшифровку встречи с ролями, описано на странице расшифровка встречи. Выбор между ботом, файлом и записью из браузера на странице транскрибация встречи онлайн.