Расшифровка · Диаризация
Диаризация это разметка записи по говорящим: программа отвечает, кто и когда говорил, и подписывает отрезки «Спикер 1», «Спикер 2». Слова в текст переводит расшифровка речи, диаризация раскладывает готовый текст по голосам. Ниже, как она работает, где ошибается и чем её заменяет запись созвона двумя дорожками.
На входе запись, где говорят несколько человек. На выходе список отрезков: с 00:00 до 00:14 говорил первый голос, с 00:14 до 00:31 второй, потом снова первый. Имён программа не знает, поэтому пишет «Спикер 1» и «Спикер 2». Кто есть кто, подписывает человек, прослушав пару реплик.
Диаризацию путают с двумя соседними задачами. Расшифровка речи отвечает, что сказано. Опознание говорящего отвечает, кто это по имени, и для него нужны заранее записанные образцы голоса. Диаризация стоит посередине: голоса она различает, имён не знает. Про саму расшифровку и стенограмму на странице что такое транскрибация.
Отпечаток голоса строится по тембру, высоте и манере звучания. Слова для него значения не имеют: одну фразу разные люди произносят с разными отпечатками, разные фразы одного человека дают похожие.
Число говорящих программе или задают заранее, или она оценивает его сама. Во втором случае она может слить двух похожих людей в одного или разделить одного человека на двух, если он отошёл от микрофона. Как устроены шаги самой расшифровки, на странице как работает расшифровка речи.
Твёрдого предела нет, он зависит от модели и от записи. Проще всего различить двух говорящих с непохожими голосами у хорошего микрофона. Чем больше людей, чем короче их реплики и чем хуже звук, тем чаще голоса сливаются и дробятся. Если число участников известно заранее, его стоит задать: так программе не придётся угадывать, сколько групп искать.
На записи совещания с одного микрофона эти ошибки видны сразу: реплика начинается у одного спикера и заканчивается у другого. Правят их вручную, прослушивая спорные места.
Разметку по голосу в расшифровке Sonaro мы выключили. Говорящих делит сама запись. Расширение пишет звук вкладки со встречей и ваш микрофон в два разных файла, и сервис расшифровывает их отдельно. Всё, что пришло с микрофона, подписано «я». Всё, что играло во вкладке, подписано «собеседник».
Отсюда два следствия. Ваша фраза никогда не уедет к собеседнику: она записана в другой файл. Если вы и собеседник заговорили разом, обе фразы останутся, каждая в своей дорожке. В файле расшифровки роль стоит прямо в строке реплики, рядом со временем и дорожкой, например «00:12 · я · микрофон».
Предел тоже честный. Если с той стороны говорят три человека, они приходят одной ролью «собеседник». Кто из них сказал фразу, понятно по смыслу или по звуку: нажмите реплику, и звук встанет на её секунду.
С вашей стороны правило то же. Если коллега сидит рядом и говорит в ваш ноутбук, его голос попадёт в ваш микрофон и будет подписан «я». Чтобы его реплики стояли отдельно, пусть он подключится к встрече со своего компьютера из соседней комнаты: тогда его голос придёт во вкладку ролью «собеседник».
Микрофон лучше слушать в наушниках. Так он не подхватывает голос собеседника из колонок, и дорожки остаются чистыми. Как ответить на вопрос «кто это сказал», если спор возник через месяц, описано на странице что сказал клиент на созвоне.
Когда запись сделана одним микрофоном на всех: совещание в переговорной, диктофон на столе, подкаст с тремя гостями в одной студии. Дорожка там одна, и делить её можно только по голосу. То же, если с той стороны созвона в одной комнате сидят несколько человек и важно, кто из них что сказал. Такие записи расшифровывают сервисы с разметкой говорящих. Для интервью, где у каждого свой микрофон и своя дорожка, диаризация не нужна: роли уже разделены записью. Если встречу ещё только предстоит записать, дайте каждому участнику свой микрофон с отдельной дорожкой: делить запись по голосу потом не придётся.
Возьмём короткий обмен на созвоне. Вы спрашиваете: «А сроки там откуда берутся?». Собеседник отвечает: «Из таблицы по городам, я её сейчас покажу». Вы говорите: «Угу».
После диаризации общей записи это три отрезка с метками «Спикер 1», «Спикер 2» и снова «Спикер 1». Короткое «угу» может уйти ко второму спикеру: для отпечатка голоса оно слишком короткое.
В записи Sonaro те же реплики лежат в двух дорожках. Вопрос и «угу» пришли с микрофона и подписаны «я», ответ пришёл из вкладки и подписан «собеседник». Короткое «угу» остаётся вашим, потому что его записал ваш микрофон. Если оно прозвучало поверх чужой фразы, в ленте оно стоит сбоку и фразу пополам не рвёт.
Роль «собеседник» получает то, что играло во вкладке со встречей, роль «я» то, что слышал ваш микрофон.
Две дорожки получаются у созвона, открытого по ссылке в браузере.
Реплики и роли появятся с той секунды, когда вы нажали «Начать запись».
Имена участников на экране площадки в разметку не попадают: подписи на кадре сервис не читает.
Голос из второй вкладки не станет третьим говорящим: пишется одна вкладка.
Если вам важны имена нескольких людей с одной стороны созвона, нужна диаризация: Sonaro отдаст их одной ролью. Если запись уже лежит файлом с одного микрофона, делите её сервисом с разметкой говорящих, в кабинет готовые файлы не загружаются. Такие сервисы собраны на странице российские сервисы расшифровки встреч.
Расшифровка переводит речь в слова. Диаризация отвечает, кто и когда говорил, и подписывает отрезки «Спикер 1», «Спикер 2».
Сама нет: имён она не знает. Имена ставит человек, прослушав реплики, или отдельная система опознания по заранее записанным образцам голоса.
Похожие голоса, короткие ответы, речь одновременно, шум и смена микрофона. На записи с одного микрофона ошибок больше всего.
По дорожке, без диаризации. Микрофон и звук вкладки пишутся в разные файлы, поэтому ваши реплики подписаны «я», реплики с той стороны «собеседник».
Если ваш голос и собеседник записаны отдельными дорожками, нет: роли уже разделены. Для общей записи с одного микрофона нужна.
Как получить расшифровку встречи с ролями, описано на странице расшифровка встречи. Выбор между ботом, файлом и записью из браузера на странице транскрибация встречи онлайн.