Расшифровка · Как это работает

Как работает расшифровка речи: от звука до реплики

Расшифровка речи идёт в несколько шагов. Звук готовят: выравнивают громкость и сводят в один канал. Модель слушает его и выдаёт слова с временем каждого. Потом текст режут на реплики по паузам и расставляют знаки. Ниже шаги по порядку и что с ними происходит на записи созвона из браузера.

Шаги расшифровки речи

Любая система расшифровки речи проходит похожий путь, отличаются детали и настройки.

  1. Подготовка звука. Запись приводят к одному виду: одна частота, один канал, ровная громкость. Тихий голос поднимают, резкие пики опускают.
  2. Признаки. Звук режут на очень короткие отрезки и для каждого считают, какие частоты в нём звучат. Получается картинка звука, с которой и работает модель.
  3. Модель. Нейросеть сопоставляет эту картинку со словами. Современные модели учатся на огромных наборах пар «звук и текст» и держат в памяти соседние слова, поэтому «сроки поставки» отличают от «строки поставки» по смыслу фразы.
  4. Время слов. У каждого слова модель отмечает начало и конец. По этим меткам текст потом связывают со звуком.
  5. Реплики и знаки. Слова собирают во фразы по паузам и ставят точки и запятые. Некоторые системы на этом шаге ещё переводят числа в цифры и приводят даты к одному виду.

Раньше звук и язык обрабатывали две отдельные модели, акустическая и языковая. Сейчас чаще одна нейросеть делает эту работу целиком, но шаги до неё и после неё остались. Про то, что такое транскрибация вообще и чем она отличается от стенограммы, на странице что такое транскрибация.

От чего зависит точность

Почему на созвоне ошибок больше, чем на диктофоне

Голос собеседника на созвоне проходит долгий путь: его микрофон, шумоподавление площадки, сжатие для передачи по сети, ваш интернет и воспроизведение во вкладке. На каждом шаге теряется часть звука. Когда сеть проседает, площадка отдаёт голос рывками или глотает слоги, и модель слышит ровно это. Ваш голос с микрофона записывается напрямую и такого пути не проходит, поэтому ваши реплики обычно расшифровываются чище.

Попап Sonaro перед записью: полосы уровня «Собеседник» и «Мой микрофон», переключатели кадров и плашки, кнопка «Начать запись»
До записи видны обе будущие дорожки: полоса «Собеседник» движется, когда во вкладке звучит встреча.

Как это устроено у записи созвона в Sonaro

Пока идёт созвон, расширение пишет две дорожки: звук вкладки со встречей и ваш микрофон. Как пишется звук вкладки, на странице запись вкладки браузера со звуком. После нажатия «Обработать» в кабинете каждая дорожка проходит шаги по очереди.

  1. Громкость. Сервис выравнивает громкость дорожки по всей записи и сводит её в один канал. Длина звука при этом не меняется ни на сэмпл, поэтому время реплик совпадает со временем записи.
  2. Куски. Длинную дорожку модель слушает кусками по три минуты.
  3. Реплики. Модель расшифровки речи настроена на русский язык. Она ставит знаки препинания и делит речь по паузам длиннее 0,8 секунды. Числа остаются словами, как их произнесли: перевод в цифры мы выключили, потому что он склеивал «с девяти до шести» в одно число.
  4. Провалы. Если внутри разговора между репликами тишина дольше полутора секунд, это место у модели спрашивают второй раз. Если и во второй раз пусто, место помечается как провал расшифровки: слова там, скорее всего, были, и звук можно послушать.
  5. Склейка. Модель отдаёт речь кусками по три-четыре секунды, и одна мысль приходит несколькими обрывками. Сервис склеивает подряд идущие куски одного говорящего, если пауза между ними до пяти секунд. Короткие поддакивания собеседника выносятся вбок, чтобы они не рвали чужую фразу пополам.
  6. Кадры. К реплике привязывается кадр экрана: снятый до неё, во время неё или сразу после.

Каждая дорожка проходит шаги отдельно, поэтому шумный микрофон не портит расшифровку собеседника, и наоборот.

Роли реплик берутся из дорожек: разметку по голосу мы не используем, и почему, объяснено на странице что такое диаризация. Метки времени у каждой реплики описаны на странице что такое таймкод. Два часа встречи обрабатываются около пяти минут.

Как найти и проверить ошибку

В любой автоматической расшифровке встречаются неверные слова: чаще всего фамилии, термины, числа и места, где говорили разом. В ленте Sonaro проверка короткая. Нажмите на сомнительную реплику, и звук встанет на её секунду: имя или цифру вы услышите сами. Если термин встречается часто, найдите его поиском по словам, счётчик покажет, сколько раз он прозвучал. Если модель раз за разом пишет фамилию одинаково неверно, поиск найдёт все такие места по неверному написанию. Если слово записано иначе, ищите по его началу: поиск находит введённые буквы внутри слов.

Кабинет Sonaro, раздел «Расшифровка»: поле поиска над лентой реплик с временами, справа кадр экрана с таблицей «Сроки по городам» на 00:24
Лента после всех шагов: реплики с временем, ролью и кадром, поиск по словам сверху.

Как подготовить созвон к хорошей расшифровке

Качество текста закладывается до встречи. После записи шум и эхо из звука уже не убрать.

Что получится и чего не будет

Пишется звук вкладки

Расшифровывается звук вкладки со встречей и ваш микрофон, каждая дорожка отдельно.

Встречу открывают в браузере

Шаги выше проходит запись созвона, открытого по ссылке в браузере.

Запись начинается по вашему нажатию

Расшифровка начинается с той секунды, когда вы нажали «Начать запись».

Текст с кадров не читается

Слова на слайдах в текст не попадают: расшифровка работает только со звуком.

Соседняя вкладка в запись не попадёт

Звук второй вкладки не смешается с речью встречи и не испортит текст.

Когда Sonaro не нужен

Если нужны субтитры прямо во время созвона, это другая задача: Sonaro расшифровывает запись после встречи. Если запись уже лежит файлом, её расшифрует файловый сервис, в кабинет готовые файлы не загружаются. Если встреча идёт на английском, выбирайте сервис с этим языком: наша расшифровка настроена на русский. Сравнение с сервисом, который работает с английскими встречами, на странице альтернатива Otter.ai. Если нужен дословный текст для публикации без единой ошибки, после любой модели закладывайте вычитку человеком.

Вопросы

Сколько времени занимает расшифровка часа записи?

У автоматических сервисов минуты. В Sonaro два часа встречи обрабатываются около пяти минут после нажатия «Обработать».

Почему модель ошибается в фамилиях и терминах?

Редкое слово она пишет так, как его услышала, по похожему звучанию. Такие места проверяют по звуку: в ленте нажатие реплики ставит звук на её секунду.

На каком языке расшифровывает Sonaro?

Расшифровка настроена на русскую речь. Встречу на другом языке она переведёт в текст с ошибками.

Зачем записывать мой микрофон отдельно?

Две дорожки дают роль каждой реплике без угадывания по голосу. Если вы и собеседник говорили разом, каждая фраза остаётся в своей дорожке.

Можно ли улучшить расшифровку уже после записи?

Громкость сервис выравнивает сам. Шум, эхо и провалы связи из записи уже не убрать, поэтому качество закладывается до встречи: наушники, микрофон ближе ко рту, речь по очереди.

Что дальше

Как получить такую ленту для своей встречи с любой площадки, описано на странице расшифровка встречи. Если нужен текст конкретного созвона без файла и без бота, загляните на страницу перевести звонок в текст.