Digital Core

Словарь

Что такое транскрибация: из голоса в текст

Что такое транскрибация: это перевод аудио или видео в текст, сегодня его почти всегда делает ИИ. Разбираем, как работает распознавание речи, на чем оно спотыкается в звонках с отраслевыми терминами и что сделать с записью, чтобы расшифровка была точнее. Пригодится, если хотите слышать звонки менеджеров, но не успеваете их переслушивать.

Обновлено 29.09.2026

Коротко

  • Транскрибация, speech to text и распознавание речи - это одно и то же: звук превращается в текст.
  • Хорошая расшифровка звонка - это текст с таймкодами и разделением на менеджера и клиента.
  • Чаще всего ошибки в терминах, артикулах, числах и фамилиях, а не в обычной речи.
  • Качество больше всего зависит от записи: раздельные каналы, без громкой связи, без сильного сжатия.
  • Выбор движка, например Whisper или Yandex SpeechKit, лучше делать на ваших записях, а не по чужим тестам.

Транскрибация простыми словами

Транскрибация - это превращение речи в текст. Раньше расшифровкой интервью и совещаний занимались люди вручную. Сейчас это делает модель распознавания речи, и обычно быстрее, чем длится сама запись.

Английский термин - speech to text, сокращенно STT. Еще говорят ASR, автоматическое распознавание речи. Все это одно явление.

Чем транскрибация отличается от смежных понятий

  • Транскрипция - запись произношения значками в лингвистике. К бизнесу отношения не имеет, хотя слова часто путают.
  • Речевая аналитика - следующий шаг после транскрибации: ИИ читает расшифровку и оценивает звонок по критериям. Об этом - на странице аналитики звонков.
  • Протокол встречи - выжимка из расшифровки: решения, задачи, сроки.

Как работает распознавание речи

  1. Подготовка звука. Запись приводится к нужному формату, отсекаются паузы и тишина.
  2. Распознавание. Нейросеть переводит звук в слова и расставляет таймкоды.
  3. Разделение спикеров. Система определяет, где говорит менеджер, а где клиент. Проще всего, если они записаны в разных каналах.
  4. Нормализация. «Двенадцать тысяч пятьсот» превращается в 12 500, расставляется пунктуация.
  5. Постобработка. Иногда текст дополнительно правит языковая модель по словарю терминов компании.

Где распознавание ошибается: звонок с отраслевыми терминами

На бытовой речи современные модели ошибаются редко. Проблемы начинаются там, где у бизнеса свой язык. Возьмем звонок в компанию, которая торгует кровельными материалами. Клиент говорит:

Мне профлист эс двадцать один, оцинковка ноль пять, двенадцать листов по шесть метров. И доборку: конек и ендову. Счет на ИП Сафронова, доставка на Новорижку.

Вот какие ошибки типичны для таких фраз без настройки. Варианты в таблице - иллюстрация, конкретный движок ошибется по-своему.

СказаноТипичная ошибкаПочемуКак исправить
«профлист эс двадцать один»«проф лист с 21» или «профлист С-21-й»Марка произносится буквами и цифрамиСловарь марок и постобработка по каталогу
«оцинковка ноль пять»«оцинковка 0 5» без связи с толщинойМодель не знает, что это 0,5 ммПравило нормализации для толщин
«доборку: конек и ендову»«до борку», «в ендову», «и в Нову»Редкие профессиональные словаСловарь терминов или подсказки модели
«ИП Сафронова»«Сафонова», «Софронова»Фамилии звучат похожеСверка с базой клиентов в CRM
«на Новорижку»Распознается верно, но это разговорное название трассыМодель пишет, как слышитНе критично для оценки, важно для адреса

Для оценки работы менеджера такие ошибки почти не мешают: смысл разговора понятен. Для автоматического создания заказа из звонка они критичны. Поэтому сначала решите, зачем нужна расшифровка.

Whisper или Yandex SpeechKit

Это два популярных варианта. Whisper - открытая модель OpenAI, которую можно развернуть на своем сервере. Yandex SpeechKit - облачный сервис Yandex Cloud с моделями для телефонного звука.

WhisperYandex SpeechKit
Где работаетНа вашем сервере, данные не уходят наружуВ облаке Yandex Cloud
Что нужноСервер, для скорости желательна видеокартаАккаунт и API-ключ
ОплатаСервер и его обслуживаниеПо тарифу поставщика за минуты
Распознавание на летуИзначально рассчитан на готовые файлыЕсть потоковый режим
ТерминыПодсказки в запросе, постобработкаНастройки распознавания, постобработка

Какой точнее на ваших звонках, покажет только тест на 20-30 реальных записях с вашими терминами. Чужие сравнения сделаны на другом звуке и другой лексике.

Как записывать звонки, чтобы расшифровка была точнее

  • Раздельные каналы. Менеджер в одном канале, клиент в другом. Это решает проблему «кто что сказал» лучше любой модели.
  • Без громкой связи. Звук из динамика с эхом комнаты распознается заметно хуже.
  • Гарнитура вместо телефона на столе. Микрофон у рта снимает шум офиса.
  • Формат без сильного сжатия. Если телефония позволяет, выбирайте качество выше минимального.
  • Запись целиком. Начало разговора, где клиент называет имя и задачу, часто самое ценное.
  • Метаданные. Имя менеджера, номер клиента и дата должны быть рядом с файлом, иначе расшифровку не к чему привязать.

Транскрибация звонков: как сделать в своей компании

Шаг 1. Получить записи

Записи берутся из телефонии или CRM: Mango Office, Битрикс24, amoCRM. В Asterisk звонки обычно пишутся в файлы на сервере, их можно забирать после завершения разговора. Распознавание прямо во время звонка - отдельная задача, возможность подключения проверяем до старта.

Шаг 2. Собрать словарь

Марки, артикулы, названия услуг, фамилии частых клиентов. Даже 50-100 терминов заметно снижают число ошибок в важных местах.

Шаг 3. Прогнать тест

20-30 записей разного качества через выбранный движок. Сравнить с ручной расшифровкой ключевых фраз.

Шаг 4. Решить, куда идет текст

В карточку сделки, в отчет руководителю или в оценку по скрипту. Примеры связок - на страницах аналитики звонков Mango Office и речевой аналитики в Битрикс24.

Вопросы

Частые вопросы

Что такое speech to text?

Это английское название транскрибации: перевод речи в текст. Сокращенно STT, иногда ASR - автоматическое распознавание речи.

Транскрибация звонков: как сделать?

Нужно получить записи из телефонии или CRM, выбрать движок распознавания, добавить словарь терминов и решить, куда складывать текст. Для оценки движка хватит 20-30 реальных звонков.

Что выбрать: Whisper или Yandex SpeechKit?

Whisper разворачивается на своем сервере, и записи не уходят наружу. SpeechKit работает в облаке, умеет распознавать на лету и оплачивается по минутам. Точность сравнивайте на своих записях.

Можно ли настроить распознавание речи для Asterisk?

Да, чаще всего записи забирают с сервера после звонка и отправляют на распознавание. Распознавание в реальном времени сложнее, его возможность проверяем до старта.

Можно ли расшифровать запись плохого качества?

Частично. Модель распознает то, что слышно, но в шумных местах будут пропуски и ошибки. Поэтому качество записи лучше наладить до запуска аналитики.

Покажем на
вашей задаче

Оставьте заявку - свяжемся в рабочее время и бесплатно покажем, как это будет работать у вас.

+7 912 587-60-85info@digital-core.ru

Или напишите в Telegram · +7 912 587-60-85

Позвонить