Словарь
Что такое транскрибация: из голоса в текст
Что такое транскрибация: это перевод аудио или видео в текст, сегодня его почти всегда делает ИИ. Разбираем, как работает распознавание речи, на чем оно спотыкается в звонках с отраслевыми терминами и что сделать с записью, чтобы расшифровка была точнее. Пригодится, если хотите слышать звонки менеджеров, но не успеваете их переслушивать.
Обновлено 29.09.2026
Коротко
- Транскрибация, speech to text и распознавание речи - это одно и то же: звук превращается в текст.
- Хорошая расшифровка звонка - это текст с таймкодами и разделением на менеджера и клиента.
- Чаще всего ошибки в терминах, артикулах, числах и фамилиях, а не в обычной речи.
- Качество больше всего зависит от записи: раздельные каналы, без громкой связи, без сильного сжатия.
- Выбор движка, например Whisper или Yandex SpeechKit, лучше делать на ваших записях, а не по чужим тестам.
Транскрибация простыми словами
Транскрибация - это превращение речи в текст. Раньше расшифровкой интервью и совещаний занимались люди вручную. Сейчас это делает модель распознавания речи, и обычно быстрее, чем длится сама запись.
Английский термин - speech to text, сокращенно STT. Еще говорят ASR, автоматическое распознавание речи. Все это одно явление.
Чем транскрибация отличается от смежных понятий
- Транскрипция - запись произношения значками в лингвистике. К бизнесу отношения не имеет, хотя слова часто путают.
- Речевая аналитика - следующий шаг после транскрибации: ИИ читает расшифровку и оценивает звонок по критериям. Об этом - на странице аналитики звонков.
- Протокол встречи - выжимка из расшифровки: решения, задачи, сроки.
Как работает распознавание речи
- Подготовка звука. Запись приводится к нужному формату, отсекаются паузы и тишина.
- Распознавание. Нейросеть переводит звук в слова и расставляет таймкоды.
- Разделение спикеров. Система определяет, где говорит менеджер, а где клиент. Проще всего, если они записаны в разных каналах.
- Нормализация. «Двенадцать тысяч пятьсот» превращается в 12 500, расставляется пунктуация.
- Постобработка. Иногда текст дополнительно правит языковая модель по словарю терминов компании.
Где распознавание ошибается: звонок с отраслевыми терминами
На бытовой речи современные модели ошибаются редко. Проблемы начинаются там, где у бизнеса свой язык. Возьмем звонок в компанию, которая торгует кровельными материалами. Клиент говорит:
Мне профлист эс двадцать один, оцинковка ноль пять, двенадцать листов по шесть метров. И доборку: конек и ендову. Счет на ИП Сафронова, доставка на Новорижку.
Вот какие ошибки типичны для таких фраз без настройки. Варианты в таблице - иллюстрация, конкретный движок ошибется по-своему.
| Сказано | Типичная ошибка | Почему | Как исправить |
|---|---|---|---|
| «профлист эс двадцать один» | «проф лист с 21» или «профлист С-21-й» | Марка произносится буквами и цифрами | Словарь марок и постобработка по каталогу |
| «оцинковка ноль пять» | «оцинковка 0 5» без связи с толщиной | Модель не знает, что это 0,5 мм | Правило нормализации для толщин |
| «доборку: конек и ендову» | «до борку», «в ендову», «и в Нову» | Редкие профессиональные слова | Словарь терминов или подсказки модели |
| «ИП Сафронова» | «Сафонова», «Софронова» | Фамилии звучат похоже | Сверка с базой клиентов в CRM |
| «на Новорижку» | Распознается верно, но это разговорное название трассы | Модель пишет, как слышит | Не критично для оценки, важно для адреса |
Для оценки работы менеджера такие ошибки почти не мешают: смысл разговора понятен. Для автоматического создания заказа из звонка они критичны. Поэтому сначала решите, зачем нужна расшифровка.
Whisper или Yandex SpeechKit
Это два популярных варианта. Whisper - открытая модель OpenAI, которую можно развернуть на своем сервере. Yandex SpeechKit - облачный сервис Yandex Cloud с моделями для телефонного звука.
| Whisper | Yandex SpeechKit | |
|---|---|---|
| Где работает | На вашем сервере, данные не уходят наружу | В облаке Yandex Cloud |
| Что нужно | Сервер, для скорости желательна видеокарта | Аккаунт и API-ключ |
| Оплата | Сервер и его обслуживание | По тарифу поставщика за минуты |
| Распознавание на лету | Изначально рассчитан на готовые файлы | Есть потоковый режим |
| Термины | Подсказки в запросе, постобработка | Настройки распознавания, постобработка |
Какой точнее на ваших звонках, покажет только тест на 20-30 реальных записях с вашими терминами. Чужие сравнения сделаны на другом звуке и другой лексике.
Как записывать звонки, чтобы расшифровка была точнее
- Раздельные каналы. Менеджер в одном канале, клиент в другом. Это решает проблему «кто что сказал» лучше любой модели.
- Без громкой связи. Звук из динамика с эхом комнаты распознается заметно хуже.
- Гарнитура вместо телефона на столе. Микрофон у рта снимает шум офиса.
- Формат без сильного сжатия. Если телефония позволяет, выбирайте качество выше минимального.
- Запись целиком. Начало разговора, где клиент называет имя и задачу, часто самое ценное.
- Метаданные. Имя менеджера, номер клиента и дата должны быть рядом с файлом, иначе расшифровку не к чему привязать.
Транскрибация звонков: как сделать в своей компании
Шаг 1. Получить записи
Записи берутся из телефонии или CRM: Mango Office, Битрикс24, amoCRM. В Asterisk звонки обычно пишутся в файлы на сервере, их можно забирать после завершения разговора. Распознавание прямо во время звонка - отдельная задача, возможность подключения проверяем до старта.
Шаг 2. Собрать словарь
Марки, артикулы, названия услуг, фамилии частых клиентов. Даже 50-100 терминов заметно снижают число ошибок в важных местах.
Шаг 3. Прогнать тест
20-30 записей разного качества через выбранный движок. Сравнить с ручной расшифровкой ключевых фраз.
Шаг 4. Решить, куда идет текст
В карточку сделки, в отчет руководителю или в оценку по скрипту. Примеры связок - на страницах аналитики звонков Mango Office и речевой аналитики в Битрикс24.
