Флюгегенхаймен
Как работает Интеграции Тарифы FAQ Блог

Речевая аналитика звонков: как она устроена внутри

Снаружи речевая аналитика звонков выглядит как магия: разговор состоялся утром, к обеду в таблице стоит балл, а рядом цитата с минутой и секундой. Внутри никакой магии нет, есть четыре шага, каждый со своими ограничениями. Разберём их по порядку — в том числе для того, чтобы понять, где система ошибается и чего от неё ждать не стоит.

Кратко
  • Путь звонка состоит из четырёх шагов: распознавание речи, разделение реплик по говорящим, проверка текста по критериям, сборка отчёта.
  • Самый хрупкий шаг — первый. Качество распознавания задаёт потолок для всего остального, а зависит оно от записи: канала, шума и того, перебивают ли собеседники друг друга.
  • Оценку определяет ваш чек-лист, переписанный так, чтобы каждый пункт подтверждался конкретной фразой из расшифровки.
  • Система уверенно ловит то, что прозвучало вслух. Интонацию, контекст сделки и причины за пределами разговора она не видит — это остаётся человеку.

Путь звонка за четыре шага

Речевая аналитика звонков — это разбор телефонных разговоров по заранее описанным правилам без участия человека. Общее определение и задачи, которые она закрывает, разобраны в материале о том, что такое речевая аналитика. Здесь интересует другое: что физически происходит с записью между моментом, когда менеджер положил трубку, и моментом, когда в отчёте появилась строка.

Шагов четыре, и они идут строго по очереди. Ошибка на раннем шаге дальше не чинится, поэтому порядок стоит держать в голове целиком.

1
Распознавание
Аудиофайл превращается в сплошной текст разговора.
2
Разделение реплик
Текст разбирается на реплики: где говорит клиент, где менеджер.
3
Проверка по критериям
По размеченному тексту проходят пункты вашего чек-листа.
4
Отчёт
Балл, отметки о нарушениях и цитаты собираются в таблицу.

Дальше по каждому шагу отдельно. Практические ограничения живут внутри шагов, и в общей схеме их не видно.

Шаг 1. Из звука в текст

Первое, что происходит с записью, — распознавание речи. Модель получает аудио и возвращает текст, а вместе с ним тайминги: на какой секунде прозвучало каждое слово. Эти тайминги потом и превращаются в ссылку «послушать с 2:14», без них разбор снова упирается в память участников.

Качество этого шага задаёт потолок для всех остальных. Если «мы не готовы платить вперёд» превратилось в «мы готовы платить вперёд», ни одна последующая проверка этого уже не исправит: потерянная частица переворачивает смысл, а в тексте выглядит нормальной фразой. Поэтому на качество записи стоит смотреть до того, как выбирать систему разбора.

Что влияет Почему Что с этим делать
Запись в два канала Менеджер и клиент пишутся отдельными дорожками, и границы реплик известны заранее Проверить в настройках телефонии: почти везде это переключатель
Наложение речи Когда собеседники говорят одновременно, часть слов теряется у обоих Помогает привычка менеджеров дослушивать до конца
Фоновый шум Открытый офис, улица и гарнитура за триста рублей съедают окончания слов Гарнитура с шумоподавлением закрывает большую часть проблемы
Термины и названия Артикулы, марки и фамилии модель слышит впервые и пишет на слух Словарь терминов, который передаётся системе до начала работы

Отдельно про термины. В нишах с собственным жаргоном именно этот пункт решает, будет разбор осмысленным или нет. Название линейки, которое менеджер произносит сорок раз за день, без словаря превращается в сорок разных написаний, и любой поиск по нему рассыпается.

Шаг 2. Кто говорит и где границы

Сплошной текст без разделения на говорящих для разбора почти бесполезен. Разница между «клиент сказал, что дорого» и «менеджер сказал, что дорого» решает всё, а в сплошной ленте слов её не видно. Задача разделения потока по говорящим называется диаризацией и состоит из двух частей: сначала находятся точки, где сменился голос, потом сегменты группируются по владельцам.

Когда телефония пишет разговор в два канала, эта работа уже сделана за нас: каждая дорожка принадлежит своему участнику по определению. В одноканальной записи говорящих приходится разделять по голосу, и тут появляются ошибки — особенно на коротких репликах вроде «угу» и «да-да». Общий смысл разговора от этого не страдает, а вот подсчёт того, кто сколько говорил, уже плывёт.

На этом же шаге текст получает структуру: реплики, тайминги, длительность пауз, доля времени каждого участника. Дальше по этой структуре и идёт проверка. Как выглядит готовая расшифровка с разделением реплик, показано на странице транскрибации звонков.

Пока в тексте не видно, чья это фраза, любой отчёт по нему сообщает среднюю температуру разговора.

Шаг 3. Оценка по критериям

Здесь начинается самая недооценённая часть. Кажется, что систему достаточно попросить «оцени звонок», и она справится. На практике так получается оценка, которую невозможно ни объяснить менеджеру, ни воспроизвести завтра.

Работает другой порядок. Сначала описывается, что для вашего бизнеса считается сильным разговором, и описывается в формулировках, допускающих ответ «да» или «нет»: спросил про сроки, назвал цену прямо, договорился о следующем шаге с датой. Потом эти пункты применяются к каждому размеченному тексту одинаково. Как собирается такой список и почему «установил контакт» проверить нельзя, разобрано в чек-листе оценки звонка.

Проверка идёт по слоям. Обязательные точки разговора дают балл. Красные флаги считаются отдельно, потому что обещание скидки, которой нет в прайсе, стоит денег независимо от того, какой процент набрал этот звонок. Поверх этого системы обычно умеют помечать темы: упоминание конкурента, вопрос про доставку, жалоба на прошлый заказ. На оценку темы не влияют, зато по ним потом удобно искать. У нас это надстройка сверх базовой оценки, её делают под задачу, а не включают всем по умолчанию.

Важная деталь: под каждым «нет» система обязана положить цитату. Оценка без подтверждающей фразы возвращает нас к спору «мне показалось», ради выхода из которого всё и затевалось.

Шаг 4. Что видит руководитель

Последний шаг — сборка. Балл по каждому модулю, отметки о нарушениях, цитаты с таймкодами и ссылка на запись складываются в строку, а строки — в таблицу по отделу. Результат обычно возвращается в карточку сделки в CRM, чтобы оценка лежала рядом с историей клиента. В отдельном кабинете её никто не откроет.

Отчёт читают сверху вниз, и первым делом смотрят на низкие баллы. Полезнее смотреть на повторы: один и тот же несданный пункт у разных менеджеров означает, что дело в скрипте или в продукте, и адресный разбор тут ничего не изменит.

Где здесь Флюгегенхаймен

Флюгегенхаймен закрывает все четыре шага и подключается к CRM и телефонии по API, так что выгружать записи руками не нужно. Критерии третьего шага команда собирает вместе с вами на ваших же разговорах, пока оценка системы не начнёт совпадать с вашей. Что происходит после подключения и как выглядит готовый отчёт — на странице как работает сервис, а разбор накопленного потока целиком — на странице аудита звонков.

Где система ошибается

Про это не пишут в презентациях, хотя знать это полезнее, чем список возможностей. Ограничения у речевой аналитики честные и предсказуемые.

  • Интонация. Раздражение, сарказм и усталость слышит человек, а текст расшифровки их не хранит. Фраза «ну отлично, спасибо большое» в тексте выглядит благодарностью в обоих смыслах.
  • Контекст за пределами звонка. Менеджер не назвал цену, потому что накануне отправил её письмом. В записи этого нет, и пункт закономерно уйдёт в минус.
  • Причины провала. Система показывает, что разговоры обрываются на вопросе о сроках. Почему сроки стали проблемой именно в этом квартале, знает коммерческий директор. В расшифровке этого нет.
  • Короткие и служебные разговоры. «Перезвоните позже» разбирать нечего, и в оценку такие звонки не идут. В среднем это каждый пятый разговор в потоке.

Отсюда практический вывод. Речевая аналитика надёжно отвечает на вопрос «что прозвучало в трубке», и отвечает по всему потоку сразу. Вопрос «почему так вышло» остаётся человеку, зато человек приходит к нему с фактами вместо ощущений.

Главное

  • Разбор звонка идёт четырьмя шагами по очереди: распознавание, разделение реплик, проверка по критериям, сборка отчёта.
  • Потолок качества задаёт первый шаг. Двухканальная запись, гарнитура с шумоподавлением и словарь терминов дают больше, чем выбор между похожими системами.
  • Разделение реплик по говорящим — обязательный шаг, без него непонятно, чья фраза попала в отчёт.
  • Оценку определяет ваш чек-лист, переписанный в проверяемые формулировки. Под каждым несданным пунктом стоит цитата с таймкодом.
  • Интонацию, контекст за пределами разговора и причины провала система не покажет. Это граница инструмента, и её стоит знать до внедрения.

FAQ

Как работает речевая аналитика звонков?
В четыре шага. Запись разговора распознаётся в текст с таймингами каждого слова. Текст разделяется на реплики по говорящим, чтобы было видно, где клиент, а где менеджер. По размеченному тексту проходят критерии из чек-листа компании: прозвучала ли цена, выяснен ли срок, есть ли договорённость о следующем шаге. Результат собирается в отчёт с баллом, отметками о нарушениях и цитатами, который обычно возвращается в карточку сделки в CRM.
Что такое диаризация и зачем она нужна?
Это разделение аудиозаписи на фрагменты по тому, кто в них говорит. Без неё расшифровка остаётся сплошной лентой слов, где непонятно, кто произнёс «это дорого» — клиент или менеджер. Если телефония пишет разговор в два отдельных канала, разделение получается точным само собой. В одноканальной записи говорящих определяют по голосу, и на коротких репликах возможны ошибки.
От чего зависит точность распознавания разговора?
От качества записи прежде всего. Помогают запись в два канала, гарнитура с шумоподавлением и словарь ваших терминов, артикулов и названий, переданный системе заранее. Мешают фоновый шум, плохой канал связи и моменты, когда собеседники говорят одновременно: там часть слов теряется у обоих. Ошибка распознавания не чинится на следующих шагах, поэтому запись важнее выбора между похожими системами.
Чем речевая аналитика отличается от транскрибации?
Транскрибация — это первые два шага: перевод записи в текст и разделение реплик. На выходе получается читаемая расшифровка разговора. Речевая аналитика добавляет к ней проверку по критериям и отчёт, то есть отвечает не только на вопрос «что было сказано», но и «насколько это соответствует вашим требованиям к разговору».
Может ли речевая аналитика определить настроение клиента?
Осторожно и не всегда. Текст расшифровки не хранит интонацию, поэтому сарказм и раздражение в нём выглядят обычными словами. Надёжно распознаются формулировки: прямая жалоба, отказ, упоминание конкурента, просьба больше не звонить. Оценивать эмоцию по голосу берутся не все системы, и строить на этом отчётность стоит только после проверки на собственных записях.
Нужно ли менять телефонию, чтобы подключить разбор звонков?
Обычно нет. Достаточно, чтобы у телефонии и CRM был API: записи забираются по нему автоматически, а результат разбора возвращается в карточку сделки. Полезно только заглянуть в настройки и проверить, включена ли запись в два канала: этот переключатель заметно поднимает качество расшифровки и ничего не стоит.