Средний показатель WER (Word Error Rate) у топовых моделей вроде OpenAI Whisper в идеальных условиях составляет 4-7%, однако при наличии шумов или специфической терминологии доля фактических ошибок и галлюцинаций может вырасти до 15-20%. В профессиональной транскрибации цена одной «выдуманной» фразы в юридическом или медицинском протоколе может стоить всей ценности документа.
Природа галлюцинаций в ASR-моделях
Галлюцинации в автоматическом распознавании речи (ASR) — это не случайные опечатки, а попытка нейросети «достроить» смысл там, где сигнал слишком слаб или неоднозначен. В моделях архитектуры Transformer, таких как Whisper, это часто проявляется в виде повторения одной и той же фразы по кругу или вставки стандартных вежливых фраз («Спасибо за просмотр», «Подпишитесь на канал»), которые модель выучила из обучающего датасета из YouTube-роликов.
На практике это приводит к тому, что при возникновении сильной реверберации модель вместо пропуска слова генерирует правдоподобную, но несуществующую фразу. Анализ влияния акустической среды на точность ИИ-транскрибации показывает, что в помещениях с RT60 (временем реверберации) более 0.6 секунды вероятность таких ошибок возрастает в 2-3 раза.
Экспертный вывод: Галлюцинации — это побочный эффект высокой языковой вероятности модели. Чем «умнее» языковая модель внутри ASR, тем увереннее она может ошибиться, заменив реальный шум на логичное по смыслу, но ложное слово.
Метод Prompting для снижения ошибок
Многие пользователи игнорируют поле Prompt в API современных моделей, считая его инструментом для задания стиля. На самом деле, передача списка ключевых слов, имен и терминов (в пределах 200-300 символов) снижает вероятность ошибок в именах собственных на 30-40%. Если в аудио звучит «Крипто-индекс», а в промпте указано «блокчейн, стейкинг, ликвидность», модель с гораздо большей вероятностью распознает термин верно, а не заменит его на созвучное бытовое слово.
Кейс: при расшифровке интервью с инженером-акустиком без промпта слово «дифракция» было заменено на «дирекция» в 12% случаев. После добавления технического глоссария в промпт количество ошибок в этом термине упало до 2%.
Экспертный вывод: Промптинг — это самый дешевый и быстрый способ борьбы с галлюцинациями. Без контекстного словаря любая модель работает вслепую, опираясь на общие статистические вероятности языка.
Температура генерации и пороги уверенности
Ключевой параметр для минимизации галлюцинаций — Temperature (температура). Значение 0 (greedy decoding) заставляет модель выбирать самый вероятный токен, что минимизирует «творчество» ИИ. Повышение температуры до 0.4-0.6 может помочь при очень неразборчивой речи, но резко увеличивает риск появления выдуманных слов. Для бизнес-записей рекомендую строго держать Temperature на уровне 0 или 0.2.
Также критически важно отслеживать Log-Probability (вероятность токена). Если уверенность модели в слове падает ниже 60-70%, этот участок текста должен автоматически помечаться тегом [?] для ручной проверки. Это сокращает время корректуры в 4-5 раз, так как редактор не читает весь текст, а идет по маркерам низкой уверенности.
Экспертный вывод: Для достоверности выбирайте детерминированный подход (Temp=0). Любая попытка «разговорить» модель через повышение температуры в рабочих документах ведет к росту фактических ошибок.
Борьба с зацикливанием и перебиваниями
Одной из самых раздражающих галлюцинаций является «петля» (looping), когда модель повторяет одну фразу 5-10 раз. Это часто происходит в моменты тишины или фонового шума. Решением является настройка VAD (Voice Activity Detection) с жестким порогом отсечения тишины (например, 500мс). Если VAD работает некорректно, модель пытается «услышать» речь в шуме и начинает галлюцинировать.
Ситуация осложняется, когда в записи присутствуют перебивания. Сравнение стратегий обработки перебиваний и одновременной речи в ИИ-транскрибации показывает, что попытка одной модели расшифровать двух говорящих одновременно часто ведет к «смешиванию» слов в одну бессмысленную фразу. Оптимальный путь — предварительное разделение дорожек или использование моделей с поддержкой многоканального ввода.
Экспертный вывод: Борьба с галлюцинациями начинается до этапа распознавания. Качественный VAD-фильтр и предварительное разделение голосов убирают до 80% причин возникновения зацикливаний.
Верификация через LLM-постпроцессинг
Современный стек включает этап «очистки» текста с помощью GPT-4o или Claude 3.5. Однако здесь кроется ловушка: LLM может заменить фактическую ошибку ASR на еще более правдоподобную, но ложную галлюцинацию. Чтобы этого избежать, в промпт для LLM нужно добавить жесткую инструкцию: «Исправляй только грамматику и пунктуацию, не меняй термины и цифры, если не уверен в них на 100%».
Пример: ASR выдал «цена 15 тысяч», а LLM, решив, что это слишком дешево для данного контекста, исправила на «150 тысяч». В итоге фактическая ошибка стала критической. Рекомендуемый метод — использование LLM только для расстановки знаков препинания и удаления слов-паразитов без изменения семантики.
Экспертный вывод: Никогда не доверяйте LLM фактическую правку транскрипта без строгого запрета на изменение цифр и имен. Постпроцессинг должен быть косметическим, а не смысловым.
Вывод
Для достижения максимальной достоверности транскрибации следует использовать связку: Whisper (Large-v3) с Temperature=0 → VAD-фильтрация → детальный Prompt с глоссарием → ручная проверка участков с низкой Log-Prob. Избегайте автоматического «улучшения» текста через LLM без жестких ограничений по смыслу. Начинайте с настройки VAD и промптов — это дает 70% прироста качества без затрат на дорогостоящий ручной труд.
