Галлюцинации в ASR-системах (Automatic Speech Recognition) приводят к ошибке Word Error Rate (WER) в 15-30% даже на чистых записях, если модель входит в цикл повторений или генерирует несуществующие слова. Борьба с этим феноменом сместилась из области обучения весов в область пост-процессинга и управления декодированием, где правильный выбор алгоритма фильтрации сокращает время ручной правки текста на 40-60%.
Механика циклического повторения в Transformer-моделях
Галлюцинации в виде «зацикливания» (например, когда фраза «я считаю, что я считаю, что» повторяется 10 раз) возникают из-за перевзвешивания токенов в механизме внимания (Attention). В моделях типа OpenAI Whisper это часто случается при низком соотношении сигнал/шум (SNR), когда модель теряет контекст и начинает предсказывать следующий токен на основе только что сгенерированного, создавая бесконечный цикл. На практике в записях с SNR ниже 15 дБ частота таких ошибок возрастает в 3-4 раза.
Для борьбы с этим применяется Repetition Penalty — штраф за повторение токенов в окне от 10 до 50 слов. Установка коэффициента штрафа на уровне 1.1–1.2 позволяет купировать до 80% явных циклов без потери смысла, но избыточный штраф (>1.5) начинает «резать» легитимные повторы в речи, что недопустимо для стенограмм судебных заседаний или интервью.
Экспертный вывод: Борьба с циклами на уровне декодера эффективнее, чем попытки вырезать их регулярными выражениями после генерации, так как модель может менять окончания слов в цикле, обходя простые фильтры.
Алгоритмы фильтрации ложных слов и артефактов
Ложные слова (галлюцинации-вставки) часто возникают в паузах или при фоновом шуме, когда модель пытается «додумать» звук до осмысленного слова. Здесь критически важен анализ Confidence Score (уровня уверенности) для каждого токена. Если уверенность модели падает ниже 0.4–0.5, вероятность галлюцинации возрастает до 70%. Практический подход заключается в сопоставлении временных меток (timestamps) с амплитудой сигнала: если слово сгенерировано на участке с энергией ниже -40 дБ, оно с вероятностью 90% является ложным.
Пример из кейса: при обработке 100 часов интервью с сильным фоновым шумом, внедрение фильтра по порогу уверенности (Confidence Threshold) в сочетании с анализом VAD (Voice Activity Detection) позволило снизить количество «фантомных» фраз на 25%, сократив общее количество слов в итоговом документе без потери смысла.
Экспертный вывод: Никогда не доверяйте тексту без привязки к Confidence Score и VAD; любой текст, сгенерированный в «тишине», должен автоматически помечаться как сомнительный или удаляться.
Сравнение методов пост-процессинга: LLM против Регулярок
Традиционные методы очистки (RegEx) справляются только с идентичными повторами, но бессильны перед семантическими галлюцинациями. Использование LLM (GPT-4o, Claude 3.5) в качестве «корректора» позволяет устранять логические несостыковки. Сравнение эффективности: RegEx убирает до 10% ошибок, LLM-фильтрация — до 45% за счет анализа контекста. Однако стоимость обработки через LLM составляет от $0.01 до $0.05 за минуту аудио, что делает метод дорогим для больших архивов.
Оптимальная схема: сначала применение легкого алгоритма фильтрации по Confidence Score, затем — прогон через специализированную модель-корректор с узким промптом на поиск тавтологий. Это снижает затраты на токены в 3-5 раз по сравнению с полной переделкой текста.
Экспертный вывод: Для бизнес-задач с бюджетом до $100/час транскрибации оправдано использование гибридной схемы: VAD → Confidence Filter → LLM-корректор.
Влияние SNR на частоту галлюцинаций
Существует прямая корреляция между качеством сигнала и стабильностью нейросети. Анализ точности ИИ-транскрибации при работе с низкокачественными записями показывает, что при падении SNR ниже 10 дБ количество галлюцинаций растет экспоненциально. В таких условиях модель начинает «достраивать» фразы, опираясь на свои внутренние веса (предпочтения в языке), а не на аудиосигнал. Это приводит к тому, что в текст вставляются стандартные клише, которых не было в речи.
Чтобы минимизировать этот эффект, необходимо использовать предварительную очистку сигнала (Denoising) с помощью моделей типа Demucs или DeepFilterNet. Опыт показывает, что предварительный денойзинг поднимает SNR на 5-12 дБ, что снижает частоту галлюцинаций на 30-40% еще до этапа транскрибации.
Экспертный вывод: Инвестировать в пре-процессинг аудио (очистку от шума) выгоднее, чем пытаться исправить галлюцинации на этапе текста, так как чистый сигнал — единственный способ остановить модель от «фантазирования».
Вывод
Для достижения промышленного качества транскрибации следует отказаться от стратегии «загрузил и получил текст». Оптимальный стек: пре-процессинг через DeepFilterNet → Whisper с настроенным Repetition Penalty (1.2) → фильтрация по Confidence Score (<0.5) → финальная чистка через LLM. Избегайте использования моделей без доступа к таймстемпам и уровням уверенности, так как это делает борьбу с галлюцинациями слепой. Начинайте с внедрения VAD-фильтрации — это самый дешевый способ убрать до 20% мусора из текста без затрат на дорогие API.
