Галлюцинации в ASR-системах (Automatic Speech Recognition) приводят к росту Word Error Rate (WER) на 5–15% даже при чистом сигнале, превращая фактические ошибки в смысловые искажения. В отличие от LLM, где галлюцинации — это творчество, в транскрибации это критический сбой декодера, который «додумывает» слова на основе вероятностей языковой модели, игнорируя акустический сигнал.
Природа галлюцинаций: конфликт акустики и языка
Галлюцинации возникают в точке пересечения акустической модели (что слышим) и языковой модели (что ожидаем услышать). Когда уверенность акустического сигнала падает ниже 40-50% (из-за шумов или дефектов речи), доминирует языковая модель. В итоге ИИ вставляет устойчивые словосочетания или логически подходящие фразы, которых не было в аудио. Это особенно заметно в моделях типа OpenAI Whisper, которые склонны «зацикливать» фразы или дописывать вежливые формулы в тишине.
Пример: в записи интервью с помехами фраза «нам нужное решение» может превратиться в «нам нужно принять решение», так как вероятность второй конструкции в корпусе текстов в разы выше. Экспертный вывод: чрезмерное доверие языковой модели (Language Model Weight) — главный источник ложной генерации.
Температурный контроль и Beam Search
Основной рычаг борьбы с галлюцинациями — настройка параметра Temperature и алгоритма Beam Search. При Temp = 0 модель выбирает самый вероятный токен, что минимизирует бред, но может привести к зацикливанию. Повышение температуры до 0.2–0.4 добавляет вариативности, но резко увеличивает риск появления лишних слов. Оптимальный диапазон для бизнес-транскрибации — от 0 до 0.1.
Beam Search (поиск по лучу) с шириной луча (beam size) 5–10 позволяет модели рассматривать несколько путей декодирования. Увеличение ширины луча до 20+ не дает линейного прироста качества, но увеличивает вычислительную нагрузку на 30–50%, при этом риск галлюцинаций в длинных паузах сохраняется. Экспертный вывод: для минимизации ложного текста используйте Temp = 0 и Beam Size в пределах 5–8.
Подавление галлюцинаций через VAD и шумоподавление
Галлюцинации чаще всего возникают в периоды тишины или фонового шума, когда модель пытается «найти» речь там, где её нет. Внедрение жесткого VAD (Voice Activity Detection) позволяет отсекать сегменты тишины до подачи в нейросеть. Это снижает количество «фантомных» слов на 80-90% в записях с длинными паузами. Однако агрессивный VAD может обрезать начало и конец фраз, что увеличивает MER.
Кейс: при обработке звонков в колл-центре с уровнем шума -30 дБ без VAD модель генерировала случайные слова («спасибо», «да») каждые 10 секунд тишины. Применение предварительного шумоподавления и VAD полностью устранило этот эффект. Экспертный вывод: борьба с галлюцинациями начинается не с настроек ИИ, а с сравнение стратегий обработки аудио с низким соотношением сигнал/шум в ИИ-транскрибации.
Контекстное ограничение и Prompt-инжиниринг
Для моделей, поддерживающих промпты (как Whisper), подача начального контекста или списка терминов (Glossary) снижает вероятность галлюцинаций в узкоспециализированных терминах. Если модель не знает слова «дериватив», она заменит его на похожее по звуку обычное слово. Подача 10-20 ключевых слов в промпт снижает частоту таких замен на 15-20%.
Важный нюанс: слишком длинный промпт может спровоцировать модель «галлюцинировать» словами из самого промпта, даже если их нет в аудио. Оптимальный объем контекста — до 200 символов. Экспертный вывод: используйте промпты только для фиксации терминологии, а не для описания содержания беседы, чтобы избежать навязывания смыслов.
Пост-процессинг и верификация уверенности (Confidence Score)
Профессиональный подход подразумевает анализ Confidence Score для каждого токена. Если уверенность модели в слове падает ниже 60%, такой сегмент должен помечаться как «сомнительный» или удаляться. Это позволяет перевести галлюцинацию из категории «скрытой ошибки» в категорию «пропуска», что гораздо безопаснее для юридических или медицинских документов.
Сравнение: автоматическая замена низкоуверенных слов на [неразборчиво] увеличивает прозрачность текста, хотя и формально повышает WER. Однако это единственный способ гарантировать отсутствие ложной информации. Экспертный вывод: для критически важных данных необходимо внедрять порог Confidence Score ≥ 0.7, жертвуя полнотой ради достоверности.
Вывод
Для полного подавления галлюцинаций в ИИ-транскрибации следует использовать связку: VAD → Noise Suppression → Temp=0 → Confidence Filtering. Избегайте высоких значений температуры и чрезмерно длинных промптов. Начинать оптимизацию нужно с настройки VAD и анализа метрик, таких как транскрибация аудио в текст с помощью ИИ: комплексный анализ метрик оценки качества и критериев точности (WER, MER, CER), так как только количественный замер позволит понять, где заканчивается коррекция и начинается галлюцинация.
Ещё один раздел с материалами — Развитие мягких навыков.
