Сырой вывод ASR-модели (Automatic Speech Recognition) даже при WER ниже 10% остается непригодным для делового документооборота из-за отсутствия пунктуации и семантических разрывов. Синергия ASR и LLM позволяет сократить время ручной правки текста с 4–6 часов на один час аудио до 15–20 минут, автоматизируя исправление галлюцинаций и восстановление логики повествования.
Проблема «сырого» текста: почему WER обманчив
Метрика Word Error Rate (WER) часто вводит в заблуждение: ошибка в одном слове-термине может полностью исказить смысл предложения, хотя статистически точность будет составлять 98%. В практике транскрибации мы сталкиваемся с тремя типами ошибок: фонетическими опечатками, отсутствием синтаксических границ и «галлюцинациями» модели, когда ИИ додумывает слова, которых не было в аудио, чтобы закрыть смысловой пробел.
Например, при записи интервью с инженером фраза «интерфейс API» может превратиться в «интерфейс апи» или «интерфейс апий», что требует ручной коррекции. Без применения LLM для пост-обработки стоимость подготовки чистового текста из сырого лога составляет около 1500–3000 рублей за час аудио при найме фрилансера. Использование связки ASR + LLM снижает эти затраты до 100–300 рублей за час за счет автоматизации.
Вывод эксперта: Не ориентируйтесь на общий процент точности; в бизнес-текстах критичны именно семантические ошибки, которые ASR-модели (даже уровня Whisper v3) не умеют исправлять самостоятельно.
Механика синергии: ASR как ухо, LLM как мозг
Процесс доработки текста строится по цепочке: распознавание → сегментация → контекстная коррекция → стилизация. LLM (например, GPT-4o или Claude 3.5 Sonnet) не просто исправляют опечатки, а анализируют контекст всего документа. Если в начале записи спикер представился как «директор по маркетингу», модель автоматически исправит все последующие фонетические ошибки в словах «лидогенерация» или «конверсия», основываясь на тематическом поле.
Кейс: при обработке 10-часового массива записей совещания с использованием только Whisper Large-v3 количество смысловых ошибок составляло около 12 на 1000 слов. После прогона через LLM с промптом на «сохранение дословности при исправлении грамматики» количество ошибок упало до 2–3 на 1000 слов. При этом время обработки одного часа аудио в облаке составляет от 2 до 5 минут.
Вывод эксперта: Для достижения литературного стандарта необходимо использовать двухэтапный промптинг: сначала жесткое исправление грамматики без изменения слов, затем — смысловое сглаживание и структурирование.
Борьба с галлюцинациями и потерями данных
Главный риск при использовании LLM — избыточная «творческая» правка, когда модель удаляет важные детали или придумывает аргументы, которых не было в речи. Чтобы минимизировать этот риск, применяется метод Temperature = 0 (детерминизм) и строгие системные инструкции. Опытный практик никогда не использует общие промпты вроде «сделай текст лучше», так как это ведет к потере до 15% специфической информации.
Эффективный метод — передача LLM глоссария терминов (до 50–100 ключевых слов) перед обработкой. Это снижает вероятность замены узкоспециализированного сленга на общеупотребительные слова. Сравнение: без глоссария модель заменяет «стейкхолдеры» на «заинтересованные лица» в 60% случаев, что может быть недопустимо в корпоративном отчете.
Вывод эксперта: Борьба с галлюцинациями выигрывается не выбором модели, а точностью промпта и наличием внешнего словаря терминов проекта.
Экономика и выбор стека для бизнеса
Выбор между локальным развертыванием (OpenAI Whisper + Llama 3) и облачным (API OpenAI/Anthropic) зависит от объема данных и требований к безопасности. Локальный стек требует инвестиций в GPU (например, NVIDIA A100 или RTX 4090 с 24ГБ VRAM) стоимостью от 150 до 400 тыс. рублей, но обнуляет стоимость одного часа транскрибации после окупаемости железа.
Облачный стек обходится дешевле на старте: транскрибация через Whisper API стоит $0.006 за минуту, а последующая коррекция через GPT-4o-mini обходится в среднем в $0.05–$0.10 за час аудио. Таким образом, себестоимость одного часа «чистого» текста в облаке составляет около $0.50–$0.70, что в десятки раз дешевле ручного труда.
Вывод эксперта: Для объемов до 100 часов аудио в месяц используйте облачные API с предварительным обезличиванием данных. Переходите на локальный стек только при объемах от 500+ часов в месяц или при строгом запрете на передачу данных вовне.
Вывод
Связка ASR + LLM — это единственный способ превратить поток речи в структурированный документ без многочасового ручного редактирования. Чтобы избежать потери данных, начинайте с модели Whisper Large-v3 для распознавания и GPT-4o-mini для базовой коррекции с температурой 0. Избегайте попыток объединить эти этапы в один промпт — разделение на «техническое распознавание» и «интеллектуальную правку» дает на 20–30% более точный результат. Обязательно внедряйте глоссарий терминов, иначе LLM «загладит» профессиональный сленг, лишив текст экспертности.
