Разрыв в точности (WER) между классическими HMM-системами и современными трансформерами достиг 15–20% на зашумленных записях, что делает выбор энкодера критическим фактором рентабельности проекта. Сегодня борьба идет не за общее распознавание, а за минимизацию галлюцинаций и стоимость одного часа аудио.
Whisper: доминирование за счет Weak Supervision
Архитектура Whisper от OpenAI перевернула рынок, используя Encoder-Decoder Transformer, обученный на 680 000 часов многоязычного аудио. В отличие от старых систем, он не просто переводит звук в фонемы, а предсказывает текст, опираясь на контекст. Это дает Word Error Rate (WER) в районе 5–10% для чистого английского и 12–18% для русского языка в стандартных условиях.
Практический кейс: при транскрибации интервью с сильным фоновым шумом (кафе, улица) Whisper Large-v3 показывает точность на 25% выше, чем Wav2Vec 2.0, за счет встроенного механизма подавления шума. Однако главный минус — склонность к «галлюцинациям»: модель может начать повторять одну фразу по кругу или придумывать текст в моменты тишины.
Экспертный вывод: Whisper идеален для контента с высокой вариативностью речи, но требует обязательного внедрения VAD (Voice Activity Detection) для отсечения пустых интервалов.
Wav2Vec 2.0: скорость и проблема языковых моделей
Wav2Vec 2.0 от Meta работает по принципу самообучения (self-supervised learning), извлекая признаки из сырого аудио без текстовых меток. Это делает его значительно быстрее Whisper в режиме инференса: обработка часа аудио на GPU уровня RTX 3090 занимает от 2 до 5 минут, в то время как Whisper Large требует 10–15 минут.
Нюанс практики: Wav2Vec выдает «сырые» предсказания. Чтобы достичь приемлемого качества, его необходимо связывать с внешней языковой моделью (n-gram или BERT). Без этого WER прыгает до 30–40%, так как модель часто ошибается в омофонах и грамматических окончаниях.
Экспертный вывод: выбирайте Wav2Vec для real-time систем или высоконагруженных сервисов, где задержка (latency) критичнее идеальной пунктуации.
Kaldi: промышленный стандарт для узких ниш
Kaldi — это не единая модель, а фреймворк на базе HMM (скрытых марковских моделей) и GMM. Несмотря на возраст, он незаменим в медицине и юриспруденции. Здесь точность достигается не объемом данных, а ручной настройкой словаря и грамматики. В узком домене (например, запись операций в хирургии) настроенный Kaldi может обойти Whisper по точности терминов на 5–7%.
Мини-кейс: внедрение системы распознавания команд управления на заводе. Использование Whisper было избыточным и медленным (задержка 1-2 сек), в то время как облегченный движок на базе Kaldi работал с задержкой <100 мс при точности 98% по ограниченному словарю.
Экспертный вывод: Kaldi — это инструмент для инженеров, а не для пользователей. Его стоит использовать только если у вас есть узкий словарь терминов и жесткие требования к железу (CPU-only).
Технический анализ стоимости и ресурсов
Выбор архитектуры напрямую влияет на TCO. Whisper Large-v3 требует минимум 12 ГБ VRAM для комфортной работы, что поднимает стоимость аренды GPU до $0.5–$1.5 за час работы сервера. Wav2Vec или оптимизированные версии Whisper (например, faster-whisper через CTranslate2) снижают потребление памяти в 2–3 раза, позволяя обрабатывать до 10-15 потоков на одной карте.
Сравнение эффективности: если стоимость человеческой верификации текста составляет $5–$10 за час аудио, то переплата за более тяжелую модель (Whisper), снижающая WER с 15% до 8%, окупается за счет сокращения времени правки текста с 40 до 20 минут на час записи.
Экспертный вывод: для массового рынка оптимален faster-whisper; для корпоративного сектора с закрытым контуром — Wav2Vec с дообучением (fine-tuning) на специфических данных.
Вывод
Мой вердикт: для 90% задач текущим золотым стандартом является Whisper в реализации faster-whisper из-за лучшего соотношения точность/усилия по настройке. Избегайте чистого Wav2Vec, если у вас нет ресурсов на создание качественной языковой модели. Kaldi оставьте для встраиваемых систем с ограниченным словарем. Начинайте с Whisper Medium, переходите на Large-v3 только если WER на вашем датасете не опускается ниже 12%, иначе вы переплатите за GPU без ощутимого прироста качества.
