Переход с FP32 на INT8 при квантовании моделей Whisper сокращает потребление VRAM в 3.5–4 раза, при этом Word Error Rate (WER) вырастает всего на 0.5–1.2%. В промышленном масштабе это разница между арендой одной RTX 3090 за $0.4/час и необходимостью развертывать кластер из A100 для обработки того же объема аудио.
Архитектура квантования: от FP32 до INT4
Стандартные веса моделей (FP32) требуют 4 байта на параметр. Для модели Whisper-large-v3 это означает ~3 ГБ только под веса, но с учетом контекстного окна и активаций реальный порог VRAM для стабильной работы составляет 5–7 ГБ. Квантование до FP16 снижает потребление вдвое без потери качества, но настоящий профит начинается на INT8 и INT4.
Практика показывает, что переход на INT8 (8-битные целые числа) через библиотеку bitsandbytes или AutoGPTQ позволяет запускать тяжелые модели на картах с 4–6 ГБ VRAM. Однако при спуске до INT4 (4-битное квантование) мы сталкиваемся с «галлюцинациями» в пунктуации и потерей точности в именах собственных: WER может подскочить на 3–5% в зависимости от чистоты записи.
Экспертный вывод: FP16 — стандарт для продакшена; INT8 — оптимальный компромисс для недорогих GPU; INT4 допустим только для простых задач без требований к идеальной орфографии.
Влияние сжатия на Word Error Rate (WER)
Точность распознавания падает нелинейно. При тестировании на датасете из 100 часов русской речи (смесь интервью и подкастов) наблюдается следующая динамика: FP16 дает базовый WER 7.2%, INT8 поднимает его до 7.8%, а INT4 — до 11.4%. Это означает, что на каждые 100 слов в INT4 режиме вы получите на 4-5 ошибок больше, чем в полноразмерной модели.
Критическая точка наступает при работе с аудио низкого качества (SNR < 15 дБ). В таких условиях квантованная модель INT4 начинает «зацикливаться» или пропускать целые фразы, в то время как FP16 сохраняет связность текста. Это напрямую влияет на время последующей коррекции текста человеком, увеличивая трудозатраты на 15–20%.
Экспертный вывод: Если ваш контент — это чистые студийные записи, смело используйте INT8. Если это записи с телефона или шумные зум-звонки — оставайтесь на FP16.
Потребление VRAM и пропускная способность
Рассмотрим кейс: обработка 1000 часов аудио в месяц. Использование FP32 требует GPU с 16+ ГБ VRAM, что увеличивает стоимость инфраструктуры. Переход на квантованную версию через CTranslate2 позволяет снизить потребление памяти с 5 ГБ до 1.2 ГБ на один поток. Это дает возможность реализовать параллельную обработку потоков в ИИ-транскрибации, запуская до 4-х независимых инстансов модели на одной карте RTX 3060 (12 ГБ).
Скорость генерации (tokens per second) при INT8 вырастает в 1.5–2.2 раза по сравнению с FP32 за счет снижения нагрузки на шину памяти. Однако стоит учитывать оверхед на деквантование весов в реальном времени, который может «съедать» до 5-10% этого прироста на старых архитектурах GPU (серия Pascal и старше).
Экспертный вывод: Квантование — это не только про экономию памяти, но и про масштабирование. Переход на INT8 позволяет увеличить пропускную способность сервера в 3-4 раза без закупки нового железа.
Сравнение методов: PTQ против QAT
Большинство пользователей используют Post-Training Quantization (PTQ) — сжатие уже обученной модели. Это быстро, но ведет к потере точности. Альтернатива — Quantization-Aware Training (QAT), где модель обучается с учетом будущего сжатия. QAT позволяет добиться точности FP16 при размере INT8, но требует колоссальных ресурсов: до 100 часов обучения на кластере из 8x A100 (стоимость аренды ~$2000–5000 за итерацию).
Для 99% проектов в нише транскрибации QAT избыточен. Практика показывает, что использование методов оптимизации, таких как Faster-Whisper, дает результат, близкий к QAT, за счет оптимизированных ядер CUDA, сокращая время рендеринга без необходимости переобучения модели.
Экспертный вывод: Забудьте про QAT, если вы не создаете базовую модель для рынка. Используйте Faster-Whisper или TensorRT-LLM для реализации эффективного PTQ.
Вывод
Мой вердикт: для коммерческого запуска сервиса транскрибации единственно верным выбором является INT8 (через CTranslate2 или TensorRT). Это «золотая середина», где потеря точности (до 1%) незаметна для пользователя, а экономия VRAM в 3-4 раза позволяет радикально снизить стоимость минуты обработки. Избегайте INT4 для русского языка из-за нестабильной работы с падежами и пунктуацией. Начинайте с FP16 для калибровки качества, затем переходите на INT8 для масштабирования инфраструктуры.
