Whisper Large V3
Открытая модель распознавания речи от OpenAI (ноябрь 2023) — де-факто стандарт для транскрипции: 1.55B параметров, 99 языков включая русский, обучена на 5 млн часов аудио. Работает локально и бесплатно, без интернета и аккаунтов. Есть ускоренная версия Turbo (809M, в 2-5 раз быстрее).
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — OpenAI
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Веса на Hugging Face под MIT
- Коммерческое использование без ограничений
- Работает офлайн — аудио не покидает компьютер
- Ускоренные сборки: whisper.cpp, faster-whisper, Turbo
- Без своего железа и настройки
- Быстрая транскрипция по запросу
- Временные метки и перевод на английский
- Требуется зарубежная карта
- Together AI, Groq, Replicate и др.
- Часто дешевле и быстрее оригинала
- Готовый API без инфраструктуры
Плюсы и минусы
Подробный обзор
Что такое Whisper Large V3
Whisper Large V3 — открытая модель распознавания речи от OpenAI, вышедшая в ноябре 2023 года и с тех пор ставшая де-факто стандартом транскрипции. Это трансформер архитектуры encoder-decoder на 1.55 млрд параметров, обученный на 5 миллионах часов аудио (1 млн часов размеченных вручную и 4 млн псевдоразмеченных предыдущей версией large-v2). Модель поддерживает 99 языков и умеет не только расшифровывать речь, но и переводить её на английский.
Точность и русский язык
На чистой английской речи (LibriSpeech clean) Whisper Large V3 показывает 2.0% WER — то есть примерно 2 ошибки на 100 слов. В среднем по всем 99 языкам на бенчмарке Fleurs — около 10.6% WER. Относительно large-v2 количество ошибок снизилось на 10-20% по широкому набору языков. Для русскоязычных пользователей главное: русский входит в число хорошо поддерживаемых языков, и качество расшифровки русской речи здесь заметно выше, чем у большинства открытых альтернатив.
Скорость: версия Turbo и ускоренные сборки
Полная large-v3 довольно тяжёлая. В октябре 2024 вышла версия Turbo: у неё урезан декодер (с 32 слоёв до 4), всего 809 млн параметров, и работает она в 2-5 раз быстрее при минимальной потере точности. Плюс существуют оптимизированные реализации — whisper.cpp (запуск даже на CPU и на Mac) и faster-whisper, которые ускоряют работу в разы. Для большинства практических задач связка Turbo + faster-whisper даёт отличный баланс.
Доступность в России
Whisper работает в России без каких-либо ограничений — это открытые веса под лицензией MIT: скачиваете модель и запускаете локально, полностью офлайн. Ни VPN, ни зарубежной карты, ни аккаунта не требуется, а аудио не покидает ваш компьютер — важный плюс для конфиденциальных записей (интервью, созвоны, медицинские или юридические материалы). Платный API OpenAI (около $0.006 за минуту) российскими картами не оплатить, но в нём и нет необходимости: локальный запуск бесплатен. Из более свежих и точных коммерческих альтернатив стоит иметь в виду ElevenLabs Scribe и Deepgram Nova-3, но они платные и требуют зарубежной оплаты.