Whisper Large V3

Whisper Large V3

Открытая модель распознавания речи от OpenAI (ноябрь 2023) — де-факто стандарт для транскрипции: 1.55B параметров, 99 языков включая русский, обучена на 5 млн часов аудио. Работает локально и бесплатно, без интернета и аккаунтов. Есть ускоренная версия Turbo (809M, в 2-5 раз быстрее).

Бесплатно при локальном запуске / API OpenAI ~$0.006 за минутуРаботает в РФРусский язык
8/10📅 2023-11🏢 OpenAI✓ Open Source

Рейтинг и бенчмарки

Общий рейтинг
8/10
Benchmark Score
8.2/10
Скорость
7.5/10
Языки
99, включая русский
WER (английский, LibriSpeech clean)
2.0%
WER (среднее по 99 языкам, Fleurs)
~10.6%
Обучение
5 млн часов аудио
Turbo-версия
809M параметров, в 2-5 раз быстрее

Входные и выходные данные

Входные данные
аудио
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно при локальном запуске / API OpenAI ~$0.006 за минуту
цена за промпт
API доступен

Способы доступа

Self-hosted (Hugging Facewhisper.cppfaster-whisper)API (OpenAIсторонние провайдеры)

Сценарии использования

транскрипция аудио и видеосубтитрырасшифровка интервью и созвоновперевод речи на английскийголосовой ввод

Тарифы и подписки — OpenAI

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Популярный
Локальный запуск (self-host)
Бесплатно
  • Веса на Hugging Face под MIT
  • Коммерческое использование без ограничений
  • Работает офлайн — аудио не покидает компьютер
  • Ускоренные сборки: whisper.cpp, faster-whisper, Turbo
API OpenAI
~$0.006 за минуту аудио
  • Без своего железа и настройки
  • Быстрая транскрипция по запросу
  • Временные метки и перевод на английский
  • Требуется зарубежная карта
Сторонние провайдеры
зависит от провайдера
  • Together AI, Groq, Replicate и др.
  • Часто дешевле и быстрее оригинала
  • Готовый API без инфраструктуры
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Бесплатна и полностью открыта (MIT) — можно скачать и запускать локально, аудио не уходит в облако
99 языков, включая русский — качественная транскрипция русской речи «из коробки», редкость для открытых моделей
Высокая точность: 2.0% WER на чистом английском (LibriSpeech), на 10-20% меньше ошибок, чем у large-v2
Обучена на 5 млн часов аудио — устойчива к шуму, акцентам и разговорной речи
Умеет не только распознавать, но и переводить речь на английский, а также выдавать временные метки для субтитров
Есть версия Turbo (809M параметров) — в 2-5 раз быстрее при минимальной потере точности
Работает офлайн и в России без ограничений: ни VPN, ни карт, ни аккаунтов не нужно
✗ Минусы
Для комфортной скорости на длинных записях нужна видеокарта — на CPU полная large-v3 работает медленно (спасает Turbo или faster-whisper)
Не различает говорящих (диаризация) из коробки — нужны сторонние инструменты
Может «додумывать» текст в тишине или на шуме — известный артефакт галлюцинаций
Модель 2023 года: по точности и скорости её уже обходят свежие коммерческие ASR (ElevenLabs Scribe, Deepgram Nova-3)
Оплата API OpenAI недоступна с российских карт (но локальный запуск бесплатен и без барьеров)
Работает только с аудио на входе — это транскрипция, а не голосовой ассистент

Подробный обзор

Что такое Whisper Large V3

Whisper Large V3 — открытая модель распознавания речи от OpenAI, вышедшая в ноябре 2023 года и с тех пор ставшая де-факто стандартом транскрипции. Это трансформер архитектуры encoder-decoder на 1.55 млрд параметров, обученный на 5 миллионах часов аудио (1 млн часов размеченных вручную и 4 млн псевдоразмеченных предыдущей версией large-v2). Модель поддерживает 99 языков и умеет не только расшифровывать речь, но и переводить её на английский.

Точность и русский язык

На чистой английской речи (LibriSpeech clean) Whisper Large V3 показывает 2.0% WER — то есть примерно 2 ошибки на 100 слов. В среднем по всем 99 языкам на бенчмарке Fleurs — около 10.6% WER. Относительно large-v2 количество ошибок снизилось на 10-20% по широкому набору языков. Для русскоязычных пользователей главное: русский входит в число хорошо поддерживаемых языков, и качество расшифровки русской речи здесь заметно выше, чем у большинства открытых альтернатив.

Скорость: версия Turbo и ускоренные сборки

Полная large-v3 довольно тяжёлая. В октябре 2024 вышла версия Turbo: у неё урезан декодер (с 32 слоёв до 4), всего 809 млн параметров, и работает она в 2-5 раз быстрее при минимальной потере точности. Плюс существуют оптимизированные реализации — whisper.cpp (запуск даже на CPU и на Mac) и faster-whisper, которые ускоряют работу в разы. Для большинства практических задач связка Turbo + faster-whisper даёт отличный баланс.

Доступность в России

Whisper работает в России без каких-либо ограничений — это открытые веса под лицензией MIT: скачиваете модель и запускаете локально, полностью офлайн. Ни VPN, ни зарубежной карты, ни аккаунта не требуется, а аудио не покидает ваш компьютер — важный плюс для конфиденциальных записей (интервью, созвоны, медицинские или юридические материалы). Платный API OpenAI (около $0.006 за минуту) российскими картами не оплатить, но в нём и нет необходимости: локальный запуск бесплатен. Из более свежих и точных коммерческих альтернатив стоит иметь в виду ElevenLabs Scribe и Deepgram Nova-3, но они платные и требуют зарубежной оплаты.

Часто задаваемые вопросы

Что такое Whisper Large V3?
Открытая модель распознавания речи от OpenAI (ноябрь 2023) на 1.55 млрд параметров, обученная на 5 млн часов аудио. Поддерживает 99 языков, включая русский, умеет расшифровывать речь и переводить её на английский, выдаёт временные метки для субтитров. Лицензия MIT — можно запускать локально бесплатно.
Хорошо ли Whisper распознаёт русскую речь?
Да, русский входит в число хорошо поддерживаемых языков, и качество расшифровки заметно выше, чем у большинства открытых альтернатив. Точных официальных цифр WER именно для русского OpenAI не публикует, но на практике модель уверенно справляется с интервью, созвонами и подкастами на русском, включая разговорную речь.
Сколько стоит Whisper Large V3?
При локальном запуске — бесплатно: веса открыты под MIT, можно использовать и коммерчески. Если не хотите возиться с настройкой, есть API OpenAI (порядка $0.006 за минуту аудио) и сторонние провайдеры (Groq, Together AI, Replicate), часто более быстрые и дешёвые.
Какое железо нужно и что такое версия Turbo?
Полная large-v3 на видеокарте работает комфортно, на CPU — медленно. Для ускорения есть версия Turbo (809 млн параметров, урезанный декодер): она в 2-5 раз быстрее при минимальной потере точности. Плюс оптимизированные реализации whisper.cpp (работает даже на CPU и Mac) и faster-whisper — с ними транскрипция идёт в разы быстрее.
Работает ли Whisper в России?
Да, без каких-либо ограничений: это открытые веса, модель скачивается и работает полностью офлайн — ни VPN, ни карт, ни аккаунтов не нужно. Аудио не уходит в облако, что важно для конфиденциальных записей. Платный API OpenAI российскими картами не оплатить, но локальный запуск полностью бесплатен.
Whisper всё ещё актуален в 2026 году?
Как открытый бесплатный стандарт — да, он остаётся самым практичным выбором для локальной транскрипции, особенно когда важна приватность. Но это модель 2023 года: по точности и скорости её уже обходят свежие коммерческие системы вроде ElevenLabs Scribe v2 и Deepgram Nova-3. Если нужен максимум качества и вы готовы платить — стоит сравнить с ними; если нужен бесплатный офлайн-вариант — Whisper вне конкуренции.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно