Whisper

Whisper

Открытая модель распознавания речи от OpenAI под лицензией MIT: 99 языков, русский на уровне 5.6% ошибок на эталонном тесте. Главное — её можно скачать и запустить бесплатно на своём компьютере, поэтому она работает в России без VPN и без оплаты зарубежных сервисов. В API OpenAI уже есть точнее, но у себя Whisper остаётся лучшим бесплатным вариантом.

Бесплатно при локальном запуске; API OpenAI — $0.006 за минуту ($0.36 за час)Работает в РФ
7.8/10📅 2022-09🏢 OpenAI✓ Open Source

Рейтинг и бенчмарки

Общий рейтинг
7.8/10
Benchmark Score
7.7/10
Скорость
8.5/10
Русский язык
5.6% ошибок на эталонном тесте FLEURS; 8-14% на реальных записях
Английский язык
8-12% ошибок на реальных записях (человек-расшифровщик — 5.1-5.9%)
Языки
99
large-v3 против large-v2
на 10-20% меньше ошибок по большинству языков
large-v3-turbo
809M параметров, примерно в 8 раз быстрее large-v3 при близкой точности
Точность против новых моделей OpenAI
5.3% против 4.1% у gpt-4o-transcribe за ту же цену

Входные и выходные данные

Входные данные
аудио
Выходные данные
текст

API и стоимость

Входные токены (Input)
Бесплатно при локальном запуске; API OpenAI — $0.006 за минуту ($0.36 за час)
цена за промпт
Выходные токены (Output)
$0.006 за минуту аудио (API)
цена за ответ
API доступен

Способы доступа

локальный запуск (GitHubHugging Facewhisper.cppfaster-whisper)API OpenAIоблачные провайдеры

Сценарии использования

расшифровка интервью и созвоновсубтитры к видеотранскрипт лекций и подкастовперевод речи на английскийголосовой вводобработка архивов записей

Тарифы и подписки — OpenAI

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Популярный
Локальный запуск
Бесплатно
  • Лицензия MIT — можно всё, включая коммерческое использование
  • Веса скачиваются с GitHub или Hugging Face
  • Работает без интернета и без VPN
  • Данные не покидают компьютер
  • Ограничение только по вашему железу
API OpenAI (whisper-1)
$0.006 за минуту
  • $0.36 за час аудио
  • Не нужно своё железо
  • Требуется зарубежная карта и VPN
  • Файлы до 25 МБ за запрос
Альтернатива в API OpenAI
от $0.003 за минуту
  • gpt-4o-mini-transcribe — вдвое дешевле Whisper
  • gpt-4o-transcribe — точнее (4.1% против 5.3%)
  • Версия с распознаванием говорящих
  • Потоковый режим — $0.017 за минуту
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Полностью бесплатна при локальном запуске и лицензия MIT разрешает любое использование, включая коммерческое — платить не нужно вообще никогда
Работает в России без VPN и без зарубежной карты: модель скачивается один раз и дальше крутится на вашем компьютере, никуда ничего не отправляя
Приличный русский: 5.6% ошибок на эталонном тесте FLEURS — это заметно лучше, чем у большинства бесплатных альтернатив
Данные не покидают компьютер — важно для расшифровки медицинских, юридических и внутренних корпоративных записей
Семь размеров под любое железо: tiny на 39M требует около 1 ГБ видеопамяти, large-v3 на 1.55B — около 10 ГБ
Версия large-v3-turbo примерно в 8 раз быстрее большой модели при почти той же точности и всего 6 ГБ видеопамяти
99 языков плюс режим перевода речи сразу на английский
Огромная экосистема готовых сборок: whisper.cpp запускает модель даже без видеокарты, faster-whisper ускоряет её в разы
✗ Минусы
Выдумывает текст в тишине — задокументированная проблема (исследование ACM FAccT 2024). На паузах длиннее 30 секунд модель может сгенерировать несуществующие фразы, поэтому длинные тишины лучше вырезать заранее
Не различает говорящих: на записи диалога получится сплошной текст без пометок, кто что сказал. Для этого нужны отдельные инструменты диаризации
Нельзя подсказать модели специфические термины, имена или названия — фамилии и профессиональный жаргон она будет коверкать
Не умеет в реальном времени: работает пачками по готовым файлам, для живой расшифровки разговора нужны другие решения
В API OpenAI это уже устаревшая модель — gpt-4o-transcribe даёт 4.1% ошибок против 5.3% у Whisper за ту же цену, а gpt-4o-mini-transcribe вдвое дешевле
Для русского результат требует вычитки: 8-14% ошибок на реальных записях означает примерно одно неверное слово из десяти — для публикации без правки не годится
Локальный запуск требует установки Python и зависимостей — для нетехнического пользователя это барьер, придётся искать готовое приложение

Подробный обзор

Что такое Whisper

Whisper — модель распознавания речи, которую OpenAI выложила в открытый доступ в сентябре 2022 года под лицензией MIT. Она превращает аудио в текст на 99 языках и умеет переводить речь сразу на английский. Ключевая особенность, из-за которой она до сих пор востребована: веса модели можно скачать и запустить у себя, ничего не платя и никуда не отправляя запись.

Почему она особенно актуальна в России

Большинство хороших сервисов расшифровки требуют зарубежную карту и VPN. Whisper — нет. Вы один раз скачиваете файл модели, и дальше она работает на вашем компьютере без интернета, без подписки и без ограничений по объёму. Для расшифровки чувствительных записей — переговоров, медицинских консультаций, внутренних совещаний — это ещё и вопрос безопасности: аудио физически не покидает ваш компьютер.

Какую версию выбрать

Модель выпущена в семи размерах, и выбор упирается в ваше железо:

  • tiny (39M) и base (74M) — около 1 ГБ видеопамяти, работают очень быстро, но ошибок много. Годятся для черновой расшифровки на слабом ноутбуке
  • small (244M) и medium (769M) — 2 и 5 ГБ соответственно, разумный компромисс
  • large-v3 (1.55B) — около 10 ГБ видеопамяти, максимальная точность. На 10-20% меньше ошибок, чем у предыдущей large-v2
  • large-v3-turbo (809M)оптимальный выбор для большинства: примерно в 8 раз быстрее большой модели при почти той же точности и всего 6 ГБ видеопамяти

Если видеокарты нет вообще, помогает сборка whisper.cpp — она гоняет модель на обычном процессоре, пусть и медленнее. Для ускорения на видеокарте есть faster-whisper.

Насколько хорошо она понимает русский

На эталонном тесте FLEURS русский показывает 5.6% ошибок — хороший результат, русский относится к языкам, которые модель знает прилично. Но на реальных записях с шумом, акцентами и перебиваниями цифра поднимается до 8-14%, то есть примерно одно неверное слово из десяти. Для сравнения: живой расшифровщик-человек ошибается в 5.1-5.9% случаев. Практический вывод простой — расшифровку нужно вычитывать, публиковать её без правки нельзя.

О чём важно знать заранее

У Whisper есть особенность, которая застаёт врасплох: на тишине модель может выдумывать текст. Это изучено и задокументировано (исследование ACM FAccT 2024): на паузах длиннее 30 секунд она иногда генерирует фразы, которых в записи не было. Лечится просто — вырезайте длинные паузы перед обработкой.

Три вещи, которых модель не умеет вовсе: различать говорящих (диалог превратится в сплошной текст), учитывать подсказанные термины (фамилии и профессиональный жаргон будет коверкать) и работать в реальном времени (только пачками по готовым файлам).

Whisper в API: честно про устаревание

Если вы собирались платить OpenAI за API, стоит знать: Whisper там уже не лучший вариант. Модель gpt-4o-transcribe даёт 4.1% ошибок против 5.3% у Whisper за ту же цену $0.006 за минуту, а gpt-4o-mini-transcribe стоит вдвое дешевле — $0.003. Есть и версия с распознаванием говорящих, чего у Whisper нет в принципе. Так что через API брать Whisper смысла мало.

А вот для локального запуска альтернатив уровня Whisper практически нет — новые модели OpenAI доступны только через платный API, требующий зарубежной карты. Именно поэтому открытые веса под MIT остаются главной причиной, по которой эта модель 2022 года до сих пор в ходу.

Часто задаваемые вопросы

Whisper бесплатная?
При локальном запуске — да, полностью и навсегда. Лицензия MIT разрешает любое использование, включая коммерческое: скачиваете веса с GitHub или Hugging Face и работаете без подписок и лимитов. Платить нужно только за облачный API OpenAI — $0.006 за минуту аудио, то есть $0.36 за час.
Работает ли Whisper в России?
Да, и это её главное преимущество для российских пользователей. Локальный запуск не требует ни VPN, ни зарубежной карты — модель скачивается один раз и дальше работает на вашем компьютере вообще без интернета. Через API OpenAI понадобятся VPN и иностранная карта.
Насколько точно Whisper распознаёт русскую речь?
На эталонном тесте FLEURS — 5.6% ошибок, это хороший результат. Но на реальных записях с шумом и перебиваниями показатель составляет 8-14%, примерно одно неверное слово из десяти. Живой расшифровщик ошибается в 5.1-5.9% случаев. Вывод: расшифровку нужно вычитывать перед публикацией.
Какую версию Whisper выбрать?
Для большинства задач оптимальна large-v3-turbo: 809M параметров, около 6 ГБ видеопамяти, примерно в 8 раз быстрее большой модели при почти той же точности. Если нужна максимальная точность и есть 10 ГБ видеопамяти — берите large-v3. На слабом железе выручат small или medium, а без видеокарты вообще поможет сборка whisper.cpp на процессоре.
Почему Whisper иногда пишет то, чего в записи не было?
Это известная особенность модели, задокументированная в исследовании ACM FAccT 2024: на участках тишины она может сгенерировать несуществующие фразы, особенно если пауза длиннее 30 секунд. Решение простое — вырезать длинные паузы из аудио перед обработкой.
Может ли Whisper определить, кто говорит?
Нет. Модель выдаёт сплошной текст без разделения на реплики — для записи диалога или совещания это заметное ограничение. Для распознавания говорящих нужны отдельные инструменты диаризации, которые запускают в связке с Whisper, либо платный gpt-4o-transcribe-diarize от OpenAI.
Whisper устарела? Есть ли что-то лучше?
В платном API OpenAI — да, устарела: gpt-4o-transcribe точнее (4.1% ошибок против 5.3%) за ту же цену, а gpt-4o-mini-transcribe вдвое дешевле. Но для бесплатного локального запуска альтернатив уровня Whisper практически нет — новые модели OpenAI доступны только через API. Поэтому в 2026 году она по-прежнему актуальна именно как свободная модель для запуска у себя.
Что нужно, чтобы запустить Whisper на своём компьютере?
Установленный Python с библиотекой openai-whisper либо готовая сборка вроде whisper.cpp (работает даже без видеокарты) или faster-whisper (быстрее на видеокарте). Из железа — от 1 ГБ видеопамяти для самой маленькой версии до 10 ГБ для самой точной. Нетехническому пользователю проще взять готовое приложение с графическим интерфейсом на базе Whisper.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно