Whisper
Открытая модель распознавания речи от OpenAI под лицензией MIT: 99 языков, русский на уровне 5.6% ошибок на эталонном тесте. Главное — её можно скачать и запустить бесплатно на своём компьютере, поэтому она работает в России без VPN и без оплаты зарубежных сервисов. В API OpenAI уже есть точнее, но у себя Whisper остаётся лучшим бесплатным вариантом.
Рейтинг и бенчмарки
Входные и выходные данные
API и стоимость
Способы доступа
Сценарии использования
Тарифы и подписки — OpenAI
Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен
- Лицензия MIT — можно всё, включая коммерческое использование
- Веса скачиваются с GitHub или Hugging Face
- Работает без интернета и без VPN
- Данные не покидают компьютер
- Ограничение только по вашему железу
- $0.36 за час аудио
- Не нужно своё железо
- Требуется зарубежная карта и VPN
- Файлы до 25 МБ за запрос
- gpt-4o-mini-transcribe — вдвое дешевле Whisper
- gpt-4o-transcribe — точнее (4.1% против 5.3%)
- Версия с распознаванием говорящих
- Потоковый режим — $0.017 за минуту
Плюсы и минусы
Подробный обзор
Что такое Whisper
Whisper — модель распознавания речи, которую OpenAI выложила в открытый доступ в сентябре 2022 года под лицензией MIT. Она превращает аудио в текст на 99 языках и умеет переводить речь сразу на английский. Ключевая особенность, из-за которой она до сих пор востребована: веса модели можно скачать и запустить у себя, ничего не платя и никуда не отправляя запись.
Почему она особенно актуальна в России
Большинство хороших сервисов расшифровки требуют зарубежную карту и VPN. Whisper — нет. Вы один раз скачиваете файл модели, и дальше она работает на вашем компьютере без интернета, без подписки и без ограничений по объёму. Для расшифровки чувствительных записей — переговоров, медицинских консультаций, внутренних совещаний — это ещё и вопрос безопасности: аудио физически не покидает ваш компьютер.
Какую версию выбрать
Модель выпущена в семи размерах, и выбор упирается в ваше железо:
- tiny (39M) и base (74M) — около 1 ГБ видеопамяти, работают очень быстро, но ошибок много. Годятся для черновой расшифровки на слабом ноутбуке
- small (244M) и medium (769M) — 2 и 5 ГБ соответственно, разумный компромисс
- large-v3 (1.55B) — около 10 ГБ видеопамяти, максимальная точность. На 10-20% меньше ошибок, чем у предыдущей large-v2
- large-v3-turbo (809M) — оптимальный выбор для большинства: примерно в 8 раз быстрее большой модели при почти той же точности и всего 6 ГБ видеопамяти
Если видеокарты нет вообще, помогает сборка whisper.cpp — она гоняет модель на обычном процессоре, пусть и медленнее. Для ускорения на видеокарте есть faster-whisper.
Насколько хорошо она понимает русский
На эталонном тесте FLEURS русский показывает 5.6% ошибок — хороший результат, русский относится к языкам, которые модель знает прилично. Но на реальных записях с шумом, акцентами и перебиваниями цифра поднимается до 8-14%, то есть примерно одно неверное слово из десяти. Для сравнения: живой расшифровщик-человек ошибается в 5.1-5.9% случаев. Практический вывод простой — расшифровку нужно вычитывать, публиковать её без правки нельзя.
О чём важно знать заранее
У Whisper есть особенность, которая застаёт врасплох: на тишине модель может выдумывать текст. Это изучено и задокументировано (исследование ACM FAccT 2024): на паузах длиннее 30 секунд она иногда генерирует фразы, которых в записи не было. Лечится просто — вырезайте длинные паузы перед обработкой.
Три вещи, которых модель не умеет вовсе: различать говорящих (диалог превратится в сплошной текст), учитывать подсказанные термины (фамилии и профессиональный жаргон будет коверкать) и работать в реальном времени (только пачками по готовым файлам).
Whisper в API: честно про устаревание
Если вы собирались платить OpenAI за API, стоит знать: Whisper там уже не лучший вариант. Модель gpt-4o-transcribe даёт 4.1% ошибок против 5.3% у Whisper за ту же цену $0.006 за минуту, а gpt-4o-mini-transcribe стоит вдвое дешевле — $0.003. Есть и версия с распознаванием говорящих, чего у Whisper нет в принципе. Так что через API брать Whisper смысла мало.
А вот для локального запуска альтернатив уровня Whisper практически нет — новые модели OpenAI доступны только через платный API, требующий зарубежной карты. Именно поэтому открытые веса под MIT остаются главной причиной, по которой эта модель 2022 года до сих пор в ходу.