ElevenLabs Scribe v2

ElevenLabs Scribe v2

Самая точная модель расшифровки речи на рынке по независимому замеру Artificial Analysis: 2.2% ошибок против 2.4% у Microsoft и 5.2% у Deepgram. 90+ языков, распознает до 48 говорящих, принимает список ваших терминов. При этом дешевле Whisper в API - $0.22 за час против $0.36. Есть версия для живой расшифровки с задержкой 150 мс.

от $0.22 за час аудио (API); версия реального времени - от $0.39Нужен VPN
⭐ 8.5/10📅 2026-01-09🏢 ElevenLabsProprietary

Рейтинг и бенчмарки

Общий рейтинг
8.5/10
Benchmark Score
9/10
Скорость
8.8/10
Точность (AA-WER)
2.2% - первое место по независимому замеру Artificial Analysis
Против конкурентов
Microsoft MAI-Transcribe-1.5 - 2.4%, Mistral Voxtral Small - 2.8%, Gemini 2.5 Pro - 2.9%, AssemblyAI Universal-3 Pro - 3.1%, Deepgram Nova-3 - 5.2%
Против Whisper
2.2% против примерно 5.3% - и при этом дешевле в API
Скорость
59.5x - час записи расшифровывается примерно за минуту
Языки
более 90
Разделение по говорящим
до 48 в пакетном режиме, до 32 в реальном времени
Задержка версии Realtime
менее 150 мс

Входные и выходные данные

Входные данные
аудио
Выходные данные
текст

API и стоимость

Входные токены (Input)
от $0.22 за час аудио (API); версия реального времени - от $0.39
цена за промпт
Выходные токены (Output)
$3.67 за 1000 минут аудио (около $0.22 за час)
цена за ответ
✓API доступен

Способы доступа

API (REST и WebSocket)веб-интерфейс ElevenLabs

Сценарии использования

расшифровка интервью и совещаний с разделением по говорящимсубтитрыобработка юридических и медицинских записейживые титрыголосовые ассистенты и агентыанализ звонков

Тарифы и подписки - ElevenLabs

Актуальные планы подписки провайдера. Цены могут меняться - уточняйте на странице цен

Starter (2.5 ч/мес включено)
$0.40/час включенных + $0.40/час доп.
  • 2 часа 30 минут транскрипции в месяц
  • Scribe v1/v2: $0.40/час (включенные часы)
  • Доп. часы: $0.40/час
  • Entity detection: +$0.120/час
  • Keyterm prompting: +$0.080/час
  • 90+ языков
Creator (12.5 ч/мес включено)
$0.35/час включенных + $0.48/час доп.
  • 12 часов 30 минут транскрипции в месяц
  • Scribe v1/v2: $0.35/час (включенные часы)
  • Доп. часы: $0.48/час
  • Entity detection: +$0.105/час
  • Keyterm prompting: +$0.070/час
  • 90+ языков, speaker diarization
Популярный
Pro (~63 ч/мес включено)
$0.33/час включенных + $0.40/час доп.
  • 62 часа 51 минута транскрипции в месяц
  • Scribe v1/v2: $0.33/час (включенные часы)
  • Доп. часы: $0.40/час
  • Entity detection: +$0.099/час
  • Keyterm prompting: +$0.066/час
  • 90+ языков, расширенные лимиты
Scale (300 ч/мес включено)
$0.30/час включенных + $0.33/час доп.
  • 300 часов транскрипции в месяц
  • Scribe v1/v2: $0.30/час (включенные часы)
  • Доп. часы: $0.33/час
  • Entity detection: +$0.090/час
  • Keyterm prompting: +$0.060/час
  • Высокие лимиты параллельных запросов
Business (1100 ч/мес включено)
$0.22/час включенных + $0.22/час доп.
  • 1100 часов транскрипции в месяц
  • Scribe v1/v2: $0.22/час (включенные часы)
  • Доп. часы: $0.22/час
  • Entity detection: +$0.066/час
  • Keyterm prompting: +$0.044/час
  • SOC 2, HIPAA, GDPR compliance
Scribe v2 Realtime (отдельный тариф)
$0.48/час включенных, 10 ч в месяц
  • 10 часов Realtime-транскрипции включено
  • Задержка ~150 мс
  • 90+ языков в реальном времени
  • WebSocket/REST API
  • Предназначен для голосовых агентов и live-приложений
Enterprise (6000+ ч/мес)
Индивидуально
  • 6000+ часов транскрипции
  • Dedicated support и SLA
  • Кастомные rate limits и SSO
  • SOC 2, HIPAA, GDPR
  • EU Data Residency и Zero Retention
  • MSA и BAA по запросу
Российские карты не принимаются.Genova-ai - работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Первое место по точности среди всех моделей расшифровки в независимом замере Artificial Analysis: 2.2% ошибок против 2.4% у Microsoft, 2.9% у Gemini 2.5 Pro и 5.2% у Deepgram Nova-3
Разделяет говорящих - до 48 человек в записи. Расшифровка совещания приходит уже разложенной по репликам, а не сплошным текстом
Принимает список ваших терминов: до 1000 слов - фамилии, названия продуктов, профессиональный жаргон. Именно это чаще всего портит расшифровку у других моделей
Дешевле Whisper в API: $0.22 за час против $0.36 - при вдвое меньшем числе ошибок
Быстрая: коэффициент 59.5x, то есть час записи расшифровывается примерно за минуту
Есть версия реального времени с задержкой менее 150 мс - для живых титров и голосовых агентов
Помечает неречевые события в записи: смех, паузы, посторонние звуки
Находит персональные данные по 56 категориям - удобно, когда расшифровку нужно обезличить перед передачей
Более 90 языков, включая русский
✗ Минусы
ElevenLabs не работает в России напрямую: нужен VPN и зарубежная карта, российские не принимаются
Закрытая облачная модель - локального запуска нет в принципе, а значит запись обязательно уходит на чужой сервер. Для медицинских и юридических данных это может быть неприемлемо
Цена $0.22 за час - это тариф Business с 1100 часами в месяц. На младших планах час стоит $0.30-0.40
Определение сущностей и список терминов тарифицируются отдельно, сверх базовой цены за час
Версия реального времени дороже пакетной и на младших тарифах включает всего 10 часов в месяц
Нет русскоязычного интерфейса и документации

Подробный обзор

Что такое ElevenLabs Scribe v2

Scribe v2 - модель распознавания речи, которую ElevenLabs выпустила 9 января 2026 года. На сегодня это самая точная модель расшифровки на рынке, и это не маркетинговое заявление компании, а результат независимого замера Artificial Analysis.

Моделей на самом деле две: Scribe v2 для обработки готовых файлов и Scribe v2 Realtime для живой расшифровки с задержкой менее 150 миллисекунд.

Насколько она точнее остальных

По сводному индексу AA-WER (чем меньше, тем лучше) расстановка получилась такая:

  • ElevenLabs Scribe v2 - 2.2%
  • Microsoft MAI-Transcribe-1.5 - 2.4%
  • Mistral Voxtral Small - 2.8%
  • Google Gemini 2.5 Pro - 2.9%
  • AssemblyAI Universal-3 Pro - 3.1%
  • Deepgram Nova-3 - 5.2%

Разрыв с ближайшим преследователем невелик, а вот с нижней частью списка - двукратный. Ценность именно в том, что замер независимый: обычно такие таблицы публикуют сами разработчики, и верить им можно с оговорками.

Три вещи, которых нет у Whisper

Если сравнивать с Whisper - самой популярной бесплатной альтернативой, - Scribe v2 закрывает ровно те три пробела, из-за которых с Whisper обычно мучаются:

  • Разделение по говорящим - до 48 человек. Расшифровка совещания приходит уже разложенной по репликам, а не сплошной простыней текста
  • Список ваших терминов - можно передать до 1000 слов: фамилии, названия продуктов, профессиональный жаргон. Именно на них модели обычно и спотыкаются
  • Работа в реальном времени - отдельная версия Realtime с задержкой менее 150 мс, тогда как Whisper умеет только обрабатывать готовые файлы

Дополнительно модель помечает неречевые события - смех, паузы, посторонние звуки - и находит персональные данные по 56 категориям, если расшифровку нужно обезличить.

Неожиданный момент с ценой

Обычно "самое точное" означает "самое дорогое". Здесь наоборот: Scribe v2 стоит $0.22 за час аудио против $0.36 за час у Whisper в API OpenAI. То есть модель одновременно вдвое точнее и в полтора раза дешевле.

$0.22 - это тариф Business с 1100 часами в месяц. На младших планах час выходит в $0.30-0.40, а определение сущностей и список терминов тарифицируются сверх базовой цены. Работает модель быстро - коэффициент 59.5x, то есть час записи расшифровывается примерно за минуту.

Когда она не подойдет

Два ограничения, которые перевешивают любую точность в конкретных сценариях.

Первое - Россия. ElevenLabs напрямую не работает: нужен VPN и зарубежная карта, российские не принимаются. Это делает сервис неудобным для повседневной работы из РФ.

Второе - приватность. Модель закрытая и облачная, локального запуска нет в принципе. Запись обязательно уходит на чужой сервер, и для медицинских консультаций, юридических переговоров или внутренних совещаний это может быть неприемлемо независимо от сертификатов соответствия. В обоих случаях выбор - Whisper: он бесплатный, работает локально без интернета и данные никуда не отправляет, пусть и ошибается вдвое чаще.

Часто задаваемые вопросы

Правда ли Scribe v2 - самая точная модель расшифровки?
По независимому замеру Artificial Analysis - да, на момент проверки. Ее индекс ошибок AA-WER составляет 2.2% против 2.4% у Microsoft MAI-Transcribe-1.5, 2.9% у Gemini 2.5 Pro и 5.2% у Deepgram Nova-3. Важно, что замер проводила независимая сторона, а не сам разработчик.
Scribe v2 или Whisper - что выбрать?
Scribe v2 точнее примерно вдвое, дешевле в API ($0.22 против $0.36 за час) и умеет три вещи, которых у Whisper нет: разделять говорящих, принимать список ваших терминов и работать в реальном времени. Но Whisper бесплатен при локальном запуске, работает в России без VPN и не отправляет запись на чужой сервер. Если приватность или доступ из РФ важнее точности - берите Whisper.
Сколько стоит Scribe v2?
$3.67 за 1000 минут аудио, то есть около $0.22 за час - но это тариф Business с 1100 включенными часами в месяц. На младших планах час обходится в $0.30-0.40. Определение сущностей и список терминов оплачиваются отдельно сверх базовой цены. Версия реального времени стоит от $0.39 за час.
Работает ли Scribe v2 в России?
Напрямую нет. ElevenLabs требует VPN, а российские карты не принимает - нужна зарубежная карта или посредник. Русский язык модель понимает и входит в ее 90+ языков, проблема именно в доступе к сервису и оплате.
Может ли Scribe v2 определить, кто говорит?
Да, и это одно из главных ее преимуществ: до 48 говорящих в пакетном режиме и до 32 в реальном времени. Расшифровка совещания или интервью приходит уже разложенной по репликам. У Whisper такой возможности нет вовсе - там получается сплошной текст без разделения.
Чем Scribe v2 отличается от Scribe v2 Realtime?
Обычная версия обрабатывает готовые файлы и предназначена для длинных записей - подкастов, совещаний, юридических и медицинских материалов, там же доступно разделение до 48 говорящих. Realtime расшифровывает живую речь с задержкой менее 150 мс для голосовых агентов и живых титров, но стоит дороже и делит максимум на 32 говорящих.
Что дает список терминов?
Возможность заранее передать модели до 1000 слов - фамилий, названий продуктов, профессионального жаргона, - чтобы она их не коверкала. Это самая частая причина испорченных расшифровок у моделей без такой функции: общеупотребительную речь они распознают хорошо, а на специфических терминах ошибаются. Учтите, что опция тарифицируется отдельно.
Насколько быстро идет расшифровка?
Коэффициент скорости 59.5x - то есть час записи обрабатывается примерно за минуту. Для сравнения, у Deepgram Nova-3 этот показатель выше (522x), но точность заметно хуже: 5.2% ошибок против 2.2%.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие модели