ElevenLabs Scribe v2

ElevenLabs Scribe v2

Самая точная модель расшифровки речи на рынке по независимому замеру Artificial Analysis: 2.2% ошибок против 2.4% у Microsoft и 5.2% у Deepgram. 90+ языков, распознаёт до 48 говорящих, принимает список ваших терминов. При этом дешевле Whisper в API — $0.22 за час против $0.36. Есть версия для живой расшифровки с задержкой 150 мс.

от $0.22 за час аудио (API); версия реального времени — от $0.39Нужен VPN
8.5/10📅 2026-01-09🏢 ElevenLabsProprietary

Рейтинг и бенчмарки

Общий рейтинг
8.5/10
Benchmark Score
9/10
Скорость
8.8/10
Точность (AA-WER)
2.2% — первое место по независимому замеру Artificial Analysis
Против конкурентов
Microsoft MAI-Transcribe-1.5 — 2.4%, Mistral Voxtral Small — 2.8%, Gemini 2.5 Pro — 2.9%, AssemblyAI Universal-3 Pro — 3.1%, Deepgram Nova-3 — 5.2%
Против Whisper
2.2% против примерно 5.3% — и при этом дешевле в API
Скорость
59.5x — час записи расшифровывается примерно за минуту
Языки
более 90
Разделение по говорящим
до 48 в пакетном режиме, до 32 в реальном времени
Задержка версии Realtime
менее 150 мс

Входные и выходные данные

Входные данные
аудио
Выходные данные
текст

API и стоимость

Входные токены (Input)
от $0.22 за час аудио (API); версия реального времени — от $0.39
цена за промпт
Выходные токены (Output)
$3.67 за 1000 минут аудио (около $0.22 за час)
цена за ответ
API доступен

Способы доступа

API (REST и WebSocket)веб-интерфейс ElevenLabs

Сценарии использования

расшифровка интервью и совещаний с разделением по говорящимсубтитрыобработка юридических и медицинских записейживые титрыголосовые ассистенты и агентыанализ звонков

Тарифы и подписки — ElevenLabs

Актуальные планы подписки провайдера. Цены могут меняться — уточняйте на странице цен

Starter (2.5 ч/мес включено)
$0.40/час включённых + $0.40/час доп.
  • 2 часа 30 минут транскрипции в месяц
  • Scribe v1/v2: $0.40/час (включённые часы)
  • Доп. часы: $0.40/час
  • Entity detection: +$0.120/час
  • Keyterm prompting: +$0.080/час
  • 90+ языков
Creator (12.5 ч/мес включено)
$0.35/час включённых + $0.48/час доп.
  • 12 часов 30 минут транскрипции в месяц
  • Scribe v1/v2: $0.35/час (включённые часы)
  • Доп. часы: $0.48/час
  • Entity detection: +$0.105/час
  • Keyterm prompting: +$0.070/час
  • 90+ языков, speaker diarization
Популярный
Pro (~63 ч/мес включено)
$0.33/час включённых + $0.40/час доп.
  • 62 часа 51 минута транскрипции в месяц
  • Scribe v1/v2: $0.33/час (включённые часы)
  • Доп. часы: $0.40/час
  • Entity detection: +$0.099/час
  • Keyterm prompting: +$0.066/час
  • 90+ языков, расширенные лимиты
Scale (300 ч/мес включено)
$0.30/час включённых + $0.33/час доп.
  • 300 часов транскрипции в месяц
  • Scribe v1/v2: $0.30/час (включённые часы)
  • Доп. часы: $0.33/час
  • Entity detection: +$0.090/час
  • Keyterm prompting: +$0.060/час
  • Высокие лимиты параллельных запросов
Business (1100 ч/мес включено)
$0.22/час включённых + $0.22/час доп.
  • 1100 часов транскрипции в месяц
  • Scribe v1/v2: $0.22/час (включённые часы)
  • Доп. часы: $0.22/час
  • Entity detection: +$0.066/час
  • Keyterm prompting: +$0.044/час
  • SOC 2, HIPAA, GDPR compliance
Scribe v2 Realtime (отдельный тариф)
$0.48/час включённых, 10 ч в месяц
  • 10 часов Realtime-транскрипции включено
  • Задержка ~150 мс
  • 90+ языков в реальном времени
  • WebSocket/REST API
  • Предназначен для голосовых агентов и live-приложений
Enterprise (6000+ ч/мес)
Индивидуально
  • 6000+ часов транскрипции
  • Dedicated support и SLA
  • Кастомные rate limits и SSO
  • SOC 2, HIPAA, GDPR
  • EU Data Residency и Zero Retention
  • MSA и BAA по запросу
Российские карты не принимаются.Genova-ai — работает в РФ без VPN

Плюсы и минусы

✓ Плюсы
Первое место по точности среди всех моделей расшифровки в независимом замере Artificial Analysis: 2.2% ошибок против 2.4% у Microsoft, 2.9% у Gemini 2.5 Pro и 5.2% у Deepgram Nova-3
Разделяет говорящих — до 48 человек в записи. Расшифровка совещания приходит уже разложенной по репликам, а не сплошным текстом
Принимает список ваших терминов: до 1000 слов — фамилии, названия продуктов, профессиональный жаргон. Именно это чаще всего портит расшифровку у других моделей
Дешевле Whisper в API: $0.22 за час против $0.36 — при вдвое меньшем числе ошибок
Быстрая: коэффициент 59.5x, то есть час записи расшифровывается примерно за минуту
Есть версия реального времени с задержкой менее 150 мс — для живых титров и голосовых агентов
Помечает неречевые события в записи: смех, паузы, посторонние звуки
Находит персональные данные по 56 категориям — удобно, когда расшифровку нужно обезличить перед передачей
Более 90 языков, включая русский
✗ Минусы
ElevenLabs не работает в России напрямую: нужен VPN и зарубежная карта, российские не принимаются
Закрытая облачная модель — локального запуска нет в принципе, а значит запись обязательно уходит на чужой сервер. Для медицинских и юридических данных это может быть неприемлемо
Цена $0.22 за час — это тариф Business с 1100 часами в месяц. На младших планах час стоит $0.30-0.40
Определение сущностей и список терминов тарифицируются отдельно, сверх базовой цены за час
Версия реального времени дороже пакетной и на младших тарифах включает всего 10 часов в месяц
Нет русскоязычного интерфейса и документации

Подробный обзор

Что такое ElevenLabs Scribe v2

Scribe v2 — модель распознавания речи, которую ElevenLabs выпустила 9 января 2026 года. На сегодня это самая точная модель расшифровки на рынке, и это не маркетинговое заявление компании, а результат независимого замера Artificial Analysis.

Моделей на самом деле две: Scribe v2 для обработки готовых файлов и Scribe v2 Realtime для живой расшифровки с задержкой менее 150 миллисекунд.

Насколько она точнее остальных

По сводному индексу AA-WER (чем меньше, тем лучше) расстановка получилась такая:

  • ElevenLabs Scribe v2 — 2.2%
  • Microsoft MAI-Transcribe-1.5 — 2.4%
  • Mistral Voxtral Small — 2.8%
  • Google Gemini 2.5 Pro — 2.9%
  • AssemblyAI Universal-3 Pro — 3.1%
  • Deepgram Nova-3 — 5.2%

Разрыв с ближайшим преследователем невелик, а вот с нижней частью списка — двукратный. Ценность именно в том, что замер независимый: обычно такие таблицы публикуют сами разработчики, и верить им можно с оговорками.

Три вещи, которых нет у Whisper

Если сравнивать с Whisper — самой популярной бесплатной альтернативой, — Scribe v2 закрывает ровно те три пробела, из-за которых с Whisper обычно мучаются:

  • Разделение по говорящим — до 48 человек. Расшифровка совещания приходит уже разложенной по репликам, а не сплошной простынёй текста
  • Список ваших терминов — можно передать до 1000 слов: фамилии, названия продуктов, профессиональный жаргон. Именно на них модели обычно и спотыкаются
  • Работа в реальном времени — отдельная версия Realtime с задержкой менее 150 мс, тогда как Whisper умеет только обрабатывать готовые файлы

Дополнительно модель помечает неречевые события — смех, паузы, посторонние звуки — и находит персональные данные по 56 категориям, если расшифровку нужно обезличить.

Неожиданный момент с ценой

Обычно «самое точное» означает «самое дорогое». Здесь наоборот: Scribe v2 стоит $0.22 за час аудио против $0.36 за час у Whisper в API OpenAI. То есть модель одновременно вдвое точнее и в полтора раза дешевле.

Честная оговорка: $0.22 — это тариф Business с 1100 часами в месяц. На младших планах час выходит в $0.30-0.40, а определение сущностей и список терминов тарифицируются сверх базовой цены. Работает модель быстро — коэффициент 59.5x, то есть час записи расшифровывается примерно за минуту.

Когда она не подойдёт

Два ограничения, которые перевешивают любую точность в конкретных сценариях.

Первое — Россия. ElevenLabs напрямую не работает: нужен VPN и зарубежная карта, российские не принимаются. Это делает сервис неудобным для повседневной работы из РФ.

Второе — приватность. Модель закрытая и облачная, локального запуска нет в принципе. Запись обязательно уходит на чужой сервер, и для медицинских консультаций, юридических переговоров или внутренних совещаний это может быть неприемлемо независимо от сертификатов соответствия. В обоих случаях выбор — Whisper: он бесплатный, работает локально без интернета и данные никуда не отправляет, пусть и ошибается вдвое чаще.

Часто задаваемые вопросы

Правда ли Scribe v2 — самая точная модель расшифровки?
По независимому замеру Artificial Analysis — да, на момент проверки. Её индекс ошибок AA-WER составляет 2.2% против 2.4% у Microsoft MAI-Transcribe-1.5, 2.9% у Gemini 2.5 Pro и 5.2% у Deepgram Nova-3. Важно, что замер проводила независимая сторона, а не сам разработчик.
Scribe v2 или Whisper — что выбрать?
Scribe v2 точнее примерно вдвое, дешевле в API ($0.22 против $0.36 за час) и умеет три вещи, которых у Whisper нет: разделять говорящих, принимать список ваших терминов и работать в реальном времени. Но Whisper бесплатен при локальном запуске, работает в России без VPN и не отправляет запись на чужой сервер. Если приватность или доступ из РФ важнее точности — берите Whisper.
Сколько стоит Scribe v2?
$3.67 за 1000 минут аудио, то есть около $0.22 за час — но это тариф Business с 1100 включёнными часами в месяц. На младших планах час обходится в $0.30-0.40. Определение сущностей и список терминов оплачиваются отдельно сверх базовой цены. Версия реального времени стоит от $0.39 за час.
Работает ли Scribe v2 в России?
Напрямую нет. ElevenLabs требует VPN, а российские карты не принимает — нужна зарубежная карта или посредник. Русский язык модель понимает и входит в её 90+ языков, проблема именно в доступе к сервису и оплате.
Может ли Scribe v2 определить, кто говорит?
Да, и это одно из главных её преимуществ: до 48 говорящих в пакетном режиме и до 32 в реальном времени. Расшифровка совещания или интервью приходит уже разложенной по репликам. У Whisper такой возможности нет вовсе — там получается сплошной текст без разделения.
Чем Scribe v2 отличается от Scribe v2 Realtime?
Обычная версия обрабатывает готовые файлы и предназначена для длинных записей — подкастов, совещаний, юридических и медицинских материалов, там же доступно разделение до 48 говорящих. Realtime расшифровывает живую речь с задержкой менее 150 мс для голосовых агентов и живых титров, но стоит дороже и делит максимум на 32 говорящих.
Что даёт список терминов?
Возможность заранее передать модели до 1000 слов — фамилий, названий продуктов, профессионального жаргона, — чтобы она их не коверкала. Это самая частая причина испорченных расшифровок у моделей без такой функции: общеупотребительную речь они распознают хорошо, а на специфических терминах ошибаются. Учтите, что опция тарифицируется отдельно.
Насколько быстро идёт расшифровка?
Коэффициент скорости 59.5x — то есть час записи обрабатывается примерно за минуту. Для сравнения, у Deepgram Nova-3 этот показатель выше (522x), но точность заметно хуже: 5.2% ошибок против 2.2%.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно