OpenAI
ГолосOpenAIGPT-Live-1голосовой AIfull-duplexAPI

OpenAI открыла GPT-Live-1: голосовой API, который слушает и говорит одновременно

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
OpenAI открыла GPT-Live-1: голосовой API, который слушает и говорит одновременно

Конец эпохи "говори - жди - слушай"

Если вы когда-нибудь разговаривали с голосовым ботом и ловили ощущение, что тот тебя не слышит, пока сам не замолчит, - теперь у этой проблемы есть технический ответ. 10 сентября 2026 года OpenAI открыла GPT-Live-1 для разработчиков через API. Модель работает в режиме полного дуплекса: она одновременно слушает и говорит, как живой собеседник, а не как колл-центр 2010-х.

Модель уже несколько месяцев работает внутри ChatGPT - туда ее запустили еще в июле. Теперь те же возможности получают сторонние разработчики.

Что изменилось технически

Традиционная голосовая архитектура - это конвейер из трех отдельных систем: распознавание речи, языковая модель, синтез речи. Каждый переход между ними добавляет задержку и создает точку, где теряется контекст или ритм разговора. Один из разработчиков, внедривших GPT-Live-1, сообщил, что переход с каскадной схемы сократил кодовую базу на 80% и убрал 23 тысячи строк кода.

GPT-Live-1 обрабатывает входящий и исходящий звук в одной модели. Прерывания, паузы, фоновый шум, "угу" и "да-да" в середине ответа - все это модель обрабатывает в реальном времени, не сбиваясь и не начиная говорить заново. Более сложные задачи - поиск, рассуждение, вызов инструментов - делегируются бэкенд-модели: это может быть GPT-6 Astra для сложных запросов или более легкая Luna для рутинных задач вроде записи и обновления заказов. Бэкенд может быть и сторонним.

Цифры бенчмарков

OpenAI публикует сравнение с предыдущей моделью GPT-Realtime-2.1, и разрыв там большой.

По тесту Full Duplex Bench v1.5 Interactivity, который проверяет реакцию на прерывания, фоновые разговоры и сигналы слушателя, GPT-Live-1 набирает 80.1% против 45.4% у предшественника. Задержка перехода хода разговора сократилась с 1.41 секунды до 0.8 секунды. Точность вызова инструментов выросла с 60% до 87%.

В банковском бенчмарке Tau Banking (Voice) по 97 задачам знания продуктов результат вырос с 12.4% до 32%. В более широком Tau3 (Voice), который охватывает сценарии авиа-, розничного и телеком-обслуживания, GPT-Live-1 в связке с Astra показал 86.2% против 45.7% у GPT-Realtime-2.1. Это уже другой класс.

По Artificial Analysis Conversational Dynamics - тест на паузы, перебивания, очередность реплик - модель набрала 97.3% против 95.7% у предшественника. Разница меньше, но базовый уровень здесь и так был высокий.

Кто уже использует

Yelp интегрировал GPT-Live-1 в Yelp Host и Hatch - системы телефонного приема резервации и заказов еды. Технический директор Алекс Леви отмечает, что качество обработки звонков выросло, а звонящие стали говорить более полными фразами - то есть перестали "подстраиваться" под ограничения бота.

Сервис изучения языков Speak сообщает о снижении нежелательных прерываний на почти 80% по сравнению с прежней пошаговой системой: модель лучше распознает, что пользователь еще думает и не закончил фразу. Для языкового тьютора это принципиально - ученик должен успевать формулировать мысль.

Cognition использует GPT-Live-1 с AI-инженером Devin: разработчики могут проговаривать идеи вслух, уточнять подходы и передавать задачи голосом, не прикасаясь к клавиатуре.

Цена и доступность

Стоимость - $0.05 за минуту. Для сравнения: звонок длительностью 10 минут обойдется в $0.50. При высоком объеме - сотнях тысяч минут в месяц - это ощутимые затраты, и бизнес-кейс нужно считать аккуратно. Для нишевых применений вроде языкового обучения или медицинской записи цена выглядит разумной. Для массового колл-центра с миллионами минут в месяц - уже серьезная статья расходов.

Модель поставляется с двенадцатью новыми голосами с разными акцентами, диалектами и языками. ASR-транскрипты и текст ответов доступны из коробки. Разработчикам, которым нужны кастомные голоса, придется обращаться в коммерческий отдел OpenAI отдельно.

Что это значит для рынка

GPT-Live-1 выходит на рынок, где уже работают ElevenLabs с Conversational AI, Hume с EVI и несколько стартапов вроде Sesame. Но у OpenAI здесь структурное преимущество: разработчики могут напрямую подключить голосовой слой к тем же моделям, с которыми уже работают в тексте, через единый API и единый биллинг.

OpenAI прямо говорит, что видит голос как основной интерфейс к вычислениям для сложной агентной работы. Это не просто слова - архитектура GPT-Live-1 с делегированием на бэкенд как раз и позволяет вести долгий голосовой разговор, пока в фоне выполняется реальная задача.

Для российских разработчиков

OpenAI API по-прежнему недоступен напрямую из России - для работы нужны VPN и карта зарубежного банка или посредник. Ситуация не изменилась с предыдущих релизов. Те, кто уже работает с Realtime API через обходные схемы, смогут перейти на GPT-Live-1 по той же схеме.

Информация о релизе подтверждена несколькими независимыми публикациями, включая официальный блог OpenAI и профильные технические издания.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости