OpenAI открыла GPT-Live-1: голосовой API, который слушает и говорит одновременно

Конец эпохи "говори - жди - слушай"
Если вы когда-нибудь разговаривали с голосовым ботом и ловили ощущение, что тот тебя не слышит, пока сам не замолчит, - теперь у этой проблемы есть технический ответ. 10 сентября 2026 года OpenAI открыла GPT-Live-1 для разработчиков через API. Модель работает в режиме полного дуплекса: она одновременно слушает и говорит, как живой собеседник, а не как колл-центр 2010-х.
Модель уже несколько месяцев работает внутри ChatGPT - туда ее запустили еще в июле. Теперь те же возможности получают сторонние разработчики.
Что изменилось технически
Традиционная голосовая архитектура - это конвейер из трех отдельных систем: распознавание речи, языковая модель, синтез речи. Каждый переход между ними добавляет задержку и создает точку, где теряется контекст или ритм разговора. Один из разработчиков, внедривших GPT-Live-1, сообщил, что переход с каскадной схемы сократил кодовую базу на 80% и убрал 23 тысячи строк кода.
GPT-Live-1 обрабатывает входящий и исходящий звук в одной модели. Прерывания, паузы, фоновый шум, "угу" и "да-да" в середине ответа - все это модель обрабатывает в реальном времени, не сбиваясь и не начиная говорить заново. Более сложные задачи - поиск, рассуждение, вызов инструментов - делегируются бэкенд-модели: это может быть GPT-6 Astra для сложных запросов или более легкая Luna для рутинных задач вроде записи и обновления заказов. Бэкенд может быть и сторонним.
Цифры бенчмарков
OpenAI публикует сравнение с предыдущей моделью GPT-Realtime-2.1, и разрыв там большой.
По тесту Full Duplex Bench v1.5 Interactivity, который проверяет реакцию на прерывания, фоновые разговоры и сигналы слушателя, GPT-Live-1 набирает 80.1% против 45.4% у предшественника. Задержка перехода хода разговора сократилась с 1.41 секунды до 0.8 секунды. Точность вызова инструментов выросла с 60% до 87%.
В банковском бенчмарке Tau Banking (Voice) по 97 задачам знания продуктов результат вырос с 12.4% до 32%. В более широком Tau3 (Voice), который охватывает сценарии авиа-, розничного и телеком-обслуживания, GPT-Live-1 в связке с Astra показал 86.2% против 45.7% у GPT-Realtime-2.1. Это уже другой класс.
По Artificial Analysis Conversational Dynamics - тест на паузы, перебивания, очередность реплик - модель набрала 97.3% против 95.7% у предшественника. Разница меньше, но базовый уровень здесь и так был высокий.
Кто уже использует
Yelp интегрировал GPT-Live-1 в Yelp Host и Hatch - системы телефонного приема резервации и заказов еды. Технический директор Алекс Леви отмечает, что качество обработки звонков выросло, а звонящие стали говорить более полными фразами - то есть перестали "подстраиваться" под ограничения бота.
Сервис изучения языков Speak сообщает о снижении нежелательных прерываний на почти 80% по сравнению с прежней пошаговой системой: модель лучше распознает, что пользователь еще думает и не закончил фразу. Для языкового тьютора это принципиально - ученик должен успевать формулировать мысль.
Cognition использует GPT-Live-1 с AI-инженером Devin: разработчики могут проговаривать идеи вслух, уточнять подходы и передавать задачи голосом, не прикасаясь к клавиатуре.
Цена и доступность
Стоимость - $0.05 за минуту. Для сравнения: звонок длительностью 10 минут обойдется в $0.50. При высоком объеме - сотнях тысяч минут в месяц - это ощутимые затраты, и бизнес-кейс нужно считать аккуратно. Для нишевых применений вроде языкового обучения или медицинской записи цена выглядит разумной. Для массового колл-центра с миллионами минут в месяц - уже серьезная статья расходов.
Модель поставляется с двенадцатью новыми голосами с разными акцентами, диалектами и языками. ASR-транскрипты и текст ответов доступны из коробки. Разработчикам, которым нужны кастомные голоса, придется обращаться в коммерческий отдел OpenAI отдельно.
Что это значит для рынка
GPT-Live-1 выходит на рынок, где уже работают ElevenLabs с Conversational AI, Hume с EVI и несколько стартапов вроде Sesame. Но у OpenAI здесь структурное преимущество: разработчики могут напрямую подключить голосовой слой к тем же моделям, с которыми уже работают в тексте, через единый API и единый биллинг.
OpenAI прямо говорит, что видит голос как основной интерфейс к вычислениям для сложной агентной работы. Это не просто слова - архитектура GPT-Live-1 с делегированием на бэкенд как раз и позволяет вести долгий голосовой разговор, пока в фоне выполняется реальная задача.
Для российских разработчиков
OpenAI API по-прежнему недоступен напрямую из России - для работы нужны VPN и карта зарубежного банка или посредник. Ситуация не изменилась с предыдущих релизов. Те, кто уже работает с Realtime API через обходные схемы, смогут перейти на GPT-Live-1 по той же схеме.
Информация о релизе подтверждена несколькими независимыми публикациями, включая официальный блог OpenAI и профильные технические издания.
Похожие новости
Apple переписала Siri на базе Gemini - но не для Европы
После многолетних задержек Apple выпустила полностью переработанного Siri на движке Google Gemini. Европейские пользователи iPhone и iPad остались за бортом из-за разногласий с регуляторами ЕС.
iOS 27 вернул мне Siri: как Apple наконец сдержала обещание
Два года задержек, смена движка на Google Gemini и полный переход в отдельное приложение - Siri в iOS 27 стал тем, чем должен был быть еще в 2024-м.
Google Assistant умрет 4 сентября: Gemini или ничего
Google официально объявила дату смерти Assistant на Android - 4 сентября 2026 года. Миллионы пользователей переведут на Gemini принудительно, без права вернуться назад.