OpenAI и Alibaba выпустили новые голосовые ИИ-модели. Кто лучше понимает речь и быстрее отвечает?

 Разное   Июль 29, 2026

 Время чтения: ~3 мин.

OpenAI и Alibaba выпустили новые голосовые ИИ-модели. Кто лучше понимает речь и быстрее отвечает?

Именно в этом направлении сейчас разворачивается очередная битва между крупнейшими разработчиками ИИ.

OpenAI представила сразу две новые модели для работы с аудио: GPT Live Transcribe и GPT Transcribe. Параллельно Alibaba обновила собственную линейку голосовых моделей и выпустила Qwen Audio 3.0 Realtime Plus и Qwen Audio 3.0 Realtime Flash.

В OpenAI разделили задачи между двумя моделями. GPT Live Transcribe рассчитана на распознавание речи непосредственно во время разговора, когда важна минимальная задержка. GPT Transcribe, в свою очередь, предназначена для обработки уже записанных аудиофайлов и асинхронной пакетной транскрибации.

Обе модели получили улучшенную работу с контекстом, разработчики могут передавать дополнительные сведения о записи, включая ключевые слова, имена, специализированные термины и предполагаемый язык разговора. Это особенно полезно для профессиональных сфер, где обычная расшифровка может регулярно ошибаться в названиях компаний, продуктов или специфической терминологии.

GPT Live Transcribe умеет дополнительно учитывать предыдущие фрагменты уже расшифрованного диалога. За счет этого модель получает больше информации о происходящем разговоре и может точнее распознавать последующую речь.

По данным OpenAI, использование контекста действительно заметно влияет на результат. В тесте Context Aware ASR семантическая точность GPT Live Transcribe выросла с 38,5% до 44,6%, а GPT Transcribe показала улучшение с 41,6% до 45,2%.

В тестах на реальных аудиозаписях GPT Live Transcribe продемонстрировала уровень ошибок распознавания 9,60%. Для сравнения, GPT Realtime Whisper показала 11,65%. Еще более заметный прогресс продемонстрировала GPT Transcribe: ее показатель составил 8,98% против 15,21% у Whisper 1.

По оценке Artificial Analysis, GPT Transcribe достигла показателя ошибок по словам на уровне 3,31%. Стоимость использования модели установлена на уровне $4,50 за 1000 минут аудио.

Но Alibaba решила не просто наблюдать за происходящим со стороны. Компания представила Qwen Audio 3.0 Realtime Plus и Qwen Audio 3.0 Realtime Flash, ориентированные уже не столько на классическую расшифровку, сколько на полноценное голосовое взаимодействие с ИИ.

Новые модели поддерживают режим полного дуплекса. Проще говоря, разговор с ИИ становится более естественным: пользователь может перебить модель прямо во время ее ответа, а система продолжит взаимодействие без необходимости ждать окончания фразы. Также заявлена поддержка вызова функций и пользовательских клонированных голосов.

И здесь Alibaba уже может похвастаться результатом, который выглядит особенно интересно на фоне конкуренции с OpenAI.

Согласно данным Artificial Analysis, Qwen Audio 3.0 Realtime Plus возглавила Speech-to-Speech Index с результатом 84,1%. Для сравнения, OpenAI GPT Realtime 2.1 High набрала 79,1%.

Модель Alibaba также показала лучшие результаты в тестах, связанных с речевым рассуждением, динамикой диалога и агентскими возможностями.

Правда, у Qwen Audio 3.0 Realtime Plus есть и слабое место, модель заметно медленнее начинает отвечать. По данным Artificial Analysis, время до появления первого аудиосигнала составляет около четырех секунд. У GPT Realtime 2 High этот показатель находится примерно на уровне 1,14 секунды.

Alibaba сейчас демонстрирует более высокий результат в некоторых тестах качества голосового общения, тогда как OpenAI делает ставку на скорость реакции и развитие отдельных специализированных моделей для транскрибации.

И это еще один показатель того, насколько быстро меняется рынок голосового ИИ. Если раньше главным вопросом было, насколько хорошо нейросеть умеет распознавать человеческую речь, то теперь планка значительно выше, ведь ИИ должен понимать контекст, учитывать предыдущие реплики, быстро отвечать, поддерживать естественный диалог и не превращать разговор в последовательность «дождался ответа → договорил → снова дождался».

Похоже, следующий этап гонки ИИ будет проходить уже не только за лучшие текстовые модели. Голос становится полноценным интерфейсом взаимодействия с нейросетями, а OpenAI и Alibaba явно намерены занять здесь свои лидирующие позиции.

Авторские права © 2026 K-Tech News. Все права защищены.