OpenAI анонсировала две новые модели для преобразования речи в текст — GPT-Live-Transcribe и GPT-Transcribe. Первая предназначена для работы в режиме реального времени с минимальной задержкой, тогда как вторая оптимизирована для обработки готовых аудиофайлов и пакетной транскрипции. Обе модели получили улучшенное понимание контекста, что позволяет более точно распознавать термины, собственные имена и разные языки, согласно данным neowin.net.
Согласно OpenAI, использование контекста заметно повышает качество транскрипции. Компания также заявляет о более низком уровне ошибок по сравнению с предыдущими моделями Whisper. Независимое тестирование Artificial Analysis подтвердило высокую точность GPT-Transcribe, а стоимость использования модели составляет 4,5 доллара за 1000 минут аудио.
В то же время Alibaba представила новые модели Qwen-Audio-3. 0-Realtime Plus и Flash, которые работают в формате «вещание — вещание». Они поддерживают естественный диалог в реальном времени, позволяют пользователю прерывать искусственный интеллект во время ответа, а также поддерживают вызов функций и создание персонализированных клонов голоса.
По рейтингу Artificial Analysis модель Qwen-Audio-3. 0 — Realtime Plus сейчас опережает решение OpenAI по качеству взаимодействия «вещание-вещание», набрав 84,1% против 79,1% у GPT-Realtime-2. 1 High. В то же время модель Alibaba уступает по скорости: ее ответ начинается примерно через четыре секунды, тогда как решение OpenAI реагирует чуть более чем за одну секунду.

