Новость
OpenAI представила новые модели распознавания речи
OpenAI выпустила GPT Transcribe и GPT Live Transcribe для расшифровки аудио и потоковой речи. Обе модели доступны через API, поддерживают мультиязычный ввод и учитывают текстовый контекст, а также заданные ключевые слова.
OpenAI представила две новые модели распознавания речи: GPT Transcribe для работы с аудиофайлами и GPT Live Transcribe для потоковой расшифровки звука с минимальной задержкой. GPT Transcribe обрабатывает аудио примерно в 34 раза быстрее реального времени. По тестам Artificial Analysis на бенчмарке AA-WER модель показывает WER 3,3% — это на 0,7 пп лучше результата GPT-4o Transcribe. Обе модели доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод. В рейтинге AA-WER GPT Transcribe пока уступает лидерам: Fun-Realtime-ASR-Preview от Alibaba Group с 1,7%, ElevenLabs Scribe v2 с 2,2%, MAI-Transcribe-1.5 с 2,4%, Mistral Voxtral Small с 2,8% и Gemini 3.1 Pro с 2,8%. Вместе с релизом OpenAI снизила тарифы: минута обработки аудио стоит $0,0045, а для GPT Live Transcribe — $0.017.
-
OpenAI представила новые модели распознавания речи
Machinelearning
✔️ OpenAI представила новые модели распознавания речи GPT Transcribe предназначена для работы с аудиофайлами и обрабатывает их примерно в 34 раза быстрее реального времени. GPT Live Transcribe оптимизирована для потоковой расшифровки звука с минимальной задержкой. Оба решения доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод. По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe демонстрирует уровень ошибок в словах (WER) на отметке 3,3%. Это на 0,7 пп лучше результата ее предшественницы - GPT-4o Transcribe. Несмотря на улучшенные метрики, изделие OpenAI пока не дотягивает до лидеров. В рейтинге AA-WER первое место у Fun-Realtime-ASR-Preview от Alibaba Group с показателем 1,7% второе - у ElevenLabs Scribe v2 (2,2%), за ней следуют MAI-Transcribe-1.5 (2,4%), Mistral Voxtral Small (2,8%) и Gemini 3.1 Pro (2,8%). Вместе с релизом OpenAI снизила тарифы - минута обработки аудио обойдется в $0,0045, а для GPT Live Transcribe - $0.017. @ai_machinelearning_big_data #news #ai #ml