OpenAI выпустила GPT Transcribe и GPT Live Transcribe для расшифровки аудио и потоковой речи. Обе модели доступны через API, поддерживают мультиязычный ввод и учитывают текстовый контекст, а также заданные ключевые слова.

OpenAI представила две новые модели распознавания речи: GPT Transcribe для работы с аудиофайлами и GPT Live Transcribe для потоковой расшифровки звука с минимальной задержкой. GPT Transcribe обрабатывает аудио примерно в 34 раза быстрее реального времени. По тестам Artificial Analysis на бенчмарке AA-WER модель показывает WER 3,3% — это на 0,7 пп лучше результата GPT-4o Transcribe. Обе модели доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод. В рейтинге AA-WER GPT Transcribe пока уступает лидерам: Fun-Realtime-ASR-Preview от Alibaba Group с 1,7%, ElevenLabs Scribe v2 с 2,2%, MAI-Transcribe-1.5 с 2,4%, Mistral Voxtral Small с 2,8% и Gemini 3.1 Pro с 2,8%. Вместе с релизом OpenAI снизила тарифы: минута обработки аудио стоит $0,0045, а для GPT Live Transcribe — $0.017.

Источники 1
  • OpenAI представила новые модели распознавания речи Machinelearning
    ✔️ OpenAI представила новые модели распознавания речи
    
    GPT Transcribe предназначена для работы с аудиофайлами и обрабатывает их примерно в 34 раза быстрее реального времени.
    
    GPT Live Transcribe оптимизирована для потоковой расшифровки звука с минимальной задержкой.
    
    Оба решения доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод.
    
    По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe демонстрирует уровень ошибок в словах (WER) на отметке 3,3%. Это на 0,7 пп лучше результата ее предшественницы - GPT-4o Transcribe.
    
    Несмотря на улучшенные метрики, изделие OpenAI пока не дотягивает до лидеров.
    
    В рейтинге AA-WER первое место у Fun-Realtime-ASR-Preview от Alibaba Group с показателем 1,7% второе - у ElevenLabs Scribe v2 (2,2%), за ней следуют MAI-Transcribe-1.5 (2,4%), Mistral Voxtral Small (2,8%) и Gemini 3.1 Pro (2,8%).
    
    Вместе с релизом OpenAI снизила тарифы -  минута обработки аудио обойдется в $0,0045, а для GPT Live Transcribe - $0.017.
    
    
    @ai_machinelearning_big_data
    
    #news #ai #ml