Qwen Audio 3.0 TTS поддерживает 16 языков, включая русский, умеет копировать голос по образцу и управлять интонацией с помощью текстовых инструкций. Модель также заняла первое место в рейтинге TTS от Artificial Analysis.

Alibaba выпустила Qwen Audio 3.0 TTS — модель для синтеза речи, которая озвучивает текст на 16 языках, включая русский. Она умеет копировать голос по аудиопримеру и сохранять тембр при генерации речи на других языках. Интонацию можно задавать обычными текстовыми инструкциями: например, попросить говорить быстрее, тише, испуганно или голосом ведущей утреннего радио. Также добавлены 86 тегов для точной настройки отдельных фраз. За один проход модель озвучивает до трёх минут текста, справляется с шумными, гулкими и плохо записанными образцами голоса и выдает аудио в качестве до 48 кГц. Модель пока не выложена в open source, доступ продаётся через Alibaba Cloud.

Источники 1
  • Alibaba представила Qwen Audio 3.0 TTS для синтеза речи GPT/ChatGPT/AI Central Александра Горного
    Alibaba представила Qwen Audio 3.0 TTS для синтеза речи
    
    Qwen Audio 3.0 TTS озвучивает текст на 16 языках, включая русский. Умеет копировать голос по аудиопримеру. Тембр сохраняется при генерации речи на другом языке. В Artificial Analysis TTS Leaderboard модель заняла 1-е место.
    
    Голосом можно управлять обычными инструкциями. Например, попросить говорить быстрее, тише, испуганно или голосом ведущей утреннего радио. Ещё добавили 86 тегов для точной настройки отдельных фраз.
    
    За один проход модель может озвучить до трёх минут текста. Она также справляется с шумными, гулкими и плохо записанными образцами голоса и выдаёт аудио в качестве до 48 кГц.
    
    Модель пока не выложили в open source. Доступ продают в Alibaba Cloud.
    
    https://funaudiollm.github.io/qwen-audio-3.0-tts/