Новость
Сбер открыл доступ к моделям распознавания речи GigaAM Multilingual и GigaChat Audio
Сбер представил две новые модели: GigaAM Multilingual для многоязычного распознавания речи и GigaChat Audio, объединяющую распознавание, перевод и диалог. Код и веса доступны на Hugging Face и GitHub.
Сбер открыл доступ к новым моделям распознавания речи — GigaAM Multilingual и GigaChat Audio. GigaAM Multilingual включает два компонента: аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR. Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ, что позволяет модели быстрее адаптироваться к новым языкам и требует меньше данных для дообучения. Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B. Код и веса модели доступны на Hugging Face и GitHub. GigaChat Audio — это большая языковая модель, объединяющая возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог. Сильная сторона модели — работа с длинными записями: на аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3, а объём контекста составляет до двух часов. Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni, а также распознаёт эмоции с точностью 90%+ по датасету Dusha. Код и веса модели доступны на Hugging Face.
-
Сбер открыл доступ к моделям распознавания речи GigaAM Multilingual и GigaChat Audio
Machinelearning
Сбер открыл доступ к новым моделям распознавания речи — GigaAM Multilingual и GigaChat Audio GigaAM Multilingual включает два компонента. Аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR. Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ. Поэтому модель быстрее адаптируется к новым языкам и требует меньше данных для дообучения. Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B. Забирайте код и веса модели на Hugging Face и GitHub: GigaAM Multilingual на Hugging Face GigaAM Multilingual на GitHub В свою очередь, GigaChat Audio — это большая языковая модель, которая объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог. Её сильная сторона — работа с длинными записями. На аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3. При этом объём контекста составляет до двух часов. Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni. А ещё распознаёт эмоции с точностью 90%+ по датасету Dusha. Забирайте код и веса модели на Hugging Face: GigaChat Audio на Hugging Face