Сбер выложил в открытый доступ аудио-native модель GigaChat Audio и мультиязычную модель распознавания речи GigaAM Multilingual. Обе разработки приняты на Interspeech 2026.

Сбер сообщил о публикации в Open Source двух моделей для работы со звуком: аудио-native языковой модели GigaChat Audio и мультиязычной системы распознавания речи GigaAM Multilingual. Обе разработки прошли рецензирование и будут представлены на конференции Interspeech 2026. GigaChat Audio умеет обрабатывать аудиозаписи длительностью до 2 часов, удерживать контекст, находить нужные фрагменты, пересказывать их и делать саммари с таймкодами. Модель также распознаёт эмоции по интонации и манере речи, поддерживает multi-turn диалог, перевод, классификацию аудио и распознавание речи. GigaAM Multilingual — расширение предыдущей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский языки. Компактная версия с 240 млн параметров превосходит Whisper Large v3 и Omnilingual 1B. Обе модели уже интегрированы в GigaChat: пользователи могут общаться голосом, отправлять голосовые сообщения и аудиофайлы. Разработчикам доступны исходные коды GigaChat Audio и GigaAM Multilingual, а также датасет TimeGround-1M.

Источники 1
  • Сбер открыл исходный код моделей GigaChat Audio и GigaAM Multilingual Sber AI
    🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ
    
    Мы выложили в Open Source сразу две модели для работы со звуком: audio-native LLM GigaChat Audio и мультиязычное SOTA-распознавание речи GigaAM Multilingual. Обе работы приняты на Interspeech 2026 — главную мировую конференцию по речевым технологиям 🔥
    
    Чем силён GigaChat Audio?
    
    🤩 Понимает длинные записи
    
    
    Держит контекст до 2 часов аудио и свободно ориентируется внутри: находит момент, где обсуждали нужную тему, пересказывает фрагмент, собирает саммари с таймкодами. На записях 20–60 минут точность локализации событий — 48.3 IoU против ~0 у Voxtral, Phi-4 и Qwen3-Omni
    🤩 Считывает эмоции 
    
    
    По интонации и манере речи распознаёт настроение говорящего — 90%+ на бенчмарке Dusha — и учитывает его в ответе
    🤩 Распознаёт русский на слух лучше аналогов
    
    
    RuBQ-Audio: 60,0 против 43,7 у Qwen3-Omni. А ещё — multi-turn диалог, перевод, классификация аудио и распознавание речи в одной модели
    
    GigaAM Multilingual —
    расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский. Компактная версия на 240M параметров обгоняет Whisper Large v3 и Omnilingual 1B, а аудиоэнкодер, предобученный на 2 млн часов речи на 70+ языках, адаптируется к новым языкам с минимумом данных: на грузинском и башкирском хватило одного Common Voice, чтобы дойти до WER ~4% против 11%+ у Whisper
    
    Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026
    
    Модели уже работают в ГигаЧате: общайтесь голосом, присылайте голосовые сообщения и аудиофайлы. 
    
    Разработчикам предлагаем забрать GigaChat Audio и GigaAM Multilingual в Open Source вместе с датасетом TimeGround-1M 
    
    А если интересна техническая часть, читайте пост команды ↖️
    
    ✔️ Подписывайтесь на Sber AI в МАКС