Консорциум немецких институтов и компаний выпустил полностью открытую модель Soofi S с архитектурой MoE. По отчёту разработчиков, она показала лучшие результаты среди открытых моделей на английских и немецких бенчмарках.

В Германии представили Soofi S — полностью открытую модель, которую консорциум институтов Fraunhofer, DFKI, немецких университетов и ИИ-компаний называет лучшей среди открытых на английских и немецких бенчмарках. Обучение прошло в Европе, на 512 Nvidia B200 в облаке Deutsche Telekom в Мюнхене. Модель содержит 31,6 млрд параметров, из которых на токен активируются 3,2 млрд. В основе — MoE-архитектура, заимствованная из Nemotron 3 Nano, с гибридом Mamba-2 и обычного attention; KV-кеш используется только в 6 слоях из 52. По данным разработчиков, это помогает удерживать скорость генерации на длинном контексте. Отдельно отмечается результат 73,8% на HumanEval — лучший среди открытых аналогов. Среди слабых мест авторы указывают конкурсную математику и извлечение фактов из длинного контекста.

Источники 1
  • В Германии представили открытую модель Soofi S Нейроканал
    Германия выпустила Soofi S, открытую модель, которая по отчёту консорциума обошла OLMo 3 32B и Apertus 70B и стала лучшей среди полностью открытых на английских и немецких бенчмарках. Обучение прошло целиком в Европе, на 512 Nvidia B200 в мюнхенском облаке Deutsche Telekom. За проектом стоит консорциум институтов Fraunhofer, DFKI, немецких университетов и ИИ-компаний.
    
    Внутри MoE на 31,6 млрд параметров, из которых на токен работают только 3,2 млрд. Архитектуру взяли у Nemotron 3 Nano: гибрид Mamba-2 и обычного attention, KV-кеш держат лишь 6 слоёв из 52. Поэтому на длинном контексте скорость почти не падает: от 4K до 256K токенов генерация остаётся ровной, а на 40K модель выдаёт примерно в 8 раз больше токенов в секунду на GPU, чем плотные модели на 14-24 млрд. В обучении 27 трлн токенов с повышенной долей немецкого. 
    
    По коду 73,8% на HumanEval, лучший результат среди открытых аналогов. Слабые места тоже задокументированы: конкурсная математика и выуживание фактов из длинного контекста.
    
    💻 Если хочется самому обучать и дообучать языковые модели, в Практикуме PRO есть курс по NLP: от BERT до современных LLM, обучение с оптимизацией операций на GPU, RAG и агентные системы, машинный перевод и NER.
    
    @neuro_channel