Новость
Топ трендов HuggingFace за неделю — что приехало в опенсорс
Топ трендов HuggingFace за неделю — что приехало в опенсорс TL;DR Новое: LongCat-2.0 от Meituan — MoE на 1,6 трлн параметров под MIT, обученная целиком на ASIC-суперподах. Hy3 от Tencent — открытые веса 295B, разбирал отдельным постом. MOSS-Transcribe-Diarize — транскрибация с разметкой говорящих на 0,9B, по точности обходит GPT-4o и Gemini 3 Pro. Audex от NVIDIA — весь аудио-стек в одной модели. ThinkingCap — файнтюн Qwen3.6, режущий рассуждения вдвое без потери качества. Giga-World-1 — world model для управляемого видео. Две identity-LoRA: krea2-identity-edit для картинок и LTX Best Face I
Топ трендов HuggingFace за неделю — что приехало в опенсорс TL;DR Новое: LongCat-2.0 от Meituan — MoE на 1,6 трлн параметров под MIT, обученная целиком на ASIC-суперподах. Hy3 от Tencent — открытые веса 295B, разбирал отдельным постом. MOSS-Transcribe-Diarize — транскрибация с разметкой говорящих на 0,9B, по точности обходит GPT-4o и Gemini 3 Pro. Audex от NVIDIA — весь аудио-стек в одной модели. ThinkingCap — файнтюн Qwen3.6, режущий рассуждения вдвое без потери качества. Giga-World-1 — world model для управляемого видео. Две identity-LoRA: krea2-identity-edit для картинок и LTX Best Face ID для видео. В квантах DeepSeek-V4-Flash от Unsloth, сжатый Nemotron Puzzle 75B, файнтюн MiniCPM5 на данных Fable 5 и фикс-шаблоны Qwen. Держится: Qwythos-9B, GLM-5.2, Unlimited-OCR, Agents-A1, TabFM, Qwen3.6 Uncensored, Ornith-1.0, агентный файнтюн yuxinlu1. LLM и агенты LongCat-2.0 — Meituan выложила MoE на 1,6 трлн параметров (48 млрд активных) под MIT. Контекст 1 млн токенов, претрейн свыше 35 трлн токенов, и весь тренинг с деплоем прошёл на ASIC-суперподах вместо GPU. Внутри собственный вариант sparse attention и N-gram эмбеддинги на 135 млрд параметров. На бенчмарках спорит с проприетарными флагманами: Terminal-Bench 70,8, SWE-bench Multilingual 77,3, GPQA-diamond 88,9. Попробовать можно в чате longcat.ai. Hy3 — Tencent открыла веса 295B MoE (21 млрд активных) под Apache 2.0: контекст 256K, три режима рассуждений, ставка на надёжность в агентных сценариях. Разбирал отдельным постом. ThinkingCap-Qwen3.6-27B — файнтюн Qwen3.6-27B от BottleCap AI под экономные рассуждения: точность базы сохраняется, а thinking-токенов в среднем вдвое меньше. На GSM8K сокращение 74,1%, на GPQA-Diamond 67,8%, а на LiveCodeBench точность даже выросла с 80,7 до 84,3. Есть FP8 и GGUF-сборки. Речь и звук MOSS-Transcribe-Diarize — модель на 0,9B от OpenMOSS, которая за один проход делает транскрибацию, разметку говорящих, таймстемпы и акустические события, без отдельного диаризационного пайплайна. По cpCER обходит GPT-4o, Gemini 3 Pro и ElevenLabs. Обслуживается через vLLM по OpenAI-совместимому API. Только английский и китайский. Nemotron Audex — NVIDIA собрала весь аудио-стек в одной MoE на 30B (3B активных): распознавание и перевод речи, синтез, генерация аудио и речь-в-речь, при этом текстовые способности базовой модели не просели. Контекст 1 млн токенов. Лицензия только некоммерческая, язык только английский. Картинки и видео krea2-identity-edit — LoRA для Krea 2: редактирование картинки по текстовой инструкции с сохранением личности человека, вплоть до отдельных родинок; остальное изображение не трогается. Работает в ComfyUI через отдельные ноды, автор подробно перечисляет ограничения. LTX Best Face ID — LoRA для видеомодели LTX-2.3 на 22B: по одной фотографии и промпту генерирует видео с этим человеком. Отдельный режим принимает character sheet из четырёх ракурсов и переносит ещё одежду и телосложение. Есть демо-Space. Giga-World-1 — world model для управляемой генерации видео от GigaAI поверх WAN FunControl: линейки на 1,3B и 5B, полные чекпоинты и scene-LoRA, прицел на робототехнику. Apache 2.0. Кванты и сообщество DeepSeek выпустила V4 Flash, и в топ въехали кванты Unsloth: MoE 284B с 13B активных, нативный контекст 1 млн токенов и три режима рассуждений, лицензия MIT. NVIDIA выложила Nemotron Puzzle 75B — Nemotron-3-Super на 120B, сжатую до 75B почти без потери точности и с примерно вдвое большей пропускной способностью. Фикс-шаблоны Qwen от froggeric — один Jinja-файл, который чинит зависания и лишний расход токенов в агентных циклах Qwen 3.5/3.6; 878 лайков при нуле скачиваний, файл просто копируют руками. Там же файнтюн MiniCPM5-1B на данных Fable 5 с квантами под llama.cpp и 128K контекста на одном миллиарде параметров. Держится в топе Qwythos-9B с миллионным контекстом всё ещё первый по загрузкам, GLM-5.2 остаётся сильнейшей открытой моделью по кодингу. Там же Unlimited-OCR от Baidu, агент Agents-A1, табличная TabFM от Google, Qwen3.6 Uncensored, кодинг-линейка Ornith-1.0 и агентный файнтюн yuxinlu1. Хорошей недели! 👾 @neuro_channel
-
Топ трендов HuggingFace за неделю — что приехало в опенсорс
Нейроканал
Топ трендов HuggingFace за неделю — что приехало в опенсорс TL;DR Новое: LongCat-2.0 от Meituan — MoE на 1,6 трлн параметров под MIT, обученная целиком на ASIC-суперподах. Hy3 от Tencent — открытые веса 295B, разбирал отдельным постом. MOSS-Transcribe-Diarize — транскрибация с разметкой говорящих на 0,9B, по точности обходит GPT-4o и Gemini 3 Pro. Audex от NVIDIA — весь аудио-стек в одной модели. ThinkingCap — файнтюн Qwen3.6, режущий рассуждения вдвое без потери качества. Giga-World-1 — world model для управляемого видео. Две identity-LoRA: krea2-identity-edit для картинок и LTX Best Face ID для видео. В квантах DeepSeek-V4-Flash от Unsloth, сжатый Nemotron Puzzle 75B, файнтюн MiniCPM5 на данных Fable 5 и фикс-шаблоны Qwen. Держится: Qwythos-9B, GLM-5.2, Unlimited-OCR, Agents-A1, TabFM, Qwen3.6 Uncensored, Ornith-1.0, агентный файнтюн yuxinlu1. LLM и агенты LongCat-2.0 — Meituan выложила MoE на 1,6 трлн параметров (48 млрд активных) под MIT. Контекст 1 млн токенов, претрейн свыше 35 трлн токенов, и весь тренинг с деплоем прошёл на ASIC-суперподах вместо GPU. Внутри собственный вариант sparse attention и N-gram эмбеддинги на 135 млрд параметров. На бенчмарках спорит с проприетарными флагманами: Terminal-Bench 70,8, SWE-bench Multilingual 77,3, GPQA-diamond 88,9. Попробовать можно в чате longcat.ai. Hy3 — Tencent открыла веса 295B MoE (21 млрд активных) под Apache 2.0: контекст 256K, три режима рассуждений, ставка на надёжность в агентных сценариях. Разбирал отдельным постом. ThinkingCap-Qwen3.6-27B — файнтюн Qwen3.6-27B от BottleCap AI под экономные рассуждения: точность базы сохраняется, а thinking-токенов в среднем вдвое меньше. На GSM8K сокращение 74,1%, на GPQA-Diamond 67,8%, а на LiveCodeBench точность даже выросла с 80,7 до 84,3. Есть FP8 и GGUF-сборки. Речь и звук MOSS-Transcribe-Diarize — модель на 0,9B от OpenMOSS, которая за один проход делает транскрибацию, разметку говорящих, таймстемпы и акустические события, без отдельного диаризационного пайплайна. По cpCER обходит GPT-4o, Gemini 3 Pro и ElevenLabs. Обслуживается через vLLM по OpenAI-совместимому API. Только английский и китайский. Nemotron Audex — NVIDIA собрала весь аудио-стек в одной MoE на 30B (3B активных): распознавание и перевод речи, синтез, генерация аудио и речь-в-речь, при этом текстовые способности базовой модели не просели. Контекст 1 млн токенов. Лицензия только некоммерческая, язык только английский. Картинки и видео krea2-identity-edit — LoRA для Krea 2: редактирование картинки по текстовой инструкции с сохранением личности человека, вплоть до отдельных родинок; остальное изображение не трогается. Работает в ComfyUI через отдельные ноды, автор подробно перечисляет ограничения. LTX Best Face ID — LoRA для видеомодели LTX-2.3 на 22B: по одной фотографии и промпту генерирует видео с этим человеком. Отдельный режим принимает character sheet из четырёх ракурсов и переносит ещё одежду и телосложение. Есть демо-Space. Giga-World-1 — world model для управляемой генерации видео от GigaAI поверх WAN FunControl: линейки на 1,3B и 5B, полные чекпоинты и scene-LoRA, прицел на робототехнику. Apache 2.0. Кванты и сообщество DeepSeek выпустила V4 Flash, и в топ въехали кванты Unsloth: MoE 284B с 13B активных, нативный контекст 1 млн токенов и три режима рассуждений, лицензия MIT. NVIDIA выложила Nemotron Puzzle 75B — Nemotron-3-Super на 120B, сжатую до 75B почти без потери точности и с примерно вдвое большей пропускной способностью. Фикс-шаблоны Qwen от froggeric — один Jinja-файл, который чинит зависания и лишний расход токенов в агентных циклах Qwen 3.5/3.6; 878 лайков при нуле скачиваний, файл просто копируют руками. Там же файнтюн MiniCPM5-1B на данных Fable 5 с квантами под llama.cpp и 128K контекста на одном миллиарде параметров. Держится в топе Qwythos-9B с миллионным контекстом всё ещё первый по загрузкам, GLM-5.2 остаётся сильнейшей открытой моделью по кодингу. Там же Unlimited-OCR от Baidu, агент Agents-A1, табличная TabFM от Google, Qwen3.6 Uncensored, кодинг-линейка Ornith-1.0 и агентный файнтюн yuxinlu1. Хорошей недели! 👾 @neuro_channel