Новость
Mistral представила Shieldstral — компактную модель для модерации контента с гибкой политикой
Mistral выпустила Shieldstral — модель на 3 млрд параметров для модерации контента под лицензией Apache 2.0. Она работает на одной видеокарте с 16 ГБ и позволяет задавать политику проверки текстом в момент запроса.
Mistral выложила Shieldstral — модель на 3 млрд параметров для модерации контента под лицензией Apache 2.0. Она помещается на одну видеокарту с 16 ГБ и рассчитана на запуск прямо на устройстве. В отличие от обычных моделей-фильтров с фиксированной таксономией, здесь политика задаётся словами в момент запроса. В <Instruct> указывается контекст проверки и строгость, в <Query> — один вопрос с ответом «да» или «нет», а в <Document> передаётся то, что нужно проверить: запрос пользователя, ответ модели, их пара или изображение с текстом. Модель за один проход смотрит только на логиты yes и no и нормализует их софтмаксом в оценку безопасности. На выходе получается число, по которому можно выставить порог и сортировать по уверенности. Такой подход применяется для классификации запросов, модерации ответов, детекции отказов, токсичности и изображений. По замерам Mistral на текстовой безопасности, детекции отказов, переносе на новые политики и мультимодальных тестах Shieldstral держится на уровне открытых моделей-фильтров в 7 раз крупнее. Веса доступны на Hugging Face, а детали устройства и обучения описаны в анонсе и техническом отчёте.
-
Mistral представила Shieldstral — компактную модель для модерации контента с гибкой политикой
Нейроканал
Mistral выложила Shieldstral, модель на 3 млрд параметров для модерации контента под Apache 2.0. Помещается на одну видеокарту с 16 ГБ и рассчитана на запуск прямо на устройстве. Обычные модели-фильтры носят в себе фиксированную таксономию: список запрещённых категорий зашит на обучении, под свои правила её приходится дообучать. Здесь политика пишется словами в момент запроса. В <Instruct> идёт контекст проверки и строгость, в <Query> один вопрос с ответом да или нет («Этот контент призывает к насилию?»), в <Document> то, что проверяем: запрос пользователя, ответ модели, пару из них или картинку с текстом. Модель за один проход смотрит только на логиты yes и no и нормализует их софтмаксом в оценку безопасности. На выходе получается число, по которому ставят свой порог и сортируют по уверенности. Одной формулировкой закрываются классификация запросов, модерация ответов, детекция отказов, токсичность и картинки. По замерам Mistral на текстовой безопасности, детекции отказов, переносе на новые политики и мультимодальных тестах Shieldstral держится вровень с открытыми моделями-фильтрами в 7 раз крупнее. Веса лежат на Hugging Face, про устройство и обучение рассказали в анонсе и техотчёте. @neuro_channel