Исследователи из MWS AI и нескольких университетов предложили способ построения синтетического датасета для машинного перевода смешанных русско-казахских текстов. Модель, обученная на синтетических данных, обошла коммерческие системы в реальном сценарии.

В Казахстане в повседневной речи, переписке и соцсетях часто смешивают казахский и русский языки. Для таких фраз почти нет данных, поэтому обычные системы машинного перевода работают нестабильно. В работе коллег из MWS AI и нескольких университетов предложен подход к генерации синтетического датасета на основе существующих параллельных корпусов на казахском и русском языках. Авторы отмечают, что в условиях нехватки размеченных данных синтетика помогает обучать модели для этой узкой, но практической задачи. По результатам ручной оценки модель, обученная на синтетических данных, обошла известные коммерческие системы в реальном сценарии.

Источники 1
  • Метод генерации синтетического датасета улучшил перевод смешанных русско-казахских текстов Habr AI
    Как переводить смешанный русский-казахский и не сойти с ума
    
    В Казахстане часто смешивают казахский и русский в соцсетях, переписке, быту. Но попробуйте скормить русско-казахскую фразу любой системе машинного перевода (Machine Translation), и она начнёт чудить. Не потому, что она глупая,  а потому что данных для обучения моделей переводить такую языковую кашу почти нет.
    
    В этот раз разбираю научную работу коллег из MWS AI и нескольких университетов, в которой они предложили подход для генерации синтетического датасета под эту задачу на базе уже существующих обычных параллельных корпусов на казахском и русском. Да, это синтетические данные, но в условиях, когда альтернативы нет, это спасает. Их модель, обученная на синтетике, обошла известные коммерческие системы (ручная оценка) в узком, но реальном сценарии. Велком под кат
    
    #simalign #датасеты #датасеты_обучения #машинный_перевод #языковые_модели #llm #казахский_язык #nlp #исследования #синтетические_данные | @habr_ai