Новость
Модель на 34 млн параметров для AI-агента в КОМПАС-3D показала рост точности до 79,6%
Разработчики представили модель на 34 млн параметров, обученную на 200 тысячах пар «задача → элемент КОМПАС API». По их данным, она лучше справляется с инженерными задачами, чем большие языковые модели, а дообучение заняло меньше пяти часов.
Чтобы AI-агент понимал инженера, разработчики поставили между ними не большую языковую модель, а компактную модель на 34 млн параметров. Она обучалась на 200 тысячах пар «формулировка задачи → элемент КОМПАС API» и, по описанию авторов, лучше справляется с задачами, чем более крупные модели. Особое внимание уделили данным: негативные примеры подбирались так, чтобы модель ошибалась на похожих методах, соседних get/set и кандидатах, которые базовая модель слишком часто ставила первыми. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 для запросов, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%. Поиск кандидатов — только первый этап. Затем каждый вариант проверяется через граф типов, константы берутся из настоящих DLL, код сверяется компилятором, а недокументированное поведение агент проверяет экспериментами в CAD-песочнице. В материале также приводятся логи, метрики трёх бенчмарков и объяснение, почему в продакшен выбрали именно первую версию модели.
-
Модель на 34 млн параметров для AI-агента в КОМПАС-3D показала рост точности до 79,6%
Habr AI
Запрещаем AI выдумывать методы КОМПАС-3D: 200К пар обучения, модель на 34М и KOMPAS Guard в одном процессе Чтобы AI-агент понимал инженера, индустрия предлагает поставить между ними еще одну большую языковую модель. Мы поставили модель на 34 млн параметров, в несколько десятков раз меньше, и она справляется лучше. Секрет в данных. 200 тысяч пар «формулировка задачи → элемент КОМПАС API», где негативные примеры подбирались специально коварные: одноименные методы разных интерфейсов, соседние get/set одного свойства, кандидаты, которых базовая модель ошибочно ставила на первое место. Дообучение заняло меньше пяти часов на одной видеокарте, а Hit@5 на запросах, где метод описан задачей, а не именем, вырос с 5,8% до 79,6%. Но поиск это только вход. Дальше каждый кандидат проходит через граф типов, константы берутся из настоящих DLL, код сверяет компилятор, а недокументированное поведение агент выясняет экспериментами в живом CAD: пишет зонд, запускает в песочнице, читает результат. Выдать догадку за факт ему негде, на каждом шаге его встречает проверка. В статье реальные логи, метрики трех бенчмарков, включая неудобные для нас, и объяснение, почему в продакшен пошла именно первая версия модели, а не две следующие. Читать далее #компас_3d #llm_агенты #семантический_поиск #эмбеддинги #дообучение_модели #галлюцинации_llm #cad #rag #com_api #бенчмарки | @habr_ai