Новость
🌟Исследователи лаборатории научных исследований Т-Технологий предложили единый подход для сравнения методов дообучения LLM
🌟Исследователи лаборатории научных исследований Т-Технологий предложили единый подход для сравнения методов дообучения LLM Работу представили на ICML 2026. Исследователи сравнили методы дообучения больших языковых моделей, которые учатся на заранее подготовленных парах ответов, и показали, что различия между современными методами дообучения определяются типом ранжирования ответов – попарным или поточечным. 🟡Что именно предложили Чтобы сделать сравнение корректным, исследователи привели разные методы к единому протоколу оценки. Дополнительно в методы был введен параметр β: он регулирует сил
🌟Исследователи лаборатории научных исследований Т-Технологий предложили единый подход для сравнения методов дообучения LLM Работу представили на ICML 2026. Исследователи сравнили методы дообучения больших языковых моделей, которые учатся на заранее подготовленных парах ответов, и показали, что различия между современными методами дообучения определяются типом ранжирования ответов – попарным или поточечным. 🟡Что именно предложили Чтобы сделать сравнение корректным, исследователи привели разные методы к единому протоколу оценки. Дополнительно в методы был введен параметр β: он регулирует силу дообучения на человеческих предпочтениях и позволяет более объективно сравнивать методы между собой. 🟡«Мы доказали, что такие сравнения не всегда корректны, и результат может зависеть в том числе от настроек эксперимента, объема данных или этапов обучения. Мы предложили единый подход, который позволяет сравнить методы в одинаковых условиях и понять, какие факторы действительно влияют на качество», — отметил Даниил Гаврилов, руководитель лаборатории Т-Технологий. 🟡Результаты сравнения Исследование показало, что многие заявленные преимущества алгоритмов выравнивания стираются, а главным фактором качества остается тип ранжирования ответов. Методы, где модель сравнивает два ответа напрямую (pairwise), чаще показывают более высокий результат на задачах средней сложности, чем подходы, где ответы оцениваются по отдельности (pointwise). 🟡Что использовалось в работе В работе ученые использовали модели Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B. Обучение проводилось на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках. 🟡Статья @ai_machinelearning_big_data #AI #ML
-
🌟Исследователи лаборатории научных исследований Т-Технологий предложили единый подход для сравнения методов дообучения LLM
Machinelearning
🌟Исследователи лаборатории научных исследований Т-Технологий предложили единый подход для сравнения методов дообучения LLM Работу представили на ICML 2026. Исследователи сравнили методы дообучения больших языковых моделей, которые учатся на заранее подготовленных парах ответов, и показали, что различия между современными методами дообучения определяются типом ранжирования ответов – попарным или поточечным. 🟡Что именно предложили Чтобы сделать сравнение корректным, исследователи привели разные методы к единому протоколу оценки. Дополнительно в методы был введен параметр β: он регулирует силу дообучения на человеческих предпочтениях и позволяет более объективно сравнивать методы между собой. 🟡«Мы доказали, что такие сравнения не всегда корректны, и результат может зависеть в том числе от настроек эксперимента, объема данных или этапов обучения. Мы предложили единый подход, который позволяет сравнить методы в одинаковых условиях и понять, какие факторы действительно влияют на качество», — отметил Даниил Гаврилов, руководитель лаборатории Т-Технологий. 🟡Результаты сравнения Исследование показало, что многие заявленные преимущества алгоритмов выравнивания стираются, а главным фактором качества остается тип ранжирования ответов. Методы, где модель сравнивает два ответа напрямую (pairwise), чаще показывают более высокий результат на задачах средней сложности, чем подходы, где ответы оцениваются по отдельности (pointwise). 🟡Что использовалось в работе В работе ученые использовали модели Llama 3.2 3B, Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B и Qwen 2.5 14B. Обучение проводилось на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках. 🟡Статья @ai_machinelearning_big_data #AI #ML