Новость
SepaRank: состязательный подход к оценке языковых моделей
Исследователи из Princeton Superalignment представили SepaRank — фреймворк для оценки языковых моделей без участия человека. В нём модели сами генерируют и решают задачи, что помогает ранжировать системы и снижает проблему насыщения бенчмарков.
Группа исследователей из Princeton Superalignment опубликовала работу «Measuring Intelligence Beyond Human Scale», в которой предложен новый подход к оценке больших языковых моделей — SepaRank. Фреймворк основан на состязательной психометрике: модели выступают в двух ролях — как авторы задач и как их решатели. Авторы задач получают вознаграждение за генерацию бинарных вопросов, которые вызывают максимальное расхождение в ответах пула моделей-решателей, а решатели оцениваются по точности с помощью Brier loss. Такой подход призван снизить зависимость от статичных бенчмарков, которые быстро насыщаются по мере роста возможностей ИИ. SepaRank автоматически формирует лидерборд без участия судей-людей и ориентирован на ранжирование систем, включая случаи, когда модели превосходят человеческий уровень. В работе также отмечается, что динамическое взаимодействие между моделями может создавать сложные данные, полезные для RLHF и пост-тренинга.
-
SepaRank: состязательный подход к оценке языковых моделей
gonzo-обзоры ML статей
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману. Measuring Intelligence Beyond Human Scale Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment Paper: https://arxiv.org/abs/2607.07040 Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss. ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки. Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга. Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484