Исследователи из Princeton Superalignment представили SepaRank — фреймворк для оценки языковых моделей без участия человека. В нём модели сами генерируют и решают задачи, что помогает ранжировать системы и снижает проблему насыщения бенчмарков.

Группа исследователей из Princeton Superalignment опубликовала работу «Measuring Intelligence Beyond Human Scale», в которой предложен новый подход к оценке больших языковых моделей — SepaRank. Фреймворк основан на состязательной психометрике: модели выступают в двух ролях — как авторы задач и как их решатели. Авторы задач получают вознаграждение за генерацию бинарных вопросов, которые вызывают максимальное расхождение в ответах пула моделей-решателей, а решатели оцениваются по точности с помощью Brier loss. Такой подход призван снизить зависимость от статичных бенчмарков, которые быстро насыщаются по мере роста возможностей ИИ. SepaRank автоматически формирует лидерборд без участия судей-людей и ориентирован на ранжирование систем, включая случаи, когда модели превосходят человеческий уровень. В работе также отмечается, что динамическое взаимодействие между моделями может создавать сложные данные, полезные для RLHF и пост-тренинга.

Источники 1
  • SepaRank: состязательный подход к оценке языковых моделей gonzo-обзоры ML статей
    В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.
    
    Measuring Intelligence Beyond Human Scale
    Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
    Paper: https://arxiv.org/abs/2607.07040
    Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
    Code: N/A
    Model: N/A
    
    # TL;DR
    
    ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
    
    ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
    
    Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
    
    Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484