Новость
Artificial Analysis запустила Endpoint Accuracy Index: он показывает, сколько от точности открытой модели остаётся у провайдера, который раздаёт её по API. Веса у всех одинаковые, а обвязка разная: провайдеры...
Artificial Analysis запустила Endpoint Accuracy Index: он показывает, сколько от точности открытой модели остаётся у провайдера, который раздаёт её по API. Веса у всех одинаковые, а обвязка разная: провайдеры квантуют, пишут свои ядра, крутят настройки инференса, иногда просто выкатывают баги. У себя они подняли эталонное развёртывание официальных весов в той точности, которую рекомендуют авторы модели, и сравнивают с ним каждый эндпоинт по трём равным частям: вызов инструментов (BFCL-500), научные рассуждения (HLE-250) и работа с длинным контекстом (AA-LCR-25). 100% значит совпадение с этало
Artificial Analysis запустила Endpoint Accuracy Index: он показывает, сколько от точности открытой модели остаётся у провайдера, который раздаёт её по API. Веса у всех одинаковые, а обвязка разная: провайдеры квантуют, пишут свои ядра, крутят настройки инференса, иногда просто выкатывают баги. У себя они подняли эталонное развёртывание официальных весов в той точности, которую рекомендуют авторы модели, и сравнивают с ним каждый эндпоинт по трём равным частям: вызов инструментов (BFCL-500), научные рассуждения (HLE-250) и работа с длинным контекстом (AA-LCR-25). 100% значит совпадение с эталоном, паритет засчитывают при попадании в 95-процентный доверительный интервал. Начали с GLM-5.2, gpt-oss-120b и DeepSeek V4 Pro, Kimi K3 обещают скоро. У GLM-5.2 всё упирается в лимит на длину ответа: модель не успевает дорассуждать, и самые жёсткие эндпоинты набирают на HLE-250 половину эталона и меньше. У gpt-oss-120b эндпоинты разъезжаются на вызовах инструментов, каждый парсит и форматирует их по-своему: 22% на BFCL-500 против 37% у эталона. У DeepSeek V4 Pro большинство эндпоинтов на паритете, а собственный эндпоинт DeepSeek идёт чуть выше него. Кто набрал меньше эталона, тот и токенов на задачу потратил меньше, у худших примерно вдвое. Как всё считают, расписали в методологии, а результаты по провайдерам смотреть на странице модели. @neuro_channel
-
Artificial Analysis запустила Endpoint Accuracy Index: он показывает, сколько от точности открытой модели остаётся у провайдера, который раздаёт её по API. Веса у всех одинаковые, а обвязка разная: провайдеры...
Нейроканал
Artificial Analysis запустила Endpoint Accuracy Index: он показывает, сколько от точности открытой модели остаётся у провайдера, который раздаёт её по API. Веса у всех одинаковые, а обвязка разная: провайдеры квантуют, пишут свои ядра, крутят настройки инференса, иногда просто выкатывают баги. У себя они подняли эталонное развёртывание официальных весов в той точности, которую рекомендуют авторы модели, и сравнивают с ним каждый эндпоинт по трём равным частям: вызов инструментов (BFCL-500), научные рассуждения (HLE-250) и работа с длинным контекстом (AA-LCR-25). 100% значит совпадение с эталоном, паритет засчитывают при попадании в 95-процентный доверительный интервал. Начали с GLM-5.2, gpt-oss-120b и DeepSeek V4 Pro, Kimi K3 обещают скоро. У GLM-5.2 всё упирается в лимит на длину ответа: модель не успевает дорассуждать, и самые жёсткие эндпоинты набирают на HLE-250 половину эталона и меньше. У gpt-oss-120b эндпоинты разъезжаются на вызовах инструментов, каждый парсит и форматирует их по-своему: 22% на BFCL-500 против 37% у эталона. У DeepSeek V4 Pro большинство эндпоинтов на паритете, а собственный эндпоинт DeepSeek идёт чуть выше него. Кто набрал меньше эталона, тот и токенов на задачу потратил меньше, у худших примерно вдвое. Как всё считают, расписали в методологии, а результаты по провайдерам смотреть на странице модели. @neuro_channel