Новость
Проверили, не оптимизируют ли LLM под «пеликанмаксинг»
Саймон Уиллисон уже несколько лет тестирует крупные релизы LLM одним и тем же промптом про SVG с пеликаном на велосипеде. Автор материала решил проверить, не подстраиваются ли модели под этот неформальный бенчмарк.
Саймон Уиллисон несколько лет подряд использует один и тот же промпт для проверки крупных релизов LLM: «Сгенерируй SVG с пеликаном, сидящим на велосипеде». Этот шуточный тест давно стал одним из самых известных неформальных бенчмарков в ИИ-сообществе и часто всплывает в обсуждениях новых релизов. В статье рассматривается вопрос, не занимаются ли ИИ-лаборатории «бенчмаксингом» — оптимизацией моделей под популярные тесты ради более высоких оценок. Для проверки автор сгенерировал 1008 SVG в семи передовых моделях, оценил результаты с помощью LLM-судьи и проанализировал их при участии Claude Fable 5. В материале приведены итоги эксперимента, а код выложен на GitHub.
-
Проверили, не оптимизируют ли LLM под «пеликанмаксинг»
Habr AI
[Перевод] Занимаются ли разработчики ИИ‑моделей пеликанмаксингом? Последние несколько лет Саймон Уиллисон тестировал каждый крупный релиз LLM одним и тем же промптом: «Сгенерируй SVG с пеликаном, сидящим на велосипеде». Эта забавная проверка постепенно стала одним из самых известных неформальных бенчмарков ИИ. Сгенерированные Саймоном картинки пеликанов на велосипедах часто становятся одними из самых популярных комментариев в постах Hacker News о новых релизах ИИ-лабораторий. Сегодня бенчмарк стал причиной серьёзных обсуждений его полезности, а также того, занимаются ли ИИ-лаборатории его бенчмаксингом [практикой оптимизации ИИ-моделей для получения высоких оценок в популярных бенчмарках]. Когда на кону миллиарды или даже триллионы долларов, а качественный результат может склонить пользователей на твою сторону, не возникает ли искушения добавить модели немного пеликанмаксинга? Мне захотелось это проверить, поэтому я организовал небольшой эксперимент: сгенерировал 1008 SVG в семи передовых моделях, оценил их при помощи LLM-судьи и проанализировал результаты Claude Fable 5. В этой статье я расскажу о результатах. Весь код доступен на Github. Читать далее #llm #обучение_моделей #grok #qwen #glm #gpt #deepseek #claude #gemini | @habr_ai