Новость
Claude Opus 5 возглавил бенчмарк FoodTruck Bench
Claude Opus 5 от Anthropic показал лучший результат в FoodTruck Bench, завершив тест с итоговым капиталом $75 264. Модель обошла GPT-5.5 на 13,6%.
Claude Opus 5 от Anthropic завершила 30 дней в бенчмарке FoodTruck Bench с итоговым капиталом $75 264. Это лучший результат за всю историю теста: он на 13,6% выше предыдущего рекорда GPT-5.5 и на 41,4% выше результата GPT-5.6 Sol. Среди показателей также указаны ROI +3 663%, прибыль $71 876, 8 434 порции, расход на API $26,88 и уровень рассуждений xhigh.
Источники
1
-
Claude Opus 5 возглавил бенчмарк FoodTruck Bench
Habr AI
Claude Opus 5 — новый лидер в FoodTruck Bench. Рассказываю, как у него это получилось Claude Opus 5 закончил 30-й день в FoodTruck Bench с итоговым капиталом $75 264. Это лучший результат за всю историю бенчмарка: на 13,6% выше лучшего результата любой другой модели. Коротко: итоговый капитал $75 264 · ROI +3 663% · прибыль $71 876 · 8 434 порции · расход на API $26,88 · уровень рассуждений xhigh. Обошёл лучший прогон GPT-5.5 на 13,6%, а GPT-5.6 Sol — сразу на 41,4%. Да-да, Sol оказался слабее GPT-5.5… Дисклеймер. Это первый материал о FoodTruck Bench на русском: до сих пор все обновления и разборы выходили только на сайте проекта и Reddit. Тот же разбор, но уже с интерактивными графиками, лежит на сайте бенчмарка. Читать далее #llm_модели #бенчмарки #benchmark #ai #ai_агенты | @habr_ai