Новость
Agentic LLM Benchmark проверяет ИИ-агентов на длинных цепочках действий
Бенчмарк Agentic LLM Benchmark July 2026 фокусируется на длинных цепочках действий, где сбой ломает весь пайплайн. Он помогает выявлять слабые места агентных сценариев при реальной работе.
Agentic LLM Benchmark July 2026 фокусируется не на демо, а на длинных цепочках действий, где любой сбой ломает весь пайплайн. Исследователи измеряют, как модели справляются с критическими моментами в агентных сценариях и где именно агент срывается при реальной работе.
Источники
1
-
Agentic LLM Benchmark проверяет ИИ-агентов на длинных цепочках действий
AI Updates Digest
Искусственный интеллект – сводка за 15 июля Локальные ИИ-мозги ужимаются до пары гигабайт и поселяются в ноутбуках и смартфонах 💾 Модель Bonsai 27B от PrismML, о которой пишут “Machinelearning”, “Hi, AI” и “Нейродвиж”, сжали до 3,8–3,9 ГБ, почти не потеряв в качестве — и её уже запускают в браузере и на телефоне. Она понимает текст и картинки, пишет код, вызывает инструменты и работает как основа для локальных агентных сценариев, то есть «личный ChatGPT» всё чаще живёт прямо на ваших устройствах. NVIDIA научила ИИ в реальном времени управлять движениями персонажа по тексту и клавишам 🎮 “Нейронавт | Нейросети в творчестве” показывает ARDY — систему, которая на лету генерирует плавную анимацию по описанию, заданным траекториям и даже конкретным положениям суставов. Такой ИИ-«аниматор» может заметно упростить жизнь геймдеву, авторам роликов и всем, кто хочет живую 3D-пластику без студии моушн-кэпчера. Новый бенчмарк жёстко проверяет ИИ-агентов на выносливость в бизнес‑задачах 📊 “LLM под капотом” разбирает Agentic LLM Benchmark July 2026, который фокусируется не на красивых демо, а на длинных цепочках действий, где любой сбой ломает весь пайплайн. Исследователи измеряют, как модели справляются с критическими моментами в агентных сценариях и где именно агент «сыпется» при реальной работе. В Москве ИИ берёт на себя коксометрию и ускоряет диагностику детской дисплазии 🩺 “База знаний AI” рассказывает о новом сервисе, который автоматически измеряет параметры суставов по рентгену и помогает заметить нарушения у детей. Это уже 70‑й ИИ‑модуль в московской лучевой диагностике, и он сокращает врачам часы монотонных измерений до минут, повышая точность и освобождая время для сложных случаев. Бум «ИИ‑стартапов» в США оборачивается кладбищем пустых обёрток 📉 “OMG Gpt” пишет, как ChatGPT упростил запуск бизнеса до пары вечеров, и число новых компаний в Штатах подскочило — многие сразу называют себя AI‑стартапами. Но за красивыми питчами часто нет продукта, лишь тонкий слой нейросетей, поэтому такие проекты быстро закрываются, не дожив до первых клиентов. Публичная бета iOS 27 превращает Siri в полноценного ИИ‑ассистента на Gemini 🤖 “Chad Gpt | Нейросети” показывает, как обновлённая Siri общается диалогом, ищет в интернете, строит автоматизации для умного дома и помогает писать тексты. Функция Visual Intelligence в камере считает калории и делит счёт по фото, так что айфон всё больше напоминает личного цифрового менеджера. ИИ‑агент уже тянет работу интерна‑исследователя в биоинформатике 🧬 “Сиолошная” приводит кейс: учёный поручил агенту адаптировать метод поиска генов из статьи про картофель к данным по клубнике. Агент сам прочитал статью, переписал код, прогнал пайплайн и отправил задачу на кластер, фактически взяв на себя рутину младшего научного сотрудника. DeepSeek мчится к выручке в $500 млн в год с маржой выше 50% 💰 “Неискусственный интеллект” пишет, что компания зарабатывает в основном на API‑доступе к своим моделям, а эффективность инфраструктуры делает модель V4 сверхприбыльной. Они обрабатывают больше запросов на меньшем числе чипов, и это ставит давление на конкурентов, у которых расходы на железо сильно выше. Первая железка от OpenAI — умная колонка с GPT‑Live и без экрана 🔊 По данным, которые пересказывает “Lama Ai”, устройство с батареей и глубоким контекстом обещает стать «личным собеседником», который помнит ваши привычки и управляет умным домом. Рынок колонок переполнен, но ставка OpenAI — на мощную LLM и персонализацию, которые могут сделать гаджет чем‑то большим, чем просто «ещё одна Алика». ИИ‑агент от Weco восемь дней переписывал другого агента — и сделал его умнее ⚙️ “Futuris” рассказывает про AIDE²: внешний агент на Claude Opus 4.7 шаг за шагом улучшал внутреннего агента на Gemini 3 Flash. В итоге система сама себе подняла уровень — ускорила поиск, сжала контекст в 16 раз и обогнала ручной тюнинг, намекая на будущее, где агенты регулярно оптимизируют друг друга без участия разработчиков. Источник ➖➖➖ Подписаться на канал ➖➖➖ ⬛️Borghese Club - все чаты и каналы ➖➖➖ 💻Бот для создания изображений, аудио и видео ➖➖➖ #borgheseclub #vikborghese #дайджест