Автор разбирает распространённое заблуждение: один вызов LLM в RAG не всегда дешевле, чем несколько итераций агента. На примере демо показано, что итоговая стоимость зависит не только от числа вызовов модели.

На демо с потенциальным заказчиком автор показывает работу агента: при вопросе о настройке интеграции с ITSM-системой система проходит несколько шагов — семантический поиск, OpenChunk, текстовый поиск по точному термину и синтез ответа со ссылками. После этого возникает вопрос: не проще ли было бы использовать один RAG-запрос, ведь один вызов LLM выглядит дешевле, чем множество итераций. Автор отмечает, что такая логика не всегда верна: формально у ассистента может быть один вызов LLM, а у агента — несколько, но это ещё не означает, что агент дороже в реальном сценарии. Разбор посвящён тому, почему сравнение только по числу вызовов модели может быть обманчивым.

Источники 1
  • Почему агент может быть дешевле RAG Habr AI
    Почему агент на самом деле дешевле RAG
    
    Я сижу на демо с потенциальным заказчиком. Показываю агента в действии: пользователь спрашивает «как настроить интеграцию с ITSM-системой», агент делает четыре итерации — семантический поиск, один OpenChunk, текстовый поиск по точному термину, синтез ответа со ссылками. Заказчик кивает, и тут слово берёт его технический директор: «А не проще было бы один RAG-запрос? Один вызов LLM — это же дешевле, чем двадцать».
    
    Формально — да. Один вызов ассистента это 1 × LLM. Агент — до 20 × LLM. Значит, агент в 20 раз дороже?
    
    Нет. И вот почему. Почему?
    
    #экономика_агента #агенты #агенты_ии #rag #ai #ии #ии_ассистент | @habr_ai