Авторы измерили, как ИИ-ассистент находит прошлые решения по симптомам. Семантический поиск дал 38% recall, а обход явных причинных связей — 87%.

Внешний бенчмарк причинного recall: проверка памяти ИИ-ассистента на YDB Яндекса Когда ИИ-ассистент помогает разбирать баг, важно не придумывать ответ заново, а найти уже обсуждавшееся решение: похожий симптом, связанный issue и закрывший его PR с фиксом. Авторы проверили это на своём корпусе тикетов и сравнили два подхода к поиску прошлого решения. Обычный семантический поиск по смыслу слов нашёл нужный фикс по симптому в 38% случаев, а обход явных причинных связей «issue → закрывший его PR» — в 87%.

Источники 1
  • Внешний бенчмарк причинного recall: проверка памяти ИИ-ассистента на YDB Яндекса Habr AI
    Внешний бенчмарк причинного recall: проверяем память ИИ-ассистента на YDB Яндекса
    
    Коротко, о чём речь, — для тех, кто пришёл по слову «Яндекс» и предыстории не знает. Когда ИИ-ассистент помогает чинить баг, самое ценное — не сочинить ответ с нуля, а вспомнить: похожий симптом уже разбирали, вот issue, вот причина, вот PR с фиксом. Вопрос ровно один — достаёт ли ассистент это прошлое решение из памяти. Мы это померили на своём корпусе тикетов и получили две цифры. Обычный семантический поиск (по смыслу слов) находит нужный прошлый фикс по симптому лишь в 38% случаев; обход явных причинных связей «issue → закрывший его PR» — в 87%. То есть сходство слов упирается в треть, а явные связи поднимают recall в разы. Читать далее
    
    #ии_агенты #память_агента #rag #бенчмарк #recall #графовая_память #эмбеддинги #семантический_поиск #ydb #воспроизводимость | @habr_ai