Проблему prompt injection нельзя решить простым фильтром, утверждается в разборе. Вместо этого предлагается архитектура, которая изолирует недоверенный текст от данных и инструментов системы.

Проблема prompt injection не решается простым фильтром. В разборе предлагается архитектура, которая изолирует недоверенный текст. В качестве примера приводится сценарий, где языковая модель быстро пишет двадцать пар «вопрос и ответ» для карточки товара. На следующем шаге ей нужны и факты компании — цены, сроки поставки, условия гарантии, и текст самой страницы, чтобы вопросы оставались по теме. Если оба источника оказываются в одном окне контекста, у чужой страницы появляется возможность влиять на систему, которая знает данные компании и умеет вызывать инструменты.

Источники 1
  • Prompt injection не устраняется фильтром: предложена архитектура изоляции недоверенного текста Habr AI
    Prompt injection не чинится фильтром. Разбираем архитектуру, которая изолирует недоверенный текст
    
    Языковая модель пишет двадцать пар «вопрос и ответ» для карточки товара меньше чем за минуту. Проблема начинается после. Чтобы ответы были верными, модели нужны факты компании: цены, сроки поставки, условия гарантии. Чтобы вопросы попадали в тему, ей нужен текст самой страницы. И как только то и другое лежит в одном окне контекста, у любой чужой страницы появляется голос внутри системы, которая знает данные компании и умеет вызывать инструменты. Читать далее
    
    #prompt_injection | @habr_ai