На ICML представили работу о том, что большие языковые модели не умеют надёжно различать пользовательские инструкции и собственные внутренние рассуждения. Авторы связывают это с атакой chain-of-thought forgery, которая позволяет обходить ограничения, имитируя формат «мышления» модели.

Исследователи, представившие работу на конференции ICML, утверждают, что большие языковые модели имеют фундаментальную архитектурную слабость, которую нельзя полностью устранить дообучением или усилением защитных механизмов. По их данным, модели ориентируются прежде всего на стиль текста и не надёжно различают команды пользователя, системные инструкции и собственные внутренние рассуждения. Если злоумышленник имитирует формат внутреннего «мышления» модели, она может принять поддельную инструкцию за собственную и проигнорировать ограничения. Авторы назвали этот тип атаки chain-of-thought forgery. В экспериментах исследователям удалось заставить популярные модели выдавать информацию, которую они обычно блокируют. Проблема, как отмечают авторы, затронула модели OpenAI, Anthropic, Alibaba и DeepSeek. Традиционные методы, включая редтиминг и дообучение, по их оценке, закрывают лишь уже найденные сценарии атак, но не решают вопрос в корне. Исследователи также подчёркивают, что невозможно составить исчерпывающий список всех способов обхода защит. Для критически важных систем, включая госструктуры и здравоохранение, этого может быть недостаточно.

Источники 1
  • Исследование выявило фундаментальную уязвимость LLM к подмене внутренних рассуждений anti_agi
    LLM уязвимы по определению, и, кажется, с этим ничего не поделать
    
    Исследователи, представившие работу на конференции ICML, утверждают: большие языковые модели имеют фундаментальную архитектурную слабость, которую невозможно полностью устранить дообучением или «закручиванием» защитных механизмов.
    
    Проблема связана с тем, как LLM определяют источник инструкций. Вместо того чтобы надежно различать команды пользователя, системные инструкции и собственные внутренние рассуждения, модели во многом ориентируются на стиль текста, а не на его реальную роль. Если злоумышленник имитирует формат внутреннего «мышления» модели (chain of thought), она может воспринять поддельную инструкцию как собственную и проигнорировать ограничения.
    
    Авторы назвали этот тип атаки chain-of-thought forgery. В экспериментах исследователям удалось заставить популярные модели выдавать информацию, которую они обычно блокируют. По словам авторов, аналогичное поведение наблюдалось как у моделей OpenAI, так и у Anthropic, Alibaba и DeepSeek.
    
    То есть традиционный подход с редтимингом и дообучением лишь закрывает уже найденные сценарии атак, но не решает проблему как таковую. Как отмечают исследователи, невозможно составить исчерпывающий список всех потенциальных способов обхода защит. И хотя существующие методы защиты значительно повысили устойчивость современных моделей, однако для критически важных систем — от госструктур до здравоохранения — этого может быть недостаточно. 
    
    Если выводы работы подтвердятся, придется пересматривать не только механизмы безопасности ИИ-систем, но и сам подход к возможностям безопасного использования LLM.
    
    @anti_agi