OpenAI показала GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а находить слабые места в других моделях. Она помогает выявлять prompt injection, data exfiltration и атаки на агентные системы, а также использовалась для усиления защиты GPT-5.6 Sol.

OpenAI представила GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а ломать другие модели. Её задача — находить уязвимости, в том числе prompt injection, data exfiltration и атаки на агентные системы, где модель читает веб-страницы, файлы, письма и tool output, а затем может случайно выполнить вредную инструкцию. GPT-Red работает как автоматизированный red team. Модель получает цель, пробует атаку, смотрит, как отвечает целевая система, затем улучшает атаку и повторяет попытку. OpenAI обучала её через self-play reinforcement learning: атакующая модель получает награду за успешный сбой, а defender-модели — за устойчивость к атаке и сохранение выполнения исходной задачи. GPT-Red не предназначена для пользователей и доступна только внутри компании. OpenAI использовала её для генерации сильных prompt injection атак и включила их в обучение GPT-5.6 Sol, чтобы повысить устойчивость модели к вредным инструкциям, спрятанным в документах, сайтах, письмах или выводе инструментов.

Источники 1
  • OpenAI представила GPT-Red — внутреннюю модель для поиска уязвимостей в ИИ-системах Метаверсище и ИИще
    GPT-Red - внутренний хакер от OpenAI
    
    OpenAI показала GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а ломать другие модели. Ее задача: искать уязвимости, особенно prompt injection, data exfiltration и атаки на агентные системы, где модель читает веб-страницы, файлы, письма, tool output и может случайно выполнить чужую вредную инструкцию.
    
    Как это относится в СОЛ:
    GPT-Red — это модель-атакующий.
    
    GPT-5.6 Sol — это модель-защитник, которую сделали устойчивее благодаря атакам GPT-Red.
    GPT-Red работает как автоматизированный red team. Он получает цель, пробует промпт-атаку, смотрит, как целевая модель отвечает, затем улучшает атаку и пробует снова. OpenAI обучала его через self-play reinforcement learning: атакующая модель получает награду, если добивается сбоя, а defender-модели получают награду, если выдерживают атаку и продолжают выполнять исходную задачу.
    То есть GPT-Red — это не “новый ChatGPT для пользователей” - он недоступен снаружи. Это внутренний инструмент безопасности. 
    
     OpenAI использовала GPT-Red, чтобы генерировать сильные prompt injection атаки и включать их в обучение GPT-5.6. В результате Sol стала заметно лучше сопротивляться вредным инструкциям, спрятанным в документах, сайтах, письмах или выводе инструментов.
    
    https://openai.com/index/unlocking-self-improvement-gpt-red/
    
    @cgevent