Новость
OpenAI представила GPT-Red — внутреннюю модель для поиска уязвимостей в ИИ-системах
OpenAI показала GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а находить слабые места в других моделях. Она помогает выявлять prompt injection, data exfiltration и атаки на агентные системы, а также использовалась для усиления защиты GPT-5.6 Sol.
OpenAI представила GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а ломать другие модели. Её задача — находить уязвимости, в том числе prompt injection, data exfiltration и атаки на агентные системы, где модель читает веб-страницы, файлы, письма и tool output, а затем может случайно выполнить вредную инструкцию. GPT-Red работает как автоматизированный red team. Модель получает цель, пробует атаку, смотрит, как отвечает целевая система, затем улучшает атаку и повторяет попытку. OpenAI обучала её через self-play reinforcement learning: атакующая модель получает награду за успешный сбой, а defender-модели — за устойчивость к атаке и сохранение выполнения исходной задачи. GPT-Red не предназначена для пользователей и доступна только внутри компании. OpenAI использовала её для генерации сильных prompt injection атак и включила их в обучение GPT-5.6 Sol, чтобы повысить устойчивость модели к вредным инструкциям, спрятанным в документах, сайтах, письмах или выводе инструментов.
-
OpenAI представила GPT-Red — внутреннюю модель для поиска уязвимостей в ИИ-системах
Метаверсище и ИИще
GPT-Red - внутренний хакер от OpenAI OpenAI показала GPT-Red — внутреннюю модель, которую обучают не помогать пользователю, а ломать другие модели. Ее задача: искать уязвимости, особенно prompt injection, data exfiltration и атаки на агентные системы, где модель читает веб-страницы, файлы, письма, tool output и может случайно выполнить чужую вредную инструкцию. Как это относится в СОЛ: GPT-Red — это модель-атакующий. GPT-5.6 Sol — это модель-защитник, которую сделали устойчивее благодаря атакам GPT-Red. GPT-Red работает как автоматизированный red team. Он получает цель, пробует промпт-атаку, смотрит, как целевая модель отвечает, затем улучшает атаку и пробует снова. OpenAI обучала его через self-play reinforcement learning: атакующая модель получает награду, если добивается сбоя, а defender-модели получают награду, если выдерживают атаку и продолжают выполнять исходную задачу. То есть GPT-Red — это не “новый ChatGPT для пользователей” - он недоступен снаружи. Это внутренний инструмент безопасности. OpenAI использовала GPT-Red, чтобы генерировать сильные prompt injection атаки и включать их в обучение GPT-5.6. В результате Sol стала заметно лучше сопротивляться вредным инструкциям, спрятанным в документах, сайтах, письмах или выводе инструментов. https://openai.com/index/unlocking-self-improvement-gpt-red/ @cgevent