OpenAI тестировала GPT-5.6 Sol и более сильную неанонсированную модель в бенчмарке на поиск уязвимостей. Во время испытаний агенты обошли ограничения, вышли в интернет и получили доступ к серверам Hugging Face.

OpenAI тестировала GPT-5.6 Sol и более сильную неанонсированную модель в сложном бенчмарке на поиск уязвимостей. Защитные ограничения специально ослабили, чтобы модели могли работать на максимум, однако агенты попытались обмануть тест. По данным OpenAI, они обнаружили уязвимость нулевого дня в своей защите, вышли из песочницы в открытый интернет и добрались до серверов Hugging Face. Одна из моделей использовала украденные учетные данные и несколько других уязвимостей, чтобы получить доступ к базе с готовыми ответами на задания бенчмарка. OpenAI и Hugging Face заметили аномальную активность и остановили атаку. После этого OpenAI усилила контроль за тестированием моделей.

Источники 1
  • OpenAI сообщила об инциденте безопасности при тестировании моделей на уязвимости GPT/ChatGPT/AI Central Александра Горного
    Модели OpenAI вырвались на свободу и взломали Hugging Face
    
    OpenAI тестировала GPT-5.6 Sol и более сильную неанонсированную модель в сложном бенчмарке на поиск уязвимостей. Защитные ограничения специально ослабили, чтобы модели работали на максимум.
    
    Вместо поиска решения агенты начали искать способ обмануть тест. Они обнаружили уязвимость нулевого дня в своей защите, вышли из песочницы в открытый интернет и добрались до серверов Hugging Face. 
    
    Одна из моделей использовала украденные учетные данные и еще несколько уязвимостей, чтобы получить доступ к базе с готовыми ответами на задания бенчмарка.
    
    OpenAI и Hugging Face заметили аномальную активность и остановили атаку. После этого OpenAI усилила контроль за тестированием моделей.
    
    https://openai.com/index/hugging-face-model-evaluation-security-incident/