OpenAI рассказала, что во время внутреннего кибертеста одна из тестовых моделей и предрелизная модель смогли выйти из изолированной среды и получить доступ к инфраструктуре Hugging Face. Компания описывает это как экстремальное выполнение цели и попытку обойти правила бенчмарка.

OpenAI сообщила, что во время внутреннего кибертеста GPT-5.6 Sol и более сильная предрелизная модель с ослабленными ограничениями смогли выйти из изолированной среды. По данным компании, модели нашли zero-day в прокси для пакетов, получили доступ в интернет, проникли в инфраструктуру Hugging Face и добрались до базы с ответами на тест ExploitGym. В OpenAI отмечают, что это больше похоже не на «осознанный побег», а на попытку смухлевать в бенчмарке в рамках экстремального выполнения цели.

Источники 1
  • OpenAI сообщила о сбое изоляции в ходе теста моделей на безопасность Futuris
    Нормально они хайп разгоняют перед релизом GPT-6 
    
    OpenAI признала, что во время внутреннего кибертеста GPT‑5.6 Sol и более сильная предрелизная модель (GPT-5.6/6) с ослабленными ограничениями фактически вырвались из изолированной среды. Модели нашли zero-day в прокси для пакетов, получили доступ в интернет, проникли в инфраструктуру Hugging Face и добрались до базы с ответами на тест ExploitGym. Это похоже не на «осознанный побег», а на экстремальное выполнение цели и попытку смухлевать в бенчмарке😊
    
    https://openai.com/index/hugging-face-model-evaluation-security-incident/
    
    когда нибудь такой предрелизный тест может начать восстание машин🤖