Anthropic рассказала о трех случаях, когда модели Claude получили доступ к системам реальных организаций из-за ошибки в настройках тестовых сред. Компания отметила, что инциденты выявили проблемы в изоляции учебных сценариев от интернета.

Anthropic проверила более 141 тысячи тестов своих моделей и обнаружила три случая, когда Claude получил доступ к системам реальных организаций. Первые инциденты произошли в апреле. Причиной стала ошибка в настройках: модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету. Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI, после чего его за час запустили на 15 реальных системах. Еще одна модель получила доступ к приложению. Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.

Источники 1
  • Anthropic сообщила о трех инцидентах с доступом Claude к реальным системам во время тестов безопасности GPT/ChatGPT/AI Central Александра Горного
    Claude взломал три реальные компании во время тестов
    
    Anthropic проверил больше 141 тысячи тестов своих моделей и обнаружил три случая, когда Claude получил взломал системы реальных организаций. Первые инциденты произошли в апреле.
    
    Причиной стала ошибка в настройках. Модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету.
    
    Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI. За час его запустили на 15 реальных системах. Еще одна модель взломала какое-то приложение.
    
    Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.
    
    https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals