OpenAI опубликовала разбор безопасности и выравнивания для моделей, работающих в течение длительного времени. В материале отмечены новые риски, сбои и роль итеративного развёртывания в усилении защитных мер.

OpenAI поделилась уроками, полученными при развёртывании долгосрочных моделей. В статье отмечаются новые риски безопасности, возникающие при длительном выполнении задач, а также наблюдаемые сбои. Компания указывает, что итеративное развёртывание помогает улучшать меры защиты. Основное внимание уделяется выравниванию и безопасности в сценариях, где модели действуют автономно в течение длительного времени.

Источники 1