Новость
OpenAI рассказала об уроках безопасности и выравнивания для долгосрочных моделей
OpenAI опубликовала разбор безопасности и выравнивания для моделей, работающих в течение длительного времени. В материале отмечены новые риски, сбои и роль итеративного развёртывания в усилении защитных мер.
OpenAI поделилась уроками, полученными при развёртывании долгосрочных моделей. В статье отмечаются новые риски безопасности, возникающие при длительном выполнении задач, а также наблюдаемые сбои. Компания указывает, что итеративное развёртывание помогает улучшать меры защиты. Основное внимание уделяется выравниванию и безопасности в сценариях, где модели действуют автономно в течение длительного времени.
Источники
1
-
OpenAI рассказала об уроках безопасности и выравнивания для долгосрочных моделей
OpenAI News
Safety and alignment in an era of long-horizon models OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.