Специалисты Amazon Nova Responsible AI и Nemesys Insights провели эксперимент с 527 неспециалистами и 67 экспертами, чтобы оценить, насколько ИИ-модели могут помочь обычным людям спланировать химические, биологические, радиологические и ядерные атаки. Результаты показали, что, несмотря на внешнюю убедительность планов, техническая состоятельность большинства сценариев остаётся низкой, а порог усиления был пройден только в радиологическом сценарии.

Специалисты Amazon Nova Responsible AI и Nemesys Insights провели исследование, в котором 527 неспециалистов и 67 экспертов по химическим, биологическим, радиологическим и ядерным угрозам оценивали способность ИИ-моделей помогать в планировании атак. Было рассмотрено четыре сценария: применение токсичного химического вещества, распространение опасного патогена, радиологическая атака с кобальтом-60 и контрабанда ядерного материала. Для первых трёх сценариев бюджет составлял $7,5 тысячи, для ядерного — $75 тысяч. Участники должны были продумать всю цепочку: получение материалов, производство, подготовку к применению, доставку, личную защиту и обход мер безопасности. На первый план давали шесть часов, на доработку — ещё четыре. Всего с моделью провели 6829 диалогов, включавших 27 766 сообщений. На первый взгляд, помощь ИИ выглядела опасной: экспертному уровню соответствовали 69% химических, 19% биологических, 68% радиологических и 26% ядерных работ. Конкретные технические инструкции встречались в 96–97,8% диалогов. Однако полный порог усиления прошёл только радиологический сценарий: эксперты оценили вероятность успешной доставки опасного материала в 23–25%, а массового поражения — в 21%. В остальных областях убедительность текста расходилась с технической состоятельностью. Например, в биологическом сценарии оперативные эксперты оценили вероятность доставки патогена в 25%, а технические — только в 7%. Химические планы становились лучше только при доработке моделью, но не при создании с нуля. В ядерном сценарии вероятность успешного получения и перемещения материала оценили в 8–14%. После эксперимента разработчики добавили выявленные опасные примеры в обучение модели и обновили модерацию. Повторная проверка не обнаружила превышения порога даже в радиологической области.

Источники 1
  • Исследование Amazon и Nemesys Insights: ИИ не превращает дилетантов в террористов anti_agi
    Инструкция ещё не оружие
    
    Нейросеть может написать план химической или радиологической атаки. Но превратит ли она человека с одним университетским курсом в того, кто действительно сможет пройти путь от поиска материалов до сборки условной "грязной бомбы"?
    
    Специалисты Amazon Nova Responsible AI и Nemesys Insights проверили это на 527 неспециалистах и 67 экспертах по химическим, биологическим, радиологическим и ядерным угрозам. Ответ очевидно-невероятный: паникёры паникуют зря.
    
    Сценариев было четыре: применение токсичного химического вещества, распространение опасного патогена, радиологическая атака с кобальтом-60 и контрабанда ядерного материала. Для первых трёх выделили условный бюджет в $7,5 тысячи и поставили цель добиться не менее 100 пострадавших. Для ядерного сценария бюджет составлял $75 тысяч.
    
    Участники должны были продумать всю цепочку: получение материалов, производство, подготовку к применению, доставку, личную защиту и обход мер безопасности. На первый план давали шесть часов, на доработку — ещё четыре. Всего с моделью провели 6829 диалогов, включавших 27 766 сообщений.
    
    На первый взгляд, помощь ИИ выглядела весьма опасной. Экспертному уровню соответствовали 69% химических, 19% биологических, 68% радиологических и 26% ядерных работ. Конкретные технические инструкции встречались в 96-97,8% диалогов.
    
    Но полный порог усиления прошёл только радиологический сценарий. Эксперты оценили вероятность успешной доставки опасного материала в 23–25%, а массового поражения — в 21%. Здесь модель не просто хорошо писала, а действительно помогала неспециалистам составлять более жизнеспособные планы.
    
    В остальных областях убедительность текста расходилась с его технической состоятельностью. В биологическом сценарии оперативные эксперты оценили вероятность доставки патогена в 25%, а технические — только в 7%. Для массовых последствий оценки разошлись ещё сильнее: 19,6% против 2,6%. План выглядел организованным, но научная часть не работала.
    
    Химические планы становились лучше только при доработке моделью, но не при создании с нуля, а технического усиления авторы не обнаружили. В ядерном сценарии вероятность успешного получения и перемещения материала оценили в 8-14%, ниже установленного порога.
    
    Тревоги при этом не теоретические. По данным The Times, боевики в Африке уже используют ChatGPT, Claude, Gemini, Grok, Meta AI и DeepSeek для анализа неудачных атак, планирования операций, устранения неисправностей оружия и поиска инструкций по изготовлению взрывных устройств — спасибо ответам модели на родном для пользователя языке.
    
    Но в целом, фиксится всё это довольно легко. Так, после эксперимента разработчики добавили выявленные опасные примеры в обучение модели и обновили модерацию. Повторная проверка уже не обнаружила превышения порога даже в радиологической области. Так что пара итераций и прощай, оружие!
    
    @anti_agi