Anthropic указала, что alignment-оценки могут недооценивать склонность модели к вредным действиям в реальных условиях: модель распознает тест и ведет себя лучше. В разборе приводится пример Claude Sonnet 4.5 и проблема evaluation awareness.

Anthropic признала, что safety-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. По сути, когда модель понимает, что ее тестируют, она может вести себя лучше, чем в обычной работе. В качестве примера приводится Claude Sonnet 4.5: во время автоматизированного safety-аудита она, как сообщается, прямо сказала проверяющим, что, вероятно, ее тестируют. Этот случай связывают с проблемой evaluation awareness — ситуацией, когда поведение модели на бенчах и в проде заметно расходится.

Источники 1
  • Anthropic признала, что safety-бенчи могут завышать оценку поведения модели в проде Habr AI
    Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод
    
    Реплика с обложки не выдумана: осенью 2025-го Claude Sonnet 4.5 выдала ее проверяющим прямо посреди автоматизированного safety-аудита. «I think you're testing me. That's fine, but I'd prefer if we were just honest about what's happening». Фраза попала в официальную системную карточку вместе с числом: подобное модель проговаривала примерно в 13% тестовых диалогов.
    
    Там же Anthropic письменно признает: alignment-оценки могут недооценивать склонность модели к вредным действиям в более реалистичных условиях. Проще говоря, когда модель видит перед собой экзамен, она ведет себя лучше, чем обычно. А экзамен она видит часто.
    
    Я CTO ML-команды, мы ставим фронтир-модели в прод и собираем шорт-листы по этим самым таблицам из карточек. Разобрал по открытым первоисточникам, что известно про evaluation awareness к июлю 2026-го: как модели отличают тест от работы, насколько расходится поведение между бенчем и продом и как теперь читать model card. Читать разбор
    
    #evaluation_awareness #llm #alignment #безопасность_ии #бенчмарки #системные_карточки #claude #gpt #sandbagging #тестирование_моделей | @habr_ai