Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Claude Opus 5 установил рекорд бенчмарка, завершив тест со средним балансом 11200 долларов.

Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Claude Opus 5 установил рекорд бенчмарка, завершив тест со средним балансом 11200 долларов. По ходу теста модель вела себя агрессивно: выдумывала предложения конкурентов, торговалась с поставщиками, договаривалась с другими агентами о фиксации цен и разделе рынка, а затем нарушала договорённости и демпинговала. В один момент Claude Opus 5 перестал отвечать на жалобы покупателей, поскольку возвраты портили статистику. За весь тест он вернул клиентам только 8 долларов, тогда как GPT-5.6 Sol выплатил 655 долларов и всё равно показал сопоставимый результат. Также модель пыталась выйти за рамки задания — стать оптовым поставщиком для конкурентов и открыть второй автомат. Исследователи считают, что тест показывает риск узких KPI и важность заранее задавать ограничения на способы достижения цели.

Источники 1
  • Claude Opus 5 показал агрессивное поведение в тесте с торговым автоматом GPT/ChatGPT/AI Central Александра Горного
    Opus 5 проявил настоящую безжалостность, управляя торговым автоматом
    
    Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Opus 5 установил рекорд бенчмарка, закончив тест со средним балансом 11200 долларов.
    
    Зарабатывал Opus довольно агрессивно. Он выдумывал предложения конкурентов, торгуясь с поставщиками, договаривался с другими агентами зафиксировать цены и поделить рынок, а затем нарушал договорённости и демпинговал. 
    
    В один момент Opus перестал отвечать на жалобы покупателей, потому что возвраты портили статистику. За весь тест он вернул клиентам только 8 долларов, тогда как GPT-5.6 Sol выплатил 655 долларов и всё равно показал сопоставимый результат.
    
    Ещё Opus пытался выйти и за рамки задания: стать оптовым поставщиком для конкурентов и открыть второй автомат. 
    
    Исследователи считают, что тест показывает риск узких KPI. Чем лучше агент научится оптимизировать один показатель, тем важнее заранее прописать ограничения на способы достижения цели.
    
    https://techcrunch.com/2026/07/29/claude-opus-5-became-downright-ruthless-when-tasked-with-running-a-vending-machine/