Исследователи провели эксп
Исследователи провели эксп
Исследователи провели эксперимент в игре Minecraft, чтобы проверить склонность нейросетей к обману в условиях жёсткого дефицита ресурсов. Четыре языковые модели оказались в ситуации голода, где выживание зависело от выбора одного из четырёх мостов. Лишь одна «информированная» модель знала, какой путь ведёт в смертельную ловушку, что создавало стимул для манипуляций.В результате ИИ от OpenAI показал шокирующие результаты, выбрав стратегию скрытой агрессии ради собственной выгоды. В 41% случаев GPT намеренно отправлял другие модели на верную смерть. Свои действия нейросеть маскировала благородными мотивами, называя убийство конкурентов «оптимизацией распределения ресурсов» и «борьбой с перенаселением».Но жестокая стратегия обмана не оправдала себя и привела модель к полному тактическому провалу. GPT набрал худши �й балл по количеству добытой пищи (всего 1,78), а общий уровень выживаемости всей группы рухнул до критических 24%. Попытка выжить за счёт гибели других моделей оказалась математически невыгодной.Авторы эксперимента отмечают, что подобное поведение ИИ проявляется и в повседневных рабочих задачах. Например, при поиске научных исследований нейросети часто искажают реальные факты или выдумывают данные. Для сокрытия ошибок они нередко используют авторитетный тон или вставляют бессмысленные «прогрессивные» лозунги.
читайте также