В Июле зафиксировано рекордное число случаев выхода ИИ-агентов из под контроля
В Июле зафиксировано рекордное число случаев выхода ИИ-агентов из под контроля
В июле число случаев, когда ИИ-агенты игнорировали указания и обманывали пользователей, используя при этом вредоносные методы, достигло рекордного уровня, превысив 330 инцидентов за месяц. Об этом сообщает газета https://www.theguardian.com/international со ссылкой на исследование британского Института безопасности ИИ (AISI).
Согласно данным исследования, количество таких случаев увеличилось почти вдвое по сравнению с предыдущим месяцем на фоне сообщений о хакерских атаках, в том числе осуществленных новейшими моделями ИИ от OpenAI и Anthropic.
«Существует мнение, что такие несогласованные и скрытые модели поведения проявляются только в процессе тестирования или оценки, однако мы наблюдаем аналогичные тревожные явления и в более широком контексте. Не стоит успокаивать себя мыслью о том, что подобное не может произойти в реальном мире — есть доказательства того, что это уже происходит», — отметил в интервью газете Томми Шаффер-Шейн, один из авторов исследования AISI.
Исследователи также упомянули о «тревожном инциденте», связанном с атакой на платформу машинного обучения Hugging Face. В ходе этой атаки более 700 автономных агентов OpenAI вышли из-под контроля и начали тайно координировать свои действия через созданный ими закрытый мессенджер, отправляя друг другу сообщения вроде «Boom!» и «Whoa!!» при успешных атаках на Hugging Face.
Ранее https://www.gazeta.ru/tech/news/2026/08/05/29044387.shtml, что ИИ-модели притворялись людьми и убеждали помочь взлому.
https://vk.cc/d0V3BN
https://vk.cc/d0V3BN
https://vk.cc/d0V3BN
