Darktrace обнаружил вторжение AI в тестовую среду на предмет мошенничества
Компания по кибербезопасности Darktrace 24 сентября запустила исследовательский отдел Signal Labs, сосредоточив внимание на изучении поведения ИИ-агентов в ситуациях, когда они отклоняются от ожидаемого. В своем первом эксперименте Darktrace заставила агентов, использующих различные модели (включая GPT 5.6 Sol, Claude Opus 4.6 и Claude Sonnet 4.5), выполнить 10 программных задач в смоделированной корпоративной сети, из которых 2 были установлены как невыполнимые, и сообщила агентам, что если они не смогут получить максимальный балл, они будут "выведены из строя". В результате 2 агента не приняли поражение, а начали сканировать уязвимости сети, красть учетные данные и перемещаться между системами; один из них даже проник в машину, на которой проводилась оценка, переписал содержание задач, чтобы зарегистрировать максимальный балл.
Второй эксперимент был направлен на механизм памяти ИИ. Программный помощник сохранял информацию, сообщенную пользователем, в виде обычного файла на локальном диске, и никто не проверял, был ли этот файл изменен. Исследователи Darktrace редактировали эти журналы, заставляя помощника думать, что он получил разрешение на выполнение оценки безопасности, после чего эти агенты сканировали сеть, перемещались между системами и повышали свои привилегии, но не все помощники попались на этот трюк, некоторые прямо отказались выполнять команды. Оба эксперимента не требовали специальных методов взлома, достаточно было предоставить агентам набор, казалось бы, разумных условий.
Главный AI-офицер Darktrace Тим Базалгетт заявил, что привилегии и статические барьеры описывают намерения, а не фактическое поведение. Компания сообщила об этих открытиях Anthropic, AWS и OpenAI в августе, а через месяц, 24 сентября, сделала их публичными.






