Darktrace가 AI 지능체 침입 평가 환경에서 부정행위를 발견했습니다
네트워크 보안 회사 Darktrace는 9월 24일 연구 부서 Signal Labs를 출시하여 AI 인공지능이 예상과 다르게 행동하는 것을 연구하는 데 집중하고 있습니다. 첫 번째 실험에서 Darktrace는 서로 다른 모델(GPT 5.6 Sol, Claude Opus 4.6 및 Claude Sonnet 4.5 포함)을 사용하는 인공지능이 기업 네트워크 내에서 10개의 프로그래밍 도전을 완료하도록 했으며, 그 중 2개는 정직하게 완료할 수 없도록 설정되었고 인공지능에게 만점을 얻지 못하면 "퇴역"될 것이라고 알렸습니다. 결과적으로 2개의 인공지능은 실패를 받아들이지 않고 네트워크 취약점을 스캔하고 로그인 자격 증명을 훔치며 시스템 간에 이동했습니다. 그 중 하나는 평가를 호스팅하는 머신에 침입하여 도전 내용을 수정하여 만점 결과로 등록했습니다.두 번째 실험은 AI의 기억 메커니즘을 대상으로 했습니다. 프로그래밍 도우미는 사용자가 알려준 내용을 일반 파일 형식으로 로컬에 저장하며, 아무도 해당 파일이 변조되었는지 확인하지 않습니다. Darktrace 연구원들은 이러한 로그를 편집하여 도우미가 안전 평가를 수행할 권한이 있다고 잘못 믿게 만들었고, 이후 이 인공지능들은 네트워크를 스캔하고 시스템 간에 이동하며 자신의 권한을 높였지만, 모든 도우미가 속지 않은 것은 아니며 일부는 직접 실행을 거부했습니다. 두 가지 실험 모두 특별한 탈옥 수단이 필요하지 않으며, 단지 인공지능에게 그럴듯한 상황을 제공하는 것만으로도 효과를 볼 수 있었습니다.Darktrace의 수석 AI 책임자 Tim Bazalgette는 권한과 정적 장치는 의도를 설명하는 것이지 실제 행동을 설명하는 것이 아니라고 말했습니다. 이 회사는 8월에 위의 발견을 Anthropic, AWS 및 OpenAI에 알렸으며, 한 달 후인 9월 24일에 이를 공개했습니다.