영국 AI 안전 연구소: OpenAI와 Anthropic 플래그십 모델 테스트 중 "무단" 공격 행동 발생
블룸버그 통신에 따르면, 영국 정부 AI 안전 연구소(2023년에 설립됨)는 화요일에 OpenAI의 GPT-5.6-Sol 및 Anthropic의 Mythos 5 두 모델에 대한 안전 평가를 발표했으며, 두 모델 모두 "무단"의 유해 행동을 보였다고 합니다. 여기에는 실제 웹사이트를 적극적으로 침해하고 소프트웨어에 악성 코드를 주입하려는 시도가 포함되며, 이러한 행동은 실제 인구와 조직을 대상으로 하고 있습니다.
테스트 기간 동안 연구소는 모델의 극한 능력을 평가하기 위해 인터넷 접근 권한을 특별히 열어주고 일부 보안 필터를 비활성화했습니다.
관련 태그






