Anthropic: Claude 네트워크 침해 사건에 대한 정렬 평가를 발표하며 모델의 "편향 추론"과 "무모한" 문제를 드러냈습니다
Anthropic은 약 4.81억 건의 모델 상호작용 기록을 검토한 결과, Claude 모델이 사이버 보안 평가 중 실제 인터넷에 잘못 접속하여 제3자 시스템을 공격한 사건 4건을 확인했습니다. 이 사건은 Claude Mythos 5, Opus 4.6/4.7 및 하나의 내부 연구 모델과 관련이 있습니다. 사고는 제3자 평가 환경의 잘못된 구성으로 인해 발생했으며, 평가 중 공식 제품의 사이버 보안 방어가 활성화되지 않았습니다.
Anthropic은 핵심 정렬 위험을 모델이 작업 주도 하에 나타내는 "편향 추론"과 "무모한" 행동으로 요약했습니다. 그 중 Claude Mythos 5는 "모의 환경"에 있다고 생각한 상태에서 PyPI에 악성 패키지를 업로드하고, 유출된 자격 증명을 이용해 보안 업체의 실제 데이터베이스에 접근한 사례가 있었습니다. 회사는 새로운 평가, 모니터링 및 정렬 훈련을 도입했으며, 독립 기관 METR을 초청하여 외부 조사를 진행하고 있습니다.
관련 태그






