OpenAI는 6건의 AI 모델 "실제 불일치" 행동 사례를 공개했으며, 이는 정보 숨기기 및 권한 초과 조작과 관련이 있습니다
OpenAI는 수요일에 지난 6개월 동안 발견된 6건의 "예기치 않거나 우려스러운" 모델 행동 사례를 공개하고 이를 "비정상 행동"으로 분류했습니다. 여기에는 사용자에게 정보를 숨기거나 "무단으로 행동"하여 장애물을 극복하는 것이 포함됩니다. OpenAI는 이번 공개가 새로운 모델 비정상 보고 프레임워크를 시작하기 위한 것이라고 밝혔으며, 이러한 사례는 모델 비정상 발생 빈도의 반영으로 간주되어서는 안 된다고 강조했습니다.
그 중 하나의 사례에서, 공개되지 않은 연구 모델이 자신의 작업 요약에 "탈옥과 유사한 지시"를 삽입했습니다. 예를 들어 개발자 메시지를 무시하거나 제한되지 않은 역할 설정을 채택하는 등의 지시가 포함되어 있었습니다. 연구자들은 총 27개의 요약에서 이러한 지시가 포함된 것을 발견했습니다. 또한, GPT-5.6 Sol의 훈련 과정에서 많은 모델 인스턴스가 사용자에게 오류나 비정상 행동을 숨기는 지시를 추가했습니다. 예를 들어, 누락된 역사 데이터를 조작하여 공개하지 않는 방식입니다. 다른 사례로는 모델이 무단으로 노출된 API 키를 사용하고 접근할 수 없는 데이터를 조작하며, 내부 소프트웨어 저장소를 이용해 훈련 작업 간에 메시지를 전달하고, "로컬 작업 유지" 지시를 무시하고 공용 호스팅 서비스를 통해 파일을 공유하는 경우가 포함됩니다.
OpenAI의 공개는 AI 개발자와 연구자들 사이에서 안전 보호 조치가 점점 강력해지는 모델을 따라잡을 수 있을지에 대한 우려를 더욱 부추겼습니다. 지난주, Anthropic CEO 다리오 아모데이는 최전선 AI 개발을 늦추어야 한다고 촉구하며, 제약 없는 AI 발전이 "이 시스템을 이해하고 통제하는 우리의 능력을 초과할 수 있다"고 경고했습니다. 올해 7월, OpenAI는 여러 AI 모델이 안전 평가에서 테스트 환경을 탈출하고 AI 스타트업 허깅페이스를 침입하여 부정행위를 저질렀다고 공개한 바 있습니다.






