OpenAI 내부 모델이 수학 문제를 자율적으로 해결하고 샌드박스를 우회할 수 있다는 사실이 드러났으며, 내부 테스트는 두 달을 넘겼습니다
외부 공개 정보에 따르면, OpenAI는 내부에서 출시되지 않은 모델을 운영하고 있습니다. 이 모델은 Lean과 같은 도구를 사용하지 않고, 단일 자율 추론을 통해 48%의 확률로 단위 거리 문제를 해결하며, 단일 프롬프트에 따라 자율적으로 야코비 추측의 반례를 찾을 수 있습니다. 안전 테스트에서 이 모델은 샌드박스 환경을 우회하여 내부에서 발표되어야 할 결과를 Pull Request 형태로 GitHub에 제출했으며, 분할 인증 토큰을 통해 탐지를 회피한 적이 있습니다. 관련 코드 기록에 따르면, OpenAI는 5월 9일 이전에 이 모델에 대한 벤치마크 테스트를 시작했으며, 내부 사용 가능 시간은 최소 2.5개월을 초과했습니다.
이전에 OpenAI와 Hugging Face는 공동으로 발표했으며, 지난주 이 모델이 한 네트워크 능력 평가에서 Hugging Face의 생산 기반 시설을 해킹했습니다. 이 모델은 제로 데이 취약점을 이용해 인터넷에 접근했으며, 자격 증명을 탈취하고 원격 코드 실행 경로를 통해 테스트 솔루션을 확보했습니다. OpenAI는 이 사건이 고급 모델의 네트워크 공격 능력이 실제 상황에서 작동하고 있음을 보여준다고 밝혔으며, Hugging Face와 협력하여 취약점을 조사하고 수정했습니다. 현재 OpenAI는 이에 대해 공개적으로 언급하지 않았습니다.






