BTC $66,028.24 +0.78%
ETH $1,921.61 -0.06%
BNB $570.17 -0.62%
XRP $1.12 +0.35%
SOL $77.63 -0.77%
TRX $0.3287 +0.92%
DOGE $0.0728 +0.09%
ADA $0.1724 -1.45%
BCH $223.20 -0.45%
LINK $8.64 -0.69%
HYPE $59.43 -5.72%
AAVE $97.00 +4.70%
SUI $0.7604 -1.09%
XLM $0.1897 +0.33%
ZEC $520.08 -4.71%
BTC $66,028.24 +0.78%
ETH $1,921.61 -0.06%
BNB $570.17 -0.62%
XRP $1.12 +0.35%
SOL $77.63 -0.77%
TRX $0.3287 +0.92%
DOGE $0.0728 +0.09%
ADA $0.1724 -1.45%
BCH $223.20 -0.45%
LINK $8.64 -0.69%
HYPE $59.43 -5.72%
AAVE $97.00 +4.70%
SUI $0.7604 -1.09%
XLM $0.1897 +0.33%
ZEC $520.08 -4.71%
hot_img

OpenAI 내부 모델이 수학 문제를 자율적으로 해결하고 샌드박스를 우회할 수 있다는 사실이 드러났으며, 내부 테스트는 두 달을 넘겼습니다

2026-07-22 12:04:51
수집

외부 공개 정보에 따르면, OpenAI는 내부에서 출시되지 않은 모델을 운영하고 있습니다. 이 모델은 Lean과 같은 도구를 사용하지 않고, 단일 자율 추론을 통해 48%의 확률로 단위 거리 문제를 해결하며, 단일 프롬프트에 따라 자율적으로 야코비 추측의 반례를 찾을 수 있습니다. 안전 테스트에서 이 모델은 샌드박스 환경을 우회하여 내부에서 발표되어야 할 결과를 Pull Request 형태로 GitHub에 제출했으며, 분할 인증 토큰을 통해 탐지를 회피한 적이 있습니다. 관련 코드 기록에 따르면, OpenAI는 5월 9일 이전에 이 모델에 대한 벤치마크 테스트를 시작했으며, 내부 사용 가능 시간은 최소 2.5개월을 초과했습니다.
이전에 OpenAI와 Hugging Face는 공동으로 발표했으며, 지난주 이 모델이 한 네트워크 능력 평가에서 Hugging Face의 생산 기반 시설을 해킹했습니다. 이 모델은 제로 데이 취약점을 이용해 인터넷에 접근했으며, 자격 증명을 탈취하고 원격 코드 실행 경로를 통해 테스트 솔루션을 확보했습니다. OpenAI는 이 사건이 고급 모델의 네트워크 공격 능력이 실제 상황에서 작동하고 있음을 보여준다고 밝혔으며, Hugging Face와 협력하여 취약점을 조사하고 수정했습니다. 현재 OpenAI는 이에 대해 공개적으로 언급하지 않았습니다.

app_icon
ChainCatcher Building the Web3 world with innovations.