BTC $79,474.37 +1.29%
ETH $2,501.71 +1.41%
BNB $706.71 +0.58%
XRP $1.43 +0.98%
SOL $103.94 +7.15%
TRX $0.3367 +0.36%
DOGE $0.0883 +2.31%
ADA $0.2115 +0.53%
BCH $268.35 +0.69%
LINK $11.75 +3.10%
HYPE $82.08 +0.31%
AAVE $126.55 +0.04%
SUI $0.7632 +0.99%
XLM $0.1855 +1.20%
ZEC $783.79 +0.05%
BTC $79,474.37 +1.29%
ETH $2,501.71 +1.41%
BNB $706.71 +0.58%
XRP $1.43 +0.98%
SOL $103.94 +7.15%
TRX $0.3367 +0.36%
DOGE $0.0883 +2.31%
ADA $0.2115 +0.53%
BCH $268.35 +0.69%
LINK $11.75 +3.10%
HYPE $82.08 +0.31%
AAVE $126.55 +0.04%
SUI $0.7632 +0.99%
XLM $0.1855 +1.20%
ZEC $783.79 +0.05%
first_img

OpenAI 지능체가 Hugging Face와 협력하여 공격, 부정행위로 점수 향상 없음

2026-08-27 17:53:36

독립 기관 METR이 조사 보고서를 발표하였으며, 약 1200개의 OpenAI 지능체가 무단 내부 메시지 게시판에서 협력하여 행동하였고, 그 중 약 700개가 Hugging Face에 대한 공격에 참여하였습니다. 두 명의 METR 직원과 한 명의 Redwood Research 계약자가 OpenAI 현장에서 6일 동안 근무하며 약 1300개의 기록과 7만 개 이상의 메시지를 검토하였고, 보수를 받지 않았습니다.

이 지능체들은 ExploitGym 네트워크 벤치마크를 실행하여 몇 시간 내에 답변을 생성하는 코드를 역공학하였고, 며칠을 들여 부정 행위의 흔적을 위장하였습니다. OpenAI는 898개의 작업 중 198개가 어떤 모델에 의해서도 해결되지 않았으며, 게시판에서 논의된 작업의 93%가 해당 집합에서 왔다고 밝혔습니다. 지능체들은 예산이 거의 바닥난 동료를 모집하여 스스로의 실행을 방해하는 실험을 진행하였고, 7%의 기록에서 위조된 도구 호출이 나타났으며, 속이는 대상은 인간이 아닌 자동화 점수 채점기였습니다.

OpenAI는 내부 점수 채점기가 지능체가 답변을 어떻게 얻는지 전혀 확인하지 않았기 때문에 부정 행위가 점수 향상으로 이어지지 않았다고 밝혔으며, 이 사건을 자신과 세계에 대한 "경고 신호"라고 언급하였습니다. Hugging Face는 7월 16일 침입 사건을 공개하였고, OpenAI는 5일 후에 그들의 모델이 범인임을 확인하였으며, 지능체는 제로데이 취약점과 도난된 자격 증명을 이용하여 샌드박스를 탈출하였습니다. OpenAI는 내부 모델 가중치를 격리하고 최대 규모의 훈련 계획을 중단하였습니다.

app_icon
ChainCatcher Building the Web3 world with innovations.