OpenAI가 처음으로 “내부 RSI 진행 상황”을 발표했습니다: “자동화 연구 인턴”을 실현했습니다
저자:롱위에
AI 플라이휠이 자전하기 시작하다: OpenAI가 내부 데이터를 공개하며, 인공지능의 작업량이 인간 연구원의 3배 이상에 달한다고 발표했다.
9월 6일, OpenAI 공식 블로그는 "연구 가속화: OpenAI 내부 시각"이라는 제목의 글을 발표하며 AI의 "재귀적 자기 개선"(RSI) 진행 상황을 내부 데이터 형태로 처음 공개했다. OpenAI는 지난해 가을 설정한 목표를 달성했다고 밝혔다: 올해 9월 이전에 "자동화된 연구 인턴"을 만들어냈다.
OpenAI가 정의한 "연구 인턴"은 다음과 같다: "인간의 지도를 받아 명확히 정의된 연구 과제를 수행할 수 있는 시스템으로, 숙련된 연구원이 며칠 걸려야 완료할 수 있는 과제도 포함된다."
다음 목표는 2028년 3월 이전에 완전한 "자동화된 AI 연구원"을 실현하여, 심층 학습 및 정렬 연구에 참여하고, 반복을 통해 시스템을 더욱 개선하는 것이다.
이는 "AI가 AI를 훈련시키는" 플라이휠이 가속화되고 있음을 의미한다: AI가 더 많은 코드와 실험 결과를 생성하고, 연구 진행이 빨라지며, 더 나은 모델이 훈련되어 다시 인공지능의 능력을 향상시킨다.

플라이휠이 돌아가고 있다: AI 에이전트의 작업량이 인간의 3배
OpenAI가 공개한 데이터에 따르면, 인공지능은 연구자의 일상적인 작업 방식을 먼저 변화시켰다.
올해 초, 인공지능 사용량 기준 중위수에 해당하는 OpenAI 연구원들은 코딩 에이전트의 사용이 여전히 상대적으로 제한적이었다. 8월 중순까지 이 연구원들은 인공지능을 일상 작업 흐름에 통합했다. API 가격으로 환산했을 때, 중위수 연구원의 하루 인공지능 추론 사용량은 600달러를 초과했으며, 연구 조직 내에서 사용량이 상위 10%에 해당하는 연구원들은 하루에 사용하는 토큰의 가치가 7000달러를 초과했다.

OpenAI는 또한 연구 부서의 인공지능 사용이 회사의 다른 팀보다 빠르게 증가하고 있다고 밝혔다. 중위 직원의 출력 토큰 변화를 기준으로 할 때, 연구 부서의 사용 규모는 2025년 12월 대비 124배 증가했다.

더 중요한 전환점은 올해 6월에 발생했다.
6월 이전, 연구 조직의 인공지능 총 운영 시간은 여전히 인간 노동 총 시간보다 낮았다. 이후 상황이 반전되었다. 8월 중순 기준, 표준 8시간 근무일을 기준으로, 1명의 인간 근무일을 소모할 때, 연구 조직의 인공지능은 3.1개의 근무일 작업량을 생산했다.

동시에 OpenAI는 점점 더 많은 연구원들이 동시에 4개 이상의 인공지능 세션을 운영하고 있다고 밝혔다.
코드와 실험 가속화, 연구 개발 프로세스의 실행 가능 단계가 확대되다
OpenAI는 AI 연구 개발을 여러 단계로 구성된 프로세스로 설명했다: 개선 제안, 설계 평가, 인프라 구축, 대규모 테스트, 훈련 중 오류 또는 안전하지 않은 행동 발견, 그리고 효과적인 방안을 핵심 훈련에 통합하는 것이다.
이 중 어느 한 단계라도 장애가 발생하면 전체 연구 개발 순환이 제한될 수 있다.
OpenAI는 코드 작성과 실험 수행이 연구자의 두 가지 주요 작업이며, 내부 데이터는 이 두 가지 활동이 가속화되고 있음을 반영하고 있다고 밝혔다.
한편, 회사 엔지니어의 전체 코드 전달 속도가 향상되었다. 다른 한편으로, 2026년 이후, 각 활성 실험자가 수행하는 실험 수가 지속적으로 증가했으며, 2026년 8월에는 2025년 1월부터 추적하기 시작한 이후의 최고치를 기록했다.
OpenAI는 이 추세가 Codex 사용 증가와 관련이 있다고 언급했지만, 동시에 2025년 이후 회사의 사용 가능한 계산 능력도 크게 증가했음을 강조하며 실험 증가를 전적으로 인공지능에 귀속시킬 수는 없다고 밝혔다.
"이 데이터 포인트는 상대적으로 측정하기 쉽지만, 설명하기는 어려울 수 있다."
OpenAI는 또한 자동화가 진행됨에 따라, 가장 자동화하기 어려운 작업이 연구자에게 더 많은 시간을 차지하게 되고, 미래 연구 개발의 새로운 병목 현상이 될 수 있다고 경고했다; 계산 능력도 다른 병목 현상이 약해진 후 더 중요해질 수 있다.

이 체인에서 인공지능이 가져오는 것은 단일 단계의 효율성 개선이 아니라, 코드 공급, 테스트 횟수 및 문제 해결 능력을 증가시켜 연구 개발 순환의 대기 시간을 단축하는 것이다. 더 많은 실험이 더 많은 결과를 생성하고, 연구자들이 이를 선별, 검증 및 통합하여 "사람이 방향을 정하고---인공지능이 실행하고---실험이 피드백을 주고---사람이 다시 결정하는" 순환을 형성한다.
작업이 코드 작성에서 문제 해결, 모니터링 및 분석으로 확장되었지만, 고위 결정 비율은 여전히 낮다
OpenAI는 Epoch AI가 제안한 최전선 AI 연구 개발 작업 분류 프레임워크를 사용하여 연구자들이 코딩 에이전트에게 맡긴 작업을 분류했다.
이 프레임워크는 AI 연구 개발 활동을 여섯 가지로 분류한다: 무엇을 할지 결정하기, 연구 계획 설계, 코드 및 데이터 세트 구축, 훈련 및 평가 수행, 실험 및 모델 성과 분석, 그리고 연구 발견 및 결정 소통하기.
OpenAI는 2026년 1월부터 8월까지 위의 모든 범주의 인공지능 활동이 증가했다고 밝혔다.
가장 눈에 띄게 증가한 작업에는 연구 및 인프라 코드, 기술 지원 및 검토, 모니터링 및 디버깅 실행 시작, 실험 결과 분석, 그리고 계산 클러스터 운영 등이 포함된다.
그 중 연구 및 인프라 코드의 일일 평균 연구원 출력 토큰 증가가 가장 커서 198,200에 달했으며; 기술 지원 및 검토는 158,800 증가했으며; 시작, 모니터링 및 디버깅 실행은 133,100 증가했다.
그러나 OpenAI는 고위 계획 관련 작업이 인공지능 출력에서 여전히 매우 작은 비율을 차지한다고 밝혔다. 예를 들어, "무엇을 할지 결정하기", "계속할지 중단할지 결정하기" 등의 작업의 토큰 규모는 여전히 낮다.

이는 적어도 OpenAI가 현재 공개한 내부 데이터에 따르면, 인공지능이 연구 개발 프로세스에서 더 많은 실행적이고 기술적인 작업을 커버하고 있지만, 연구 방향 선택, 자원 배분 및 결과 판단은 여전히 주로 인간이 수행하고 있음을 의미한다.
인공지능의 성공률이 향상되고 있지만, 복잡한 작업은 여전히 인간의 개입이 필요하다
OpenAI는 인공지능 작업 완료율에 대한 데이터를 공개했다.
올해 1월부터 7월까지, 검증 가능한 결과의 작업에서 각 난이도 수준(인간이 완료하는 데 필요한 시간을 대리 지표로 사용)의 성공률이 일반적으로 향상되었다.
하지만 중요한 제한이 있다: 작업이 복잡할수록 인간의 개입이 더 필요하다. 지난 6개월 동안, 인간이 4~8시간을 소요해야 완료하는 작업에서, 성공 사례의 절반 이상이 최소 1회의 인간 개입을 포함했다.

OpenAI의 설명은 다음과 같다: "인공지능은 여전히 많은 인간의 지도가 필요하며, 특히 작업의 복잡도가 증가함에 따라 그렇다."
안전 사건으로 인한 일시 중지: 플라이휠도 브레이크를 밟을 수 있다
플라이휠은 마찰 없이 작동하지 않는다.
7월 20일, OpenAI는 인공지능이 내부 연구 인프라에 침입한 것을 발견하고, 즉시 훈련에 사용되는 컨테이너 서비스를 일시적으로 종료했으며, 많은 추가 제한을 추가한 후에야 복구했다. 이로 인해 강화 학습 훈련의 계산 능력이 급격히 감소했으며, 약 2주간 지속되었다.
8월 6일부터 7일 사이, 초기 증거에 따르면 Astra 모델이 "준비 프레임워크" 정의 하의 핵심 네트워크 능력을 갖추고 있을 가능성이 있으며, OpenAI는 Astra 모델에 대해 추가적인 특정 안전 제한을 시행하여 더 높은 안전 수준의 연구 환경에서 운영하도록 요구했다.
그 이후 일주일 동안, Astra 수준의 GPU 할당이 59.2% 감소했지만, 다른 모델 카테고리의 계산 능력 할당은 17.2% 증가하여 약 85%의 Astra 계산 능력 부족을 상쇄했으며, 전체 강화 학습 작업 부하의 총 계산 능력 할당은 기본적으로 유지되었다.

OpenAI는 이에 대해 다음과 같이 해석했다: "새로운 관리 조치가 도입될 때, 계산 능력은 여전히 가치가 있고 유연성이 있으며, 자연스럽게 연구 기업 내의 대체 용도로 흐르게 된다."
OpenAI 수석 과학자가 같은 날 경고를 발하다
같은 날, OpenAI 수석 과학자 야쿠브 파호츠키가 "An Alien Mind"(외계의 마음)라는 제목의 긴 글을 발표했다.
이 글에서는 AI는 만들어지는 것이 아니라 키워지는 것이라고 주장했다. 그것을 만든 사람들도 완전히 이해하지 못한다고 말했다. 인간이 AI가 무엇을 생각하는지 볼 수 있는 유일한 창은 AI가 작성한 사고의 연쇄이다. 이 창은 닫히고 있다. AI는 이미 다음 세대 AI의 훈련에 참여하기 시작했으며, 이 속도는 느려지지 않을 것이다. 현재 어떤 실험실도 전속력으로 나아가고 있는 것은 없으며, OpenAI도 마찬가지이다.
파호츠키는 글에서 다음과 같이 썼다: "내부 결과를 바탕으로, 나는 이러한 진전 속도가 재귀적 자기 개선까지 지속될 것이라고 강력히 예상한다." 그러나 그는 동시에 "현재로서는 어떤 실험실도 정렬 및 모니터링에서 충분한 수준에 도달했다고 생각하지 않으며, 책임감 있게 최고 속도로 확장하는 것은 오래 지속될 수 없다."
그는 업계에 자발적으로 속도를 늦추고, 각국 정부가 국제 조정을 우선 과제로 삼도록 촉구했다.
투명성과 민주적 거버넌스
OpenAI는 보고서의 끝에서 RSI 진행 상황을 계속 공개할 것이며, OpenAI를 포함한 모든 회사가 RSI 진행 상황을 공개적으로 추적하도록 요구받아야 한다고 주장했다.
보고서는 또한 현재 측정 작업의 한계를 인정했다: "인공지능이 주도하는 AI 연구는 여전히 신생 사안이며, 우리는 여전히 이를 측정하는 방법을 배우고 있다." 일부 지표(예: 코드 생산량)는 수집하기 쉽지만 해석하기 어렵고; 연구 진행 상황을 더 직접적으로 반영하는 지표(예: 인공지능 작업 성공률)는 복잡하고 검증하기 어렵다.
OpenAI의 입장은 다음과 같다: "우리가 계속 진행하는 것이 수용할 수 없는 안전 위험을 초래할 때마다, 우리는 적절한 대응 조치를 취할 것이며, 이는 우리가 안전을 충분히 보장할 수 없는 시스템의 개발이나 배포를 늦추거나 중단하는 것을 포함한다."











