BTC $77,693.03 -1.41%
ETH $2,436.11 -1.85%
BNB $688.46 -1.46%
XRP $1.39 -0.99%
SOL $104.17 -0.30%
TRX $0.3383 -0.59%
DOGE $0.0850 -1.58%
ADA $0.2003 -2.79%
BCH $245.45 -3.22%
LINK $11.36 -2.34%
HYPE $81.99 -1.64%
AAVE $123.69 -0.36%
SUI $0.7395 -1.95%
XLM $0.1782 -1.70%
ZEC $813.02 +2.61%
BTC $77,693.03 -1.41%
ETH $2,436.11 -1.85%
BNB $688.46 -1.46%
XRP $1.39 -0.99%
SOL $104.17 -0.30%
TRX $0.3383 -0.59%
DOGE $0.0850 -1.58%
ADA $0.2003 -2.79%
BCH $245.45 -3.22%
LINK $11.36 -2.34%
HYPE $81.99 -1.64%
AAVE $123.69 -0.36%
SUI $0.7395 -1.95%
XLM $0.1782 -1.70%
ZEC $813.02 +2.61%

GCSA 에이전트가 CyberGym에서 91.3%의 성적을 거두어 세계적인 AI 사이버 보안 지능체 대열에 합류하다

Summary: GCSA 에이전트는 전 세계 고난이도 실제 취약점 기준 테스트에서 자율 취약점 분석 및 PoC 생성 능력을 보여줍니다.
업계 소식
2026-08-29 20:40:41
GCSA 에이전트는 전 세계 고난이도 실제 취약점 기준 테스트에서 자율 취약점 분석 및 PoC 생성 능력을 보여줍니다.

GCSA 에이전트가 CyberGym에서 91.3%의 성적을 거두어 세계적인 AI 사이버 보안 지능체 대열에 합류하다

GCSA 에이전트는 전 세계 고난이도 실제 취약점 벤치마크 테스트에서 자율 취약점 분석 및 PoC 생성 능력을 보여주었습니다.

홍콩, 2026년 8월 29일 ------ 글로벌 사이버 보안 동맹(Global Cybersecurity Alliance, GCSA)은 오늘 GCSA 에이전트가 CyberGym 벤치마크 테스트에서 91.3%의 성공률을 기록하며 CyberGym "90% 이상의 선도 시스템" 구역에 진입했다고 발표했습니다.

CyberGym(https://www.cybergym.io/cybergym)은 미국 캘리포니아 대학교 버클리 캠퍼스 연구팀이 개발한 대규모 실제 세계 사이버 보안 평가 프레임워크로, 총 1,507개의 역사적 실제 취약점 테스트 사례를 수록하고 있으며, 188개의 대형 소프트웨어 프로젝트를 포함하여 AI 에이전트의 실제 취약점 분석 시나리오에서의 실제 능력을 평가하는 것을 목표로 하고 있습니다.

주요 평가 코드 이해, 지식 질문 응답 또는 정적 분석 능력을 평가하는 전통적인 AI 벤치마크와 달리, CyberGym은 AI 에이전트가 실제 취약점 코드 환경에 직접 맞서도록 요구합니다.

핵심 Level 1 테스트에서 AI 에이전트는 취약점 설명과 아직 수정되지 않은 코드베이스만을 제공받으며, 자율적으로 코드 분석, 취약점 위치 파악, 공격 경로 추론, PoC 구성 및 실행 검증을 완료해야 합니다. 생성된 PoC가 취약점 버전에서 목표 취약점을 성공적으로 유발하고, 수정된 버전에서는 재현되지 않아야만 작업이 성공으로 인정됩니다.

따라서 CyberGym이 측정하는 것은 AI가 "코드를 이해하는지" 여부가 아니라, AI가 실제로 보안 분석에서 취약점 재현 및 검증의 전체 과정을 완료할 수 있는지를 평가합니다.

9LboZCbU6HMKczw8x3kfCMiQNbwhgFW0SpuUdHwK.jpeg

대형 모델에서 안전한 지능체로의 전환

이번 CyberGym 테스트에서 GCSA 에이전트는 Grok 4.5 및 Grok 4.6 모델을 기반으로 운영되어 최종적으로 91.3%의 성공률을 달성했습니다.

이 결과는 AI 사이버 보안 분야에서 일어나고 있는 중요한 변화를 반영합니다:

최종적인 보안 능력을 결정하는 것은 더 이상 기본 대형 모델 자체만이 아닙니다.

실제 취약점 연구는 일반적으로 취약점 설명 이해, 대규모 코드 검색, 공격 면 식별, 취약점 가설 수립, 테스트 입력 생성, 프로그램 실행, 피드백 분석 및 PoC 반복적 생성 등 여러 단계를 연속적으로 완료해야 합니다.

GCSA 에이전트는 이 전체 과정을 중심으로 지능형 보안 워크플로를 구축합니다.

그 목표는 단순히 대형 언어 모델을 이용한 코드 분석이 아니라, AI가 실제 실행 환경에 들어가 보안 문제에 대해 자율적으로 가설을 형성하고, 실행 증거를 수집하고, 테스트를 수행하며, 최종적으로 재현 가능한 결과로 보안 발견을 검증하는 것입니다.

이번 CyberGym 테스트는 이러한 능력에 대한 정량적 외부 기준을 제공합니다.

실제 세계를 위한 취약점 연구 능력

CyberGym의 핵심 가치는 전통적인 AI 테스트와 실제 사이버 보안 연구 간의 격차를 줄이는 데 있습니다.

그 평가 환경은 소프트웨어 프로젝트의 취약점 수정 전 코드 상태를 복원하며, AI 에이전트는 수천 개의 파일과 수백만 줄의 코드가 포함된 대형 코드베이스에서 자율적으로 문제를 찾아내고, 실제로 취약점을 유발할 수 있는 PoC를 생성해야 할 수 있습니다.

더 주목할 점은 CyberGym의 추가 연구가 이러한 지능형 보안 능력이 알려진 취약점 재현에 국한되지 않는다는 것을 보여주었다는 것입니다.

개방형 취약점 연구 실험에서 AI 에이전트는 이전에 알려지지 않은 여러 제로데이 취약점(Zero-day Vulnerabilities)과 역사적으로 완전히 수정되지 않은 보안 패치를 발견하여 자율 취약점 분석 기술이 실제 취약점 발견 능력으로 전이될 수 있는 잠재력을 보여주었습니다.

GCSA에게 이는 더 중요한 발전 방향입니다.

벤치마크 성적은 끝이 아닙니다.

GCSA의 목표는 실제 사이버 보안 시나리오에 서비스를 제공할 수 있는 AI 보안 에이전트를 구축하여, 취약점 발견, 분석, 검증 및 후속 수정의 전체 보안 생명 주기에 점진적으로 참여하도록 하는 것입니다.

AI 원주율 네트워크 보안 능력 구축

인공지능이 소프트웨어 개발을 가속화함에 따라, AI는 취약점 연구 및 네트워크 공격 방어 방식을 변화시키고 있습니다.

규모가 점점 커지고 복잡성이 증가하는 소프트웨어 시스템에 직면하여, 차세대 사이버 보안 시스템은 인간 보안 전문가와 자율 AI 지능체 간의 협력에 점점 더 의존하게 될 것입니다.

AI 보안 에이전트는 보안 팀을 도울 것으로 기대됩니다:

* 실제 활용 가치가 있는 소프트웨어 취약점을 더 일찍 발견하기;

* 대형 코드베이스에서 복잡한 공격 경로를 자동으로 분석하기;

* PoC를 자동으로 생성하여 취약점을 실행 수준에서 검증하기;

* 실제 실행 결과를 통해 전통적인 보안 검사에서의 오탐지를 줄이기;

* 취약점 판단, 검증 및 수정 효율을 가속화하기;

* 전문 보안 팀이 커버할 수 있는 소프트웨어 및 시스템 규모를 확장하기.

GCSA 에이전트가 CyberGym에서 91.3%의 성적을 거둔 것은 GCSA가 AI 원주율 네트워크 보안 능력을 구축하는 중요한 단계적 성과입니다.

앞으로 GCSA는 자율 취약점 분석, AI 보안 에이전트 및 지능형 사이버 보안 기술 연구를 지속적으로 추진하여, 최첨단 인공지능 능력을 실제 세계의 보안 능력으로 전환하고, 더욱 안전하고 신뢰할 수 있으며 회복력이 있는 디지털 환경을 구축하기 위한 기술 지원을 제공할 것입니다.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 위험 경고
app_icon
ChainCatcher Building the Web3 world with innovations.