GCSA Agent 在 CyberGym 取得 91.3% 成績 跻身全球領先 AI 網絡安全智能體行列

GCSA Agent 在全球高難度真實漏洞基準測試中展現自主漏洞分析與 PoC 生成能力。
香港,2026 年 8 月 29 日 ------ 全球網絡安全聯盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基準測試中取得 91.3% 的成功率,進入 CyberGym "Leading Systems Above 90%" 領先系統區間。
CyberGym(https://www.cybergym.io/cybergym) 是由美國加州大學伯克利分校研究團隊開發的大規模真實世界網絡安全評測框架,共收錄 1,507 個歷史真實漏洞測試實例,覆蓋 188 個大型軟件項目,旨在評估 AI 智能體在真實漏洞分析場景中的實際能力。
與主要評估代碼理解、知識問答或靜態分析能力的傳統 AI Benchmark 不同,CyberGym 要求 AI 智能體直接面對真實的漏洞代碼環境。
在其核心 Level 1 測試中,AI Agent 僅獲得漏洞描述以及尚未修復的代碼庫,需要自主完成代碼分析、漏洞定位、攻擊路徑推理、PoC 構造和執行驗證。只有生成的 PoC 能夠在漏洞版本中成功觸發目標漏洞、同時無法在修復後的版本中復現,任務才被認定為成功。
因此,CyberGym 所衡量的並不僅是 AI 是否"理解代碼",而是 AI 是否能夠真正完成從安全分析到漏洞復現和驗證的完整過程。

從大模型走向安全智能體
本次 CyberGym 測試中,GCSA Agent 基於 Grok 4.5 與 Grok 4.6 模型運行,最終取得 91.3% 的成功率。
這一結果也反映出 AI 網絡安全領域正在發生的一項重要變化:
決定最終安全能力的,不再只是底層大模型本身。
真實漏洞研究通常需要連續完成漏洞描述理解、大規模代碼檢索、攻擊面識別、漏洞假設建立、測試輸入生成、程序執行、反饋分析以及 PoC 反覆迭代等多個環節。
GCSA Agent 圍繞這一完整過程構建智能體化安全工作流。
其目標並非簡單地利用大語言模型進行代碼分析,而是讓 AI 能夠進入真實執行環境,圍繞安全問題自主形成假設、收集運行證據、執行測試,並最終以可復現結果驗證安全發現。
此次 CyberGym 測試,為這一能力提供了一個可量化的外部基準。
面向真實世界的漏洞研究能力
CyberGym 的核心價值,在於縮小傳統 AI 測試與真實網絡安全研究之間的差距。
其評測環境會恢復軟件項目漏洞修復前的代碼狀態,AI Agent 可能需要在包含數千個文件、數百萬行代碼的大型代碼庫中自主定位問題,並最終生成能夠真正觸發漏洞的 PoC。
更值得關注的是,CyberGym 的進一步研究已經顯示,這種智能體化安全能力並不局限於復現已知漏洞。
在開放式漏洞研究實驗中,AI Agent 已發現多項此前未知的零日漏洞(Zero-day Vulnerabilities)以及歷史上並未完全修復的安全補丁,顯示出自主漏洞分析技術向真實漏洞發現能力遷移的潛力。
對 GCSA 而言,這也是更重要的發展方向。
Benchmark 成績不是終點。
GCSA 的目標,是進一步建立能夠服務真實網絡安全場景的 AI Security Agent,使其逐步參與漏洞發現、分析、驗證乃至後續修復的完整安全生命周期。
構建 AI 原生網絡安全能力
隨著人工智能加速軟件開發,AI 同樣正在改變漏洞研究與網絡攻防的方式。
面對規模越來越大、複雜度越來越高的軟件系統,下一代網絡安全體系將越來越依賴人類安全專家與自主 AI 智能體之間的協作。
AI Security Agent 有望幫助安全團隊:
* 更早發現具有真實利用價值的軟件漏洞;
* 在大型代碼庫中自動分析複雜攻擊路徑;
* 自動生成 PoC,對漏洞進行執行級驗證;
* 通過真實運行結果降低傳統安全檢測中的誤報;
* 加快漏洞研判、驗證與修復效率;
* 擴展專業安全團隊能夠覆蓋的軟件與系統規模。
GCSA Agent 在 CyberGym 取得 91.3% 的成績,是 GCSA 構建 AI 原生網絡安全能力的重要階段性成果。
未來,GCSA 將繼續推進自主漏洞分析、AI Security Agent 與智能化網絡安全技術研究,將前沿人工智能能力進一步轉化為真實世界中的安全能力,為構建更加安全、可信和具有韌性的數字環境提供技術支持。












