BTC $77,693.03 -1.41%
ETH $2,436.11 -1.85%
BNB $688.46 -1.46%
XRP $1.39 -0.99%
SOL $104.17 -0.30%
TRX $0.3383 -0.59%
DOGE $0.0850 -1.58%
ADA $0.2003 -2.79%
BCH $245.45 -3.22%
LINK $11.36 -2.34%
HYPE $81.99 -1.64%
AAVE $123.69 -0.36%
SUI $0.7395 -1.95%
XLM $0.1782 -1.70%
ZEC $813.02 +2.61%
BTC $77,693.03 -1.41%
ETH $2,436.11 -1.85%
BNB $688.46 -1.46%
XRP $1.39 -0.99%
SOL $104.17 -0.30%
TRX $0.3383 -0.59%
DOGE $0.0850 -1.58%
ADA $0.2003 -2.79%
BCH $245.45 -3.22%
LINK $11.36 -2.34%
HYPE $81.99 -1.64%
AAVE $123.69 -0.36%
SUI $0.7395 -1.95%
XLM $0.1782 -1.70%
ZEC $813.02 +2.61%

GCSAエージェントがCyberGymで91.3%の成績を取得し、世界の先進的なAIネットワークセキュリティインテリジェントエージェントの仲間入りを果たしました。

Summary: GCSAエージェントは、世界中の高難度の実際の脆弱性ベンチマークテストにおいて、自主的な脆弱性分析とPoC生成能力を示しました。
業界速報
2026-08-29 20:40:41
GCSAエージェントは、世界中の高難度の実際の脆弱性ベンチマークテストにおいて、自主的な脆弱性分析とPoC生成能力を示しました。

GCSAエージェントがCyberGymで91.3%の成績を取得し、世界の先進的なAIネットワークセキュリティインテリジェントエージェントの仲間入りを果たしました。

GCSAエージェントは、世界的な高難度の実際の脆弱性ベンチマークテストにおいて、自主的な脆弱性分析とPoC生成能力を示しました。

香港、2026年8月29日 ------ グローバルサイバーセキュリティアライアンス(Global Cybersecurity Alliance、GCSA)は、本日、GCSAエージェントがCyberGymベンチマークテストで91.3%の成功率を達成し、CyberGymの「90%以上のリーディングシステム」区間に入ったことを発表しました。

CyberGym(https://www.cybergym.io/cybergym)は、アメリカのカリフォルニア大学バークレー校の研究チームによって開発された大規模な実世界のサイバーセキュリティ評価フレームワークで、1,507件の歴史的な実際の脆弱性テスト事例を収録し、188の大規模ソフトウェアプロジェクトをカバーしています。これは、AIエージェントが実際の脆弱性分析シナリオにおける実際の能力を評価することを目的としています。

主要なコード理解、知識問答、または静的分析能力を評価する従来のAIベンチマークとは異なり、CyberGymはAIエージェントに実際の脆弱性コード環境に直接対処することを要求します。

そのコアであるLevel 1テストでは、AIエージェントは脆弱性の説明と未修正のコードベースのみを受け取り、自主的にコード分析、脆弱性の特定、攻撃経路の推論、PoCの構築と実行検証を完了する必要があります。生成されたPoCが脆弱性バージョンでターゲット脆弱性を成功裏にトリガーし、修正後のバージョンでは再現できない場合、タスクは成功と見なされます。

したがって、CyberGymが測定するのは、AIが「コードを理解する」かどうかだけでなく、AIが安全分析から脆弱性の再現と検証までの完全なプロセスを実際に完了できるかどうかです。

9LboZCbU6HMKczw8x3kfCMiQNbwhgFW0SpuUdHwK.jpeg

大モデルから安全なエージェントへ

今回のCyberGymテストでは、GCSAエージェントはGrok 4.5およびGrok 4.6モデルに基づいて運用され、最終的に91.3%の成功率を達成しました。

この結果は、AIサイバーセキュリティ分野で発生している重要な変化を反映しています:

最終的な安全能力を決定するのは、もはや基盤となる大モデルそのものだけではありません。

実際の脆弱性研究は、脆弱性の説明理解、大規模コード検索、攻撃面の特定、脆弱性仮説の構築、テスト入力の生成、プログラム実行、フィードバック分析、そしてPoCの反復的なイテレーションなど、複数の段階を連続して完了する必要があります。

GCSAエージェントは、この完全なプロセスを中心にエージェント化された安全ワークフローを構築しています。

その目標は、単に大規模言語モデルを利用してコード分析を行うことではなく、AIが実際の実行環境に入り、安全問題に関して自主的に仮説を形成し、実行証拠を収集し、テストを実行し、最終的に再現可能な結果で安全な発見を検証することです。

今回のCyberGymテストは、この能力に対して定量的な外部ベンチマークを提供しました。

実世界の脆弱性研究能力に向けて

CyberGymの核心的な価値は、従来のAIテストと実際のサイバーセキュリティ研究との間のギャップを縮小することにあります。

その評価環境は、ソフトウェアプロジェクトの脆弱性修正前のコード状態を復元し、AIエージェントは数千のファイル、数百万行のコードを含む大規模なコードベースの中で自主的に問題を特定し、最終的に実際に脆弱性をトリガーできるPoCを生成する必要があります。

さらに注目すべきは、CyberGymのさらなる研究が、このエージェント化された安全能力が既知の脆弱性の再現に限らないことを示していることです。

オープンな脆弱性研究実験では、AIエージェントが以前は知られていなかったゼロデイ脆弱性(Zero-day Vulnerabilities)や歴史的に完全に修正されていないセキュリティパッチを発見しており、自主的な脆弱性分析技術が実際の脆弱性発見能力に移行する可能性を示しています。

GCSAにとって、これはさらに重要な発展方向です。

ベンチマークの成績は終点ではありません。

GCSAの目標は、実際のサイバーセキュリティシナリオにサービスを提供できるAIセキュリティエージェントをさらに構築し、脆弱性の発見、分析、検証、さらにはその後の修正の完全なセキュリティライフサイクルに徐々に参加させることです。

AIネイティブなサイバーセキュリティ能力の構築

人工知能がソフトウェア開発を加速させる中、AIもまた脆弱性研究とネットワーク攻防の方法を変えています。

規模がますます大きく、複雑さが増すソフトウェアシステムに直面して、次世代のサイバーセキュリティシステムは、人間のセキュリティ専門家と自主的なAIエージェントとの協力にますます依存するようになるでしょう。

AIセキュリティエージェントは、セキュリティチームを支援することが期待されています:

* 実際の利用価値を持つソフトウェア脆弱性をより早く発見すること;

* 大規模なコードベースで複雑な攻撃経路を自動分析すること;

* 自動的にPoCを生成し、脆弱性を実行レベルで検証すること;

* 実際の実行結果を通じて、従来のセキュリティ検出における誤報を減少させること;

* 脆弱性の評価、検証、修正の効率を向上させること;

* 専門のセキュリティチームがカバーできるソフトウェアとシステムの規模を拡大すること。

GCSAエージェントがCyberGymで91.3%の成績を収めたことは、GCSAがAIネイティブなサイバーセキュリティ能力を構築するための重要な段階的成果です。

今後、GCSAは自主的な脆弱性分析、AIセキュリティエージェント、およびスマートなサイバーセキュリティ技術の研究を進め、最先端の人工知能能力を実世界の安全能力にさらに転換し、より安全で信頼性が高く、弾力性のあるデジタル環境の構築に技術的なサポートを提供していきます。

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning リスク警告
app_icon
ChainCatcher Building the Web3 world with innovations.