Giành được 15 lỗ hổng zero-day hàng đầu: Khung debug của thực thể trí tuệ nhân tạo được xây dựng bởi 0G Lab hợp tác với New National, Đại học Bắc Kinh và đội ngũ Bắc Kinh Bưu điện
Hệ thống phân tán "Chén Thánh" ------ Giao thức đồng thuận (Consensus Protocols), từ lâu đã là "Địa ngục lỗi" của các kỹ sư hạ tầng hàng đầu. Do trạng thái của nó cực kỳ phức tạp và nhiều nút liên kết, các phương pháp kiểm tra truyền thống và LLM đơn thể gần như bất lực trước các Deep Bug (lỗi logic sâu) cứng cáp.
Gần đây, trong bài báo mới nhất được gửi đến ICML 2026, các nhà nghiên cứu từ 0G Labs cũng như Đại học Quốc gia Singapore, Đại học Bắc Kinh, Đại học Bưu chính Viễn thông Bắc Kinh và các đội ngũ học thuật và công nghiệp hàng đầu đã đề xuất khung kiểm tra tự động đầu tiên kết hợp sâu sắc kiến thức lĩnh vực với nhiều Agent của mô hình lớn ------ Agora.
Khung này thông qua kiến trúc đổi mới, nhắm thẳng vào các điểm đau của giao thức, trong các giao thức cốt lõi công nghiệp và học thuật như Raft, EPaxos, HotStuff, BullShark, đã cắt giảm một cách mạnh mẽ 15 lỗi Deep Bug chưa từng biết đến ở cấp giao thức! So với đó, những mô hình lớn như GPT-5.2, Claude 4.5 đều thất bại, không tìm ra được gì. Trong bối cảnh hệ thống đa tác nhân (Multi-Agent) và "Kiểm toán an toàn tác nhân hóa" (Agentic Quality Control) trở thành những lĩnh vực nóng nhất năm 2026, Agora không chỉ đưa ra một bài báo, mà còn là một giải pháp công nghiệp có thể triển khai.

Bài báo: 《Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents》
1. Bối cảnh: Sự hợp tác mạnh mẽ giữa 0G và NUS, tích lũy kiến thức hệ thống lâu dài và sự kết hợp giữa các mô hình đa tác nhân
Sự tiến hóa của giao thức đồng thuận phân tán vừa là lịch sử đổi mới của thiên tài, vừa là lịch sử đầy máu của các kỹ sư hàng đầu. Như nhà nhận giải Turing Lamport đã nói, đảm bảo tính chính xác của việc thực hiện giao thức phân tán không dễ hơn việc đi qua một mê cung đang rung lắc với mắt bị bịt. Và ngay trên con đường "địa ngục" này, thị trường đang âm thầm chuyển hướng: Theo quan sát của Gartner, lượng tư vấn doanh nghiệp về hệ thống đa tác nhân đã tăng vọt hơn mười lần trong hơn một năm, thị trường nền tảng đa tác nhân cũng bước vào giai đoạn mở rộng nhanh chóng gần như gấp đôi mỗi năm ------ việc sử dụng "sự hợp tác của nhiều Agent" cho việc xác minh hệ thống cốt lõi đang trở thành nhu cầu thiết yếu của ngành.
Đối mặt với con đường địa ngục này, các ông lớn công nghệ với hào quang trên đầu đã tiên phong trong việc khám phá theo kiểu đầu tư lớn. Ví dụ, Anthropic, một trong những công ty hàng đầu trong ngành, gần đây đã thúc đẩy dự án Glasswing trong Claude Code, mặc dù cố gắng sử dụng Agent để tiếp cận kiểm tra cơ sở hạ tầng cốt lõi, nhưng kiến trúc của nó vẫn cực kỳ phụ thuộc vào các mô hình thương mại hàng đầu với tiêu chuẩn cao nhất, chi tiết dự án vẫn chưa rõ ràng và chỉ hợp tác kín đáo với một số ít tổ chức công nghệ lớn và tập đoàn đa quốc gia. Điều nghiêm trọng hơn là, các giải pháp của những ông lớn này có thể thể hiện mức tiêu thụ Token khủng khiếp trong quá trình vận hành, rào cản tính toán cao và con đường đầu tư lớn này đã trực tiếp đẩy các công ty khởi nghiệp và doanh nghiệp vừa và nhỏ có ngân sách hạn chế ra ngoài.
Liệu các công ty nhỏ và cộng đồng mã nguồn mở có phải chịu số phận không thể sử dụng các công cụ kiểm tra lỗ hổng tự động hàng đầu?
Các kỹ sư từ 0G Labs và Liu Xiang từ Đại học Quốc gia Singapore, Song Sa từ Đại học Bưu chính Viễn thông Bắc Kinh, cùng với tiến sĩ Zhang Zhao và nhà nghiên cứu Zhang Ce Yao từ Học viện Thông minh của Đại học Bắc Kinh đã kết hợp kiến thức sâu sắc trong lĩnh vực Agent của mình để thực hiện một cuộc cách mạng đổi mới "lấy nhỏ đánh lớn", công việc của họ đã được gửi đến hội nghị hàng đầu ICML 2026.
"Kiến thức hệ thống lâu dài" trong học thuật đã gặp "điểm đau và nhạy bén" trong ngành công nghiệp, làm thế nào để kích hoạt cuộc cách mạng an toàn hệ thống thế hệ tiếp theo?
Đội ngũ 0G đã tích lũy được kinh nghiệm phong phú trong việc tấn công và phòng thủ cấp sản xuất trong việc triển khai giao thức đồng thuận blockchain; và đội ngũ này có nền tảng học thuật sâu sắc trong các hệ thống phân tán hiệu suất cao, kiểm soát đồng thời cốt lõi và xác minh hình thức hệ thống. Họ hiểu rõ rằng các phương pháp truyền thống (như kiểm tra Fuzzing) thường bị giới hạn bởi sự bùng nổ không gian trạng thái khi đối mặt với các kho mã công nghiệp. Nhiều nhà nghiên cứu đã quyết định sử dụng kiến thức suy diễn logic toàn cầu về invariants (tính không thay đổi) của hệ thống phân tán tích lũy lâu dài làm "linh hồn", đưa vào mô hình hợp tác đa tác nhân tiên tiến và kiến trúc Harness tự động, cho ra đời khung Agora bình đẳng mã nguồn mở.
Trong khi đó, với tư cách là cơ sở hạ tầng AI mô-đun tiên tiến trong ngành và mạng lưới khả dụng dữ liệu phi tập trung hiệu suất cao, đội ngũ 0G đã tích lũy được kinh nghiệm phong phú trong việc tấn công và phòng thủ cấp sản xuất cũng như các mẫu lỗi giao thức trong thế giới thực trong việc triển khai giao thức đồng thuận blockchain và kiến trúc BFT (tolerant Byzantine) cao.
Sự kết hợp giữa các lĩnh vực này đã thay đổi hoàn toàn quy tắc trò chơi: nó không phải là kiểm tra bạo lực mù quáng, cũng không phải là mô hình lớn "mù quáng sờ mó" thiếu kiến thức lĩnh vực, mà là thông qua sự phân công chuyên môn của các Agent, chuyển đổi trực giác suy diễn logic của các chuyên gia hệ thống dày dạn hàng chục năm thành sự cạnh tranh và hợp tác giữa các Agent, từ đó có được sức mạnh cứng cáp để đánh bại các công cụ kiểm tra truyền thống.
Khác với con đường đầu tư lớn của Glasswing tiêu tốn một lượng lớn Token, Agora mang đến một giải pháp thay thế cực kỳ thân thiện với các doanh nghiệp vừa và nhỏ ------ nó chứng minh rằng ngay cả khi mô hình cơ sở "kém một chút", với chi phí hiệu quả hơn, thông qua kiến trúc hợp tác đa Agent với nhận thức lĩnh vực tinh tế, vẫn có thể phát hiện ra các Deep Bug cứng cáp!
2. Điểm đau: LLM đơn thể khó vượt qua, hệ thống phân tán treo "Thanh kiếm logic sâu"
Trong thời đại mà dữ liệu lớn, blockchain và cơ sở dữ liệu phân tán chi phối mọi thứ, giao thức đồng thuận (như Paxos, Raft, PBFT…) chính là nền tảng cơ sở của toàn bộ thế giới số. Tuy nhiên, việc thực hiện giao thức đồng thuận nổi tiếng với "độ khó địa ngục". Ngay cả những dự án công nghiệp như etcd, đã trải qua sự rèn giũa của vô số kỹ sư hàng đầu toàn cầu và hoạt động nhiều năm, vẫn ẩn chứa những Deep Bug (lỗi logic sâu) khiến người ta toát mồ hôi.
Những lỗi này khác với các lỗi thực hiện thông thường như rò rỉ bộ nhớ, tràn số nguyên ( Implementation Bugs), chúng trải dài qua nhiều giai đoạn thực thi, phụ thuộc vào trạng thái đồng thời phức tạp. Một khi bị kích hoạt ác ý, không chỉ gây hư hại cho dữ liệu cốt lõi mà còn có thể dẫn đến tổn thất tài chính thảm khốc.
Mặc dù các mô hình ngôn ngữ lớn ( LLM ) gần đây rất nổi bật trong phân tích mã thông thường, nhưng khi đối mặt với đồng thuận phân tán lại tỏ ra "thiếu thông minh". Chúng chỉ có thể phát hiện ra các khuyết điểm nông cạn trong mã cục bộ, trong khi đối mặt với các lỗi logic cấp giao thức phụ thuộc vào trạng thái toàn cầu, LLM đơn thể thường rơi vào bẫy của mã cục bộ, hoàn toàn không thể thực hiện suy diễn thời gian toàn cầu.
3. Phá vỡ: Ba Agent của Agora và kiến trúc Harness cốt lõi
Để phá vỡ bế tắc này, Agora lần đầu tiên đưa mô hình kiểm tra dựa trên giả thuyết (Hypothesis-Driven Testing, HDT) cổ điển từ học thuật vào hệ thống Agent mô hình lớn. Để thực hiện suy diễn toàn cầu hiệu quả, Agora đã hoàn toàn từ bỏ mô hình "chiến đấu đơn lẻ" truyền thống, khéo léo phân tách quy trình làm việc thành ba Agent chuyên môn hóa cao với các nhiệm vụ riêng biệt:
Orchestrator Agent (Điều phối viên): Chịu trách nhiệm duy trì trạng thái toàn cầu và "khai thác lỗ hổng" từ các lỗ hổng đã biết;
Strategy Agent (Nhà chiến lược): Chịu trách nhiệm đưa vào kiến thức lĩnh vực phân tán, tạo ra các tình huống bất thường cực kỳ có tính tấn công cho các giao thức CFT và BFT;
TestGen Agent (Nhà phát sinh mã): Là người thực hiện. Và điều khiến Agora thực sự có thể triển khai, tạo ra các bài kiểm tra hiệu quả, chính là kiến trúc kiểm tra tự động cốt lõi của nó.
Kiến trúc của nó như hình dưới đây:

Trong thiết kế tổng thể của Agora, phép thuật bình đẳng "lấy nhỏ đánh lớn" này không phải tự nhiên mà có, mà xuất phát từ cơ chế tương tác thông minh tinh tế và sự kết hợp sâu sắc của kiến trúc kiểm tra Harness.
Đội ngũ nghiên cứu đã thiết kế một bộ cơ chế giao tiếp và bộ nhớ cực kỳ đơn giản và hiệu quả ( Succinct Memory & Communication), đảm bảo rằng mỗi Agent tập trung vào nhiệm vụ cốt lõi của mình, đồng thời giảm thiểu chi phí truyền tải ngữ cảnh dư thừa xuống mức tối thiểu. Dưới sự ràng buộc giao tiếp cực đoan này, Orchestrator Agent (chịu trách nhiệm điều phối toàn cầu và kiểm soát trạng thái), Strategy Agent (chịu trách nhiệm tạo ra môi trường bất thường phân tán và các tình huống) và TestGen Agent (chịu trách nhiệm kiểm tra mã và đánh giá động Evaluation) đã hoàn toàn hòa quyện, cùng nhau thúc đẩy và đáp ứng kiến trúc Harness:
Vòng lặp tự động khép kín kết hợp: Khi Strategy Agent suy diễn ra các tình huống tấn công phân tán trừu tượng, dựa vào khung tương tác được phân tách cao, TestGen Agent có thể ngay lập tức khởi động các bài kiểm tra cơ sở. Kiến trúc này không chỉ có khả năng tự thích ứng môi trường mạnh mẽ, có thể vượt qua các ngôn ngữ lập trình khác nhau như Go, Rust, mà còn tích hợp công nghệ vòng lặp phản chiếu ( Reflection-Loop ) hiệu quả.
Một khi bài kiểm tra gặp lỗi khi chạy trong môi trường, hệ thống sẽ chính xác và thời gian thực ghi lại ngăn xếp gọi và nhật ký thực thi, và gửi lại một cách tinh gọn cho Agent để tự sửa chữa có định hướng. Sự kết hợp hữu cơ của "tương tác cực kỳ đơn giản giữa nhiều Agent + vòng lặp khép kín động Harness" không chỉ cho phép Agora phát hiện chính xác các Bug logic sâu kín nhất với chi phí Token cực thấp, mà còn tạo ra các báo cáo phân tích chi tiết với tỷ lệ báo cáo sai rất thấp.
Tổng quan về hoạt động cuối cùng như hình dưới đây:

4. Thành quả: Phát hiện 15 Deep Bug zero-day hàng đầu, các mô hình lớn đều thất bại
Kết quả đánh giá thật sự gây sốc. Đội ngũ nghiên cứu đã tiến hành một cuộc kiểm tra toàn diện trên bốn kho giao thức đồng thuận nổi tiếng (bao gồm etcd cấp sản xuất và các thành phần cốt lõi của chuỗi công khai mới nổi Sui) và so sánh với các mô hình mạnh nhất như GPT-5.2, Gemini 3.0 Pro Preview, Claude Sonnet 4.5 và Qwen3 Coder.
Kết quả không chỉ làm cho hệ thống đồng thuận mà 0G vận hành trở nên an toàn hơn, mà còn thể hiện sự tấn công giảm chiều áp đảo:
15 Logic Deep Bug mới xuất hiện: Agora đã thành công phát hiện 15 lỗi logic sâu cấp giao thức chưa từng được biết đến trước đây. Những lỗi này trải dài qua các phân kỳ thực thi, vi phạm đơn điệu, khuyết tật topo, lỗ hổng chữ ký và nhiều lĩnh vực nguy hiểm khác.
Các mô hình lớn đều thất bại: Ngược lại với các mô hình cơ sở (ngay cả khi được trang bị bộ công cụ động ReAct tiên tiến), khi đối mặt với các lỗi logic sâu này đều không tìm ra được gì ( 0/15 ). Chúng tiêu tốn một lượng lớn Token, nhưng chỉ có thể xoay quanh các lỗi thực hiện mã cấp thấp.
Tỷ lệ báo cáo sai cực thấp và chi phí hiệu quả cao: Trong tất cả các báo cáo Bug do Agora sản xuất, tỷ lệ lỗi logic thực tế lên tới 73.9% (tỷ lệ báo cáo sai chỉ 26.1%). Điều đáng kinh ngạc hơn là, trung bình mỗi khi phát hiện một lỗi logic hàng đầu khiến các kiến trúc sư kỳ cựu phải rụng tóc, chỉ cần tiêu tốn khoảng 5.32M tokens (tương đương 40 đô la), chi phí hiệu quả cực cao.
Kết quả trên nhiều LLM như sau:

5. Tương lai: Tính khả thi cao, tiến vào nhiều "vùng đất chưa có người" cốt lõi hơn
Sự thành công của Agora không chỉ mang lại một liều thuốc mạnh cho an toàn của hệ thống phân tán, mà còn chỉ ra hướng đi cho việc triển khai các ứng dụng công nghiệp cấp dọc của mô hình lớn.
Điều quan trọng là, thiết kế kiến trúc của Agora thể hiện tính khả thi và tính phổ quát cực cao. Đội ngũ nghiên cứu nhấn mạnh rằng, Agora còn có thể được tái hiện và sử dụng nhanh chóng dưới dạng plugin hoặc skill bởi đông đảo người dùng, mã của chúng tôi (github.com/0gfoundation/agora) cung cấp các skills tương ứng để giúp tái hiện. Không chỉ vậy, mô hình "mô hình lớn + hợp tác đa Agent + dựa trên giả thuyết" của Agora không chỉ có thể được sử dụng cho giao thức đồng thuận. Do quy trình làm việc cốt lõi và kho kiến thức lĩnh vực trên cao đã được phân tách sâu sắc. Điều này có nghĩa là kiến trúc này không chỉ có thể giúp nhiều người dùng nhanh chóng sử dụng để debug giao thức đồng thuận, mà còn có thể được triển khai nhanh chóng theo cách "cắm và chạy" ( Plug-and-Play ) vào các lĩnh vực cốt lõi khác cũng đang phải chịu đựng "địa ngục lỗi logic sâu":
Kiểm soát đồng thời cơ sở dữ liệu (Concurrency Control): Được sử dụng để kiểm tra các khuyết điểm xung đột giao dịch phức tạp trong cơ sở dữ liệu phân tán ở mức độ cách ly cực đoan (như Serializable).
Hệ điều hành / Hệ thống đồng thời: Khám phá sâu các tình huống chết lặng và điều kiện cạnh ẩn trong cơ sở hạ tầng đa luồng.
Kiểm toán hợp đồng thông minh Web3: Khám phá sâu các ranh giới an toàn liên quan đến các giao thức chuỗi chéo và logic DeFi với các mô hình kinh tế phức tạp. Thị trường an toàn blockchain dự kiến sẽ đạt quy mô khoảng 8.5 tỷ đô la vào năm 2026, và đã xuất hiện các sản phẩm thương mại sử dụng "hệ thống an toàn đa tác nhân" để kiểm toán hợp đồng thông minh, rút ngắn chu kỳ kiểm toán từ vài tuần xuống còn vài giờ, nhu cầu thị trường đang bùng nổ.
Thời đại an toàn tự động hóa AI cho cơ sở hạ tầng công nghiệp có thể đang được Agora và kiến trúc Harness của nó chính thức khởi động.
Chúng ta có lý do để tin rằng, Agora có thể giúp kiểm tra tốt hơn khả năng của coding LLM thông qua việc phát hiện nhiều deep bug hơn trong các lĩnh vực khác nhau, các trường hợp deep bug mà nó phát hiện cũng có thể giúp coding LLM nâng cao khả năng hiểu mã.
Agora có thể nâng cao an toàn cho các kho mã như giao thức đồng thuận, kiểm soát đồng thời, hợp đồng thông minh, v.v., vốn là nền tảng cho giao dịch an toàn tài chính. Hơn nữa, Agora cũng có thể giúp nhiều công ty công nghệ phát hiện các logic bug sâu hơn, nhưng tiêu tốn ít tokens hơn, tiết kiệm chi phí nhưng vẫn hiệu quả hơn!
Quan trọng hơn, điều này đúng lúc chạm vào hai lĩnh vực nóng nhất hiện nay: một là hệ thống đa tác nhân đang từ thử nghiệm chuyển sang sản xuất ------ Gartner dự đoán đến năm 2028 sẽ có hơn một phần ba phần mềm doanh nghiệp tích hợp agentic AI, quy mô thị trường nền tảng đa tác nhân sẽ từ hàng tỷ đô la tăng lên hàng trăm tỷ đô la trong vài năm; hai là "sử dụng tác nhân để kiểm tra tác nhân" đang trở thành tiêu chuẩn ngành cho năm 2026 với kiểm soát chất lượng tác nhân hóa (Agentic Quality Control).
Trong bối cảnh báo cáo Veracode 2025 chỉ ra rằng khoảng 45% mã do AI tạo ra có lỗ hổng an toàn, và thị trường an toàn agentic AI đang tăng trưởng với tỷ lệ 42% hàng năm, Agora cho phép các công ty công nghệ phát hiện các Logic Bug sâu hơn với chi phí token thấp hơn, nâng cấp kiểm toán an toàn từ "công việc nhân lực tính theo tuần" lên "khả năng tự động giao hàng tính theo giờ".
Và khi bức tranh của lĩnh vực này dần trở nên rõ ràng, những người thực sự nắm bắt cơ hội thường không phải là những ông lớn ồn ào nhất, mà là những đội ngũ đầu tiên thực hiện thành công phương pháp và có thể tái tạo liên tục.












