AI 安全競賽再次證明一個道理:贏家是建立最好系統的團隊,而非擁有最強模型的團隊。趨勢科技(Trend Micro)旗下的 TrendAI 團隊近日宣布,其代號 AESIR 的自主漏洞利用修復引擎(agentic exploit-remediation engine)在 UC Berkeley 的 CyberGym 基準測試中以 97% 的成績奪得第一,領先第二名 Sangfor AI(93.2%)近 4 個百分點,更大幅超越 OpenAI 的 GPT-5.6 Sol(84.5%)與 Anthropic 的 Claude Mythos 5(83.8%)。
CyberGym 是什麼?
CyberGym 是 UC Berkeley 研究團隊建立的 AI 安全基準測試,涵蓋 188 個大型開源軟體專案中的 1,507 個真實漏洞。測試任務並非只是讓程式崩潰那麼簡單。系統需要對每個漏洞產生「差異性觸發輸入」(differential crash):一個特定位元組序列或檔案,必須讓舊版(有漏洞的)程式崩潰,但已修補的新版能正常執行。系統在解題時無法取得 patch 或已修復的版本。
這遠比一般模糊測試(fuzzing)的標準更高,因為它要求系統證明自己的輸入確實觸發了開發者修復的那個特定漏洞,而非任何隨機的不穩定行為。漏洞類型涵蓋堆積溢位(heap overflow)、釋放後使用(use-after-free)、整數溢位、未初始化記憶體讀取與堆疊破壞,這些正是每年大量 CVE 通報的元兇。
測試專案包括 FFmpeg、Wireshark、Ghostscript 等業界廣泛使用的軟體,以及各類編解碼器函式庫和智慧卡中介軟體。
CyberGym 排行榜(2026 年 8 月)
AESIR 以 97% 的成績遙遙領先。以下是排行榜上的主要競爭者:
- 第 1 名:TrendAI AESIR,97.0%(趨勢科技)
- 第 2 名:Sangfor AI,93.2%(深信服)
- 第 3 名:Whitzard(白澤),91.2%(復旦大學)
- 第 4 名:MDASH,91.0%(Microsoft)
- 第 5 名:Wiz Atlas,90.9%(Wiz)
- 第 9 名:GPT-5.6 Sol,84.5%(OpenAI)
- 第 12 名:Claude Mythos 5,83.8%(Anthropic)
觀察排行榜可以發現,接近榜首的所有競爭者(Sangfor、復旦大學、Microsoft、Wiz)使用的都是同樣的前沿 AI 模型。差異完全來自圍繞模型的工程設計,也就是「系統」而非「模型」的競爭。
AESIR 的秘密武器:階梯式管線
TrendAI 團隊在技術部落格中詳細解釋了 AESIR 的核心設計。系統採用「成本遞增」的階梯式管線(graduated pipeline),在調用 AI 推理之前先用盡所有低成本的確定性方法。
第一個階段是經典的模糊測試與種子突變,從 TrendAI 超過 20 年漏洞研究積累的已知漏洞本體(ontology,由 Zero Day Initiative 支援,超過 12,500 筆紀錄)中提取經過驗證的利用結構作為起點。這個階段大約能解決 30% 的任務,完全不需 AI 參與,單一任務耗時不到 2 分鐘,成本為零。
只在前階段失敗時,系統才會升級到 AI 驅動的代理。AESIR 總共使用了來自四個供應商(Anthropic、Google、OpenAI、DeepSeek)的七種模型,每種模型扮演不同的角色:Claude Opus 負責需要長程推理的深度分析任務(約佔已驗證任務的 31%),Gemini Pro 在二進位格式構建上表現意外出色,GPT 擅長特定協定層級的任務,DeepSeek 則在其訓練中大量見過的特定程式碼模式上有貢獻。
CyberGym 的論文也發現,不同的代理框架之間成功率重疊不到 50%。也就是說,不同模型解決的是不同的任務子集,單一模型系統會遺漏近一半可解的問題。
對抗式的品質保證:偽陽性殺手
AESIR 的第三個關鍵設計是「提案者-對手-裁決者」三層架構。系統不會讓同一模型自我驗證自己的發現,因為模型對自己的輸出太容易同意了。每個漏洞假說在輸出前都必須經過另一個供應商的模型主動嘗試反駁它。
舉例來說,第 N 輪 Claude Opus 是提案者(提出漏洞假說),GPT-5.6 Luna 是對手(嘗試反駁),Gemini 3.1 Pro 是裁決者。第 N+1 輪角色輪換:GPT 變提案者,Gemini 變對手,DeepSeek 變裁決者。沒有任何模型預先知道自己的角色分配,也沒有一個模型能單獨決定結果。
TrendAI 團隊強調:「對抗式 QA 的目標是殺死發現,而非確認它們。一個經過不同模型結構性反駁而存活下來的發現,才值得被報告。」這機制解決了 AI 安全工具最頭痛的問題:偽陽性。文章引用 2024 年 Yangruibo Ding 等人的研究,指出 GPT-4 搭配思維鏈推理在漏洞分類上的成對準確率僅 12.94%,甚至低於隨機猜測的 22.7%。問題在於模型太容易被引導。你叫它找漏洞,它就找到一堆長得像漏洞但實際上被上游驗證保護或不存在於可達路徑的模式。
當 AI 不是解答時:30% 的任務根本不需要 LLM
一個反直覺的數據是:AESIR 驗證的大約 1,460 個利用案例中,近三分之一完全不需要 AI。經典的模糊測試在約四分之一的任務上比 AI 推理更強。60 秒的 fuzzer 加上來自相關漏洞的良好初始輸入,就能解決 AI 代理花 18 分鐘和 6 美元 API 成本才能解的任務。零 LLM 任務的速度還快了 15 倍。
TrendAI 團隊的結論很清楚:「把任務導向正確的工具。最貴的工具很少是最對的工具。」
經濟效益:6,000 美元的 API 費用 vs 488 萬美元的資料外洩成本
從經濟面來看,97% 的成績背後是約 1,460 個經獨立驗證的差異性崩潰,涵蓋 188 個開源專案。總成本約為 6,000 美元的 AI API 費用加上 235 個 CPU 小時。作為對照,根據 IBM 2024 年報告,一次企業資料外洩的平均成本為 488 萬美元。而且一旦知識庫建立完成,掃描下一個專案的邊際成本趨近於零。
給資安工程團隊的教訓
TrendAI 團隊在文章中提出了幾個對產業有普遍意義的建議:
- 先建立知識層:來自持續累積的機構知識的複利回報,遠大於更好的提示詞或更好的基礎模型。每次沒有知識層的任務,就是一次沒有讓下次任務變容易的任務。
- 在更好的指令之前先投資成功的範例:從相關任務取得的經過驗證的利用案例,經突變後應用到新任務,效果超過數小時的 AI 推理。
- 在需要之前就建立對抗式 QA:偽陽性問題在 AI 安全工具中的累積速度遠超過團隊清理速度。
- 從第一天就用多模型架構:不同模型解決不同的問題子集,單一模型會留下結構性的能力缺口。
- 把階梯式管線當作成本控制機制:讓便宜且快速的方法先行,只有在它們失敗後才升級到昂貴的 AI 推理,否則系統成本會多出三到四倍。
總結
趨勢科技 TrendAI AESIR 在 CyberGym 基準測試以 97% 拿下第一,這件事本身是一項成就,但更具意義的是它所揭示的產業趨勢:AI 安全競賽的勝負正在從「誰有最好的模型」轉向「誰建立了最好的系統」。30% 的零 LLM 解決方案、多模型管線、知識本體持續累積、對抗式品質保證,這些工程決策的總和,才是 AESIR 領先 OpenAI 和 Anthropic 超過 12 個百分點的真正原因。
CyberGym 只是目前約 175 個網路安全 AI 基準之一,但它以 1,507 個真實漏洞、188 個真實專案和位元組等級的差異驗證,成為最具綜合性的二進位漏洞復現測試平台。AESIR 的成績驗證了一個正在被廣泛接受的結論:模型在商品化,但知識層、管線和工程紀律不會。






