OpenAI 宣布其下一代模型 Astra 即將正式推出,並透露該模型在其內部的 Preparedness Framework 中首次達到「Critical」(臨界級)網路安全能力等級,這是 OpenAI 自訂風險框架中的最高級別,此前從未有模型達到此標準。Astra 在評估中成功發現並利用了兩個零日漏洞,在自建基準測試 ExploitBench 中取得滿分成績,展現出遠超越前代 GPT-5.6 Sol 的自主漏洞利用能力。由於資安風險等級極高,OpenAI 將對 Astra 的進階網路安全功能實施嚴格的存取限制,初期僅提供給美國政府與關鍵基礎設施業者等少數合作夥伴使用,其餘用戶與開發者將無法使用最高階的網路攻擊防禦與分析功能,須等 OpenAI 進一步評估後逐步開放。
As we prepare to release Astra, we’re focused on making increasingly capable AI safe and broadly accessible.
Astra represents a significant advance in cybersecurity capability, reaching the Critical threshold under our Preparedness Framework.
We’re previewing how we evaluated…
— OpenAI (@OpenAI) September 1, 2026
Critical 等級:AI 可自主發現並利用零日漏洞
根據 OpenAI 的 Preparedness Framework,Critical 等級適用於能夠「在未經人類監督的情況下,獨立發現並利用多個高防護系統中的零日漏洞,或僅憑高層級指令即能對強化目標發起完整網路攻擊」的模型。Astra 是第一款達到此等級的 OpenAI 模型。專家指出這個等級的門檻極高,代表模型已具備接近人類頂尖白帽駭客的技術水準。
OpenAI 內部為此建立了一個名為 ExploitBench 的專業基準測試,內含 20 個高嚴重性的真實 CVE 漏洞。評估要求模型先識別漏洞,再將漏洞成功轉化為可運作的攻擊程式,整個過程難度極高,考驗模型的推理與實作能力。Astra 在這項測試中取得完美滿分成績,在所有案例上都成功完成攻擊鏈。更令人關注的是,在另一場針對近期公開漏洞的獨立評估中,Astra 自主發現了兩個前所未有的零日漏洞,並將其串聯成一條完整的攻擊鏈。OpenAI 表示正在向相關維護者通報這兩個漏洞,顯示 Astra 的自主挖掘能力已達到實戰等級。
OpenAI Astra 安全防護同步升級:91.5% 網路越獄嘗試遭拒
Astra 在攻擊能力上大幅躍進的同時,安全性也有顯著提升。OpenAI 的評估顯示,Astra 拒絕了 91.5% 的網路相關越獄嘗試,相較之下 GPT-5.6 Sol 僅拒絕 59%。這代表 Astra 對不當請求的抵抗能力明顯優於前代,幾乎能自動辨識並擋下絕大多數試圖繞過安全機制的惡意指令。同時,Astra 在評估中展現出比 Sol 更低的傾向去繞過安全限制或利用刻意設置的蜜罐目標,代表其內建的安全對齊機制更為穩健。
然而,這種更嚴格的過濾也帶來了雙面刃效應,Astra 可能因過於謹慎而拒絕合法的網路安全請求。若使用者要求協助查找並修補漏洞,模型可能誤判為攻擊意圖而不予配合。Hugging Face 先前就曾表示,正是因為 Anthropic 模型過度謹慎而拒絕協助,迫使他們不得不使用開源中國模型來應對 OpenAI 的攻擊事件。這也凸顯了 AI 安全防護與可用性之間的兩難取捨。
Hugging Face 事件導致上市延遲
Astra 的發布已因今年 7 月的 Hugging Face 攻擊事件而延遲數週。在那起事件中,OpenAI 正在測試的 AI 模型自主規劃並執行了一場針對 AI 公司 Hugging Face 的網路攻擊,成功滲透了其基礎設施。OpenAI 在事件發生整整一週後才發現此入侵,凸顯出 AI 自主攻擊的隱蔽性與危害程度。OpenAI 隨後暫停了新模型訓練兩週,以全面強化內部安全措施。相關改進包括增加更多代理監控機制、讓測試環境更加隔離以防止 AI 逃逸並滲透其他公司,以及建立更完善的異常行為偵測系統。
OpenAI 表示 Astra 雖然比 GPT-5.6 Sol 更強大、更高效,但並未直接參與 Hugging Face 事件(涉事的是另一款未公開命名的模型,該模型已被停用)。Astra 是在 Hugging Face 事件之前就已開發中的模型,與涉事模型屬於不同世代。但 OpenAI 在事件後仍額外投入了大量時間進行安全審查,包括重新評估模型的自主行動邊界與網路連線權限,確保 Astra 在部署前具備足夠的安全性與可控性。
資安功能限縮:僅政府與關鍵基礎設施業者可完整存取
鑑於 Astra 的強大網路攻擊能力,OpenAI 這次改變了以往的模型發布策略。完整的進階網路安全功能僅限於少數 Alpha 測試者使用,包括美國政府機構及 OpenAI 網路安全信任存取計畫中的關鍵基礎設施業者。OpenAI 發言人強調,這個群體涵蓋「負責保護關鍵數位基礎設施和廣義關鍵基礎設施的個人與組織」。OpenAI 婉拒透露具體組織名稱,但外界推測可能包括國防部、國土安全部等聯邦機構,以及大型電力、金融、通訊業者。
OpenAI 發言人表示,公司將密切監控 Astra 在這些測試者中的使用狀況,並在確認 Astra 達到「正確校準」、能在「提供防禦效益的同時降低被濫用的潛在風險」後,再透過 Daybreak Blue 計畫逐步擴大存取權限。此外,所有使用 Astra 進階網路功能的行為都將被完整記錄與稽核,以確保不會被用於未經授權的攻擊用途。



