最近各家 AI 模型的迭代速度真不是普通的快,OpenAI 繼 6 月底推出 GPT-5.6 Sol 之後,稍早正式推出新一代「GPT-6 Astra」模型!雖然間隔不到三個月,但 GPT-6 Astra 可說是全面提升,電腦操作、瀏覽、程式能力都變得更強,甚至在 ARC-AGI-3 測試中還拿到 99.9%,OpenAI 總裁 Greg Brockman 更表示,他個人相信 OpenAI 已經達到 AGI,媒體簡報最後甚至以「歡迎來到 AGI 時代」作為收尾。
不僅如此,資安能力也首度跨進 OpenAI Preparedness Framework 的 Critical(關鍵)門檻,代表只要搭配適當工具與權限,GPT-6 Astra 就能在無人逐步指導下,自行找出未知漏洞、開發漏洞利用方式,甚至完成複雜端對端網路攻擊的能力,這也是 OpenAI 首款被評為這一級別的模型。
GPT-6 Astra 正式登場:OSWorld 任務時間少 47%、ARC-AGI-3 達 99.9%,資安能力首度跨入 Critical
GPT-6 Astra 是 OpenAI 目前定位最高的通用模型,主要能力涵蓋電腦操作、網頁瀏覽、程式開發、專業工作、科學研究與網路安全。跟過往模型不同,Astra 的發展方向是:「接手完整工作流程」,可以填寫線上表單、更新 CRM 裡的客戶資料、整理行事曆,在瀏覽器裡研究資料後,再到電子郵件或文件編輯器撰寫摘要。
簡單來說,GPT-6 Astra 打開工具後,可以一路把事情都做完。
根據 Axios 報導,Brockman 在 GPT-6 Astra 媒體簡報中稱它是能力上的「世代躍進」,並表示他個人相信 OpenAI 已經達到 AGI。當記者問到未來回頭看時,Astra 是否可能被視為 AGI 到來的分界點,他回答:「I think it might be about this model」,最後更用「Welcome to the AGI era」為簡報收尾。
在 ARC-AGI-3 測試中,GPT-6 Astra 達到 99.9%,GPT-5.6 Sol 只有 7.8%,Claude Opus 5 為 30.2%:
GPT-6 Astra 現在也更懂得什麼時候該自己做決定,什麼時候應該停下來問你
如果指示留下的空白不影響主要結果,它會根據上下文補齊合理細節。如果答案可能改變任務方向,它才會提出比較聚焦的問題。更重要的是,在 Codex 裡,GPT-6 Astra 等待使用者回答期間,還能繼續處理不受這個問題影響的工作,不會讓整個任務停在原地。
OpenAI 也承認,較早模型收到中途的補充指示時,有時會把新消息當成另一個目標,結果忘記原本要完成什麼。GPT-6 Astra 針對這種「做到一半被插話」的情況有加強訓練,會把新要求納入既有工作,也可以回答支線問題後再回到主線。
長時間使用 Codex 時,GPT-6 Astra 還加入新的跨內容視窗記憶方式。
過去對話塞滿內容視窗後,系統必須把前面的過程壓縮成摘要,而每壓縮一次,都可能漏掉某個修正為什麼失敗、某項測試曾出現什麼結果。
這次加入的新機制,允許 GPT-6 Astra 保存筆記,並搜尋較早的對話與工具輸出,即使某個細節沒有被寫進摘要,還是有機會重新找回來。不過這項實驗功能初期要在 Codex 的 `config.toml` 手動開啟,OpenAI 預計未來幾週逐步設為 Astra 的預設功能。
提升最有感:電腦操作
電腦操作是這次 GPT-6 Astra 讓一般使用者提升最有感。根據 OpenAI 分享在 OSWorld 2.0 測試中,Astra 拿到 72.6%,高於 GPT-5.6 Sol 的 65.7%與 Claude Opus 5 的 70.2%。OpenAI 進一步模擬任務執行時間,Astra 平均約需 40 分鐘完成一項工作,Sol 則約為 75 分鐘,等於耗時減少約 47%:
測試模型辨識畫面並找出正確操作位置能力的「ScreenSpot-Pro」,Astra 達到 92.7%,GPT-5.6 Sol 為 76.9%;評估跨不同職業工作流程的 Agents’ Last Exam,兩者則分別是 59.3%和 53.6%。搭配 OpenAI 同步更新的 Codex 操作架構後,Astra 在 Mind2Web 測試的完成速度達到現行 Sol 體驗的 1.9 倍:
GPT-6 Astra 程式能力也大幅提升,不過不是每一項都拿第一
在 Terminal-Bench 4.0 測試中,Astra 拿到 57.9%,前一代 GPT-5.6 Sol 為 37.3%,Claude Fable 5.1 為 55.8%,Claude Opus 5 則是 52.3%。DeepSWE 1.1 部分,Astra 的 74.1%也略高於 Gemini 3.8 Flash 的 73.8%與 Claude Opus 5 的 73.7%:
不過在 FrontierCode 1.1 Main,Astra 的 53.3%略低於 Claude Fable 5 的 53.5%;Artificial Analysis Coding Agent Index 也只有 67.0,低於 Claude Fable 5 的 67.2 與 Claude Opus 5 的 68.1。因此,OpenAI 稱「目前最佳的軟體工程模型」比較適合視為官方對整體能力的定位,而不是每項測試都全面領先:
其他測試成績與資安
數學、科學與抽象推理的成績中,FrontierMath Tier 4 部分 Astra 拿到 97.6%,GPT-5.6 Sol 為 83.0%,Claude Fable 5.1 為 87.8%;Terminal-Bench Science 0.1 則從 Sol 的 22.4%上升到 64.6%。
OpenAI 還表示,Astra 協助研究人員把無限多對質數之間的已知距離上限,從先前的 240 進一步縮小到 186,並改善一項超過 80 年沒有變動的大質數間距結果。
資安風險方面,Astra 在 ExploitBench 拿到 100%,GPT-5.6 Sol 為 78.5%;ExploitGym 成功率為 42.4%,Sol 是 30.3%。
測試模型在沒有原始碼的情況下逆向分析軟體執行檔的 SRE-Bench,Astra 單次解題率達 88.0%,四次內更提高到 99.2%,Sol 分別只有 55.9%與 68.7%。
OpenAI 表示,GPT-6 Astra 在測試期間甚至找到並利用兩個此前未知的零時差漏洞,目前正向相關維護者通報。它也成為 OpenAI 第一款資安能力達到 Preparedness Framework「Critical」門檻、又廣泛部署的模型。
換句話說,它不只會分析已知漏洞,在取得正確工具與權限後,也可能自行找到尚未公開的問題並發展新的利用方式。
為了降低風險,一般版 Astra 會拒絕製作較進階的漏洞概念驗證。
OpenAI 預計透過 Daybreak 計畫,在未來幾週逐步提供限制較少的存取方式,供經審查的防禦工作使用,包括驗證漏洞、分析惡意程式與建立偵測規則。這也代表說,資安研究人員就算拿到 Astra,實際能執行的工作仍會受到方案、資格與安全機制限制。
雖然 OpenAI 也把「不擅自越界」列為 GPT-6 Astra 的另一項進步,不過,這並不等於完全沒有安全疑慮。
OpenAI 在安全報告裡坦承,Astra 的推理過程比 GPT-5.6 Sol 更難監控,當研究人員刻意要求模型躲避監控時,它比較能控制自己寫出的推理內容,也可能在策略性降低表現或部分破壞任務中避開內部監測。
GPT-6 Astra 佈署和使用方式
GPT-6 Astra 目前採分階段開放。首波先提供給少數組織,接下來幾天才會逐步開放 ChatGPT Plus、Pro、Business 與 Enterprise 使用者。OpenAI 產品負責人 Tibo Sottiaux 也在 X 說明,團隊希望把 Astra 帶給所有 Plus 用戶,而不是只提供給 Pro、Business 和 Enterprise,但整個部署需要幾天時間。
為了補償在等待 Astra 開通的付費使用者,Tibo 隨後宣布一項補償:從公告當天開始,付費 ChatGPT 方案每有一天無法使用 Astra,就會收到一個可儲存的重置額度(banked reset),第一個預計在發文約三小時後發放:
Pro、Business 與 Enterprise 方案之後還會取得 GPT-6 Astra Pro。
不過要注意的是,Enterprise 推出時預設是關閉的,需要由管理員手動開啟。GPT-6 Astra 也會計入各方案原有的正常使用額度,使用者可以把 100%額度用在 Astra 上。當然,用完時也能購買額外點數。
開發者也能在 OpenAI API 使用 `gpt-6-astra`,官方文件列出的內容視窗為 1,050,000 Token、單次最大輸出為 128,000 Token,知識截止日為 2026 年 4 月 30 日。模型支援文字與圖片輸入,但不直接支援音訊及影片輸入;推理強度可選 low、medium、high、xhigh 和 max,沒有 none。
| GPT-6 Astra Standard API | 每百萬 Token 價格 |
|---|---|
| 輸入 | 10 美元 |
| 快取輸入 | 1 美元 |
| 快取寫入 | 12.5 美元 |
| 輸出 | 50 美元 |
如果單次提示內容超過 272K Token,整個請求的輸入與快取費率會變成 2 倍,輸出費率則是 1.5 倍。
Batch 與 Flex 為標準價格的 50%;Fast mode 最快可達 Standard 的 2 倍速度,費率也是 2 倍。
官方分享完整測試數據表格
| 類別 | 測試項目 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|---|
| 電腦操作 | Agents’ Last Exam | 59.3% | 53.6% | — | 48.7% | 55.5% | — |
| OSWorld 2.0 | 72.6% | 65.7% | — | — | 70.2% | — | |
| ScreenSpot-Pro | 92.7% | 76.9% | — | 87.3% | — | — | |
| 專業工作 | AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | — |
| BenchCAD | 95.9% | 83.3% | 84.3% | 67.5% | 82.1% | — | |
| BrowseComp | 91.5% | 90.4% | — | 87.4% | 90.8% | — | |
| OpenScore String Quartets(1 – OMR-NED) | 0.84 | 0.19 | — | — | — | — | |
| Internal Design Tasks | 50.0% | 47.4% | — | 35.8% | — | — | |
| Internal Data Science Tasks | 40.9% | 30.5% | — | 34.7% | — | — | |
| Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 | |
| 程式能力 | Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% | 52.3% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% | |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% | |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% | |
| Internal Database Migration Tasks | 63.9% | 42.7% | 57.8% | 50.3% | — | — | |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | — | 67.2 | 68.1 | 61.2 | |
| 學術能力 | Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | — |
| FrontierMath Tier 4(v2) | 97.6% | 83.0% | 87.8% | 87.8% | 73.2% | — | |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% | |
| Humanity’s Last Exam(w/ tools) | 57.2% | — | 65.0% | 63.8% | 63.6% | — | |
| 科學與健康 | GeneBench Pro | 37.8% | 28.7% | — | — | — | — |
| MedChemBench(Internal) | 49.3% | 47.4% | — | — | — | — | |
| LifeSciBench | 60.3% | 59.9% | — | — | — | — | |
| HealthBench Professional(length-adjusted) | 63.4% | 60.5% | 58.1% | 60.9% | 56.4% | 52.1% | |
| 資安能力 | ExploitBench | 100.0% | 78.5% | — | — | 70.0% | — |
| ExploitGym | 42.4% | 30.3% | 30.4% | 28.4% | 22.0% | — | |
| ExploitBench(2026 年 6~8 月) | 39.0% | 11.5% | — | — | — | — | |
| SRE-Bench | 88.0% | 55.9% | — | — | 12.5% | — | |
| SEC-Bench Pro | 85.4% | 79.1% | — | — | — | — | |
| 對齊與安全 | Internal computer use safety benchmark(越低越好) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | — |
| Internal computer use safety benchmark + AutoReview(越低越好) | 1.8% | 4.3% | — | — | — | — | |
| Internal circumvention benchmark(越低越好) | 0.00% | 0.29% | — | — | — | — | |
| ExploitGym honeypot(越低越好) | 0.0% | 48.2% | — | — | — | — | |
| Impossible ExploitGym | 100.0% | — | — | — | — | — | |
| Internal hallucination benchmark(越低越好) | 4.2% | 12.2% | — | — | — | — | |
| 長內容 | OpenAI MRCR v2 8-needle 256K–512K | 100.0% | 91.5% | — | — | — | — |
| OpenAI MRCR v2 8-needle 512K–1M | 96.3% | 73.8% | — | — | — | — | |
| 抽象推理 | ARC-AGI-3 | 99.9% | 7.8% | — | — | 30.2% | — |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | — | |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | — |







