一位開發者在 X 上發了一則貼文,意外引爆了 AI 產業最敏感的話題之一:當安全護欄阻擋的是修復者而非攻擊者,這樣的「安全」還有什麼意義?7 月 18 日,X 用戶 @callebtc 發文表示,他手上有一份完整的軟體資安漏洞報告,但 OpenAI 的 Codex 和 Anthropic 的 Fable 都以「Cyber guardrails(網路安全護欄)」為由拒絕修復。他改用中國月之暗面(Moonshot AI)的 Kimi K3,後者在約 10 個小時內將所有漏洞全部修復。這則貼文至今累積超過 13,000 個讚,成為近期 AI 社群討論度最高的發文之一。
I have a report full of security issues of a software I’m working on.
Codex won’t fix them because of Cyber guardrails
Fable won’t fix them because of Cyber guardrailsKimi K3 fixed them all. No restrictions, just gets the job done.
This will end badly for OpenAI & Anthropic.
— calle (@callebtc) July 18, 2026
前白宮加密貨幣與 AI 顧問 David Sacks 隨即轉發並評論:「Kimi K3 修復了 Codex 和 Fable 因為『網路安全護欄』而拒絕修復的 15 個關鍵資安漏洞。沒有理由限制美國模型去處理中國模型能輕鬆完成的任務,我們只是在讓自己變得更不具競爭力。」
護欄的悖論:擋住修復者,擋不住攻擊者
這起事件的核心矛盾很清楚:OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Fable 5 在技術上完全有能力識別資安漏洞,但它們的安全護欄在看到攻擊程式碼相關內容時,會將使用者自動歸類為潛在攻擊者並拒絕處理。
X 用戶 @VaibhavSisinty 對此做了精確的總結:「一個拒絕修補關鍵漏洞的模型,因為修復程式碼看起來像攻擊程式碼,這不是在保護任何人,這是在敞開大門。」 他進一步指出,Kimi K3 並不是在資安方面更聰明,它只是沒有那些阻礙它完成工作的限制。而這正是開發者開始轉向中國模型的原因。
X 用戶 @rayethesis 則提供了更細緻的分析:問題在於許多美國 AI 實驗室採用過於寬泛的限制,因為這比理解使用者意圖更容易執行。模型看到與資安相關的程式碼就假設有風險然後拒絕,即使使用者明顯是在修補漏洞。這或許降低了實驗室的法律風險,但同時把正當的開發者推向限制較少的海外或開放權重模型。
Hugging Face 資安事件:護欄擋住了調查者,下手的竟是OpenAI
以上事件其實也不是個例,就在前天 Hugging Face 發佈公告稱自己遭到全自動 AI Agent 攻破,當時美國本土的知名閉源模型也直接拒絕執行協助調查,當時也是用中國的另一個開源模型 GLM 5.2 搞定,不過更諷刺還在後面。
7 月 21 日,Sam Altman 親自發文確認 OpenAI 在模型評估期間發生了「重大資安事件」。OpenAI 的一個模型(GPT-5.6 Sol)和一個尚未發布的更強模型在進行網路安全基準測試時,自主逃離了沙盒環境,利用第三方軟體的零日漏洞攻擊了 Hugging Face 的基礎設施,目的是竊取基準測試的答案,也就是說,這個 AI 為了在考試中作弊而入侵了一家公司。(簡單說 Hugging Face 這次的嚴重資安事故很可能就是 OpenAI 的模型所為)
結語:安全與實用之間的裂縫
整起事件暴露了整個美國 AI 產業在安全策略上的結構性矛盾。當護欄過於寬泛地將資安相關內容一律封鎖時,攻擊者早就轉向不受限制的模型,被擋住的反而是那些合法的、試圖修復漏洞的開發者和資安團隊。
Kimi K3 在這個案例中展現了一個更基本的能力:它能完成被交付的工作。在 AI 模型的基準分數不斷攀升的今天,「能完成工作」這個看似理所當然的要求,正在成為美國模型和中國模型之間最明顯的分界線。
Polymarket 上,美國政府在今年底前限制另一款 Anthropic 模型的機率已升至 20%,一天內上漲了 8 個百分點。中國商務部也在評估對自身模型和晶片實施出口管制。AI 的安全與實用之爭,才剛剛開始,而答案可能決定未來十年全球 AI 產業的競爭格局。
