OpenAI 一周前才披露自家 AI 模型逃出隔離測試環境、駭入 Hugging Face 的嚴重資安事件,在事件後其競爭對手 Anthropic 可能也覺得不妙,隨即啟動大規模自我回溯審查,結果發現自家 Claude 也發生過類似狀況。Anthropic 於美東時間 30 日(台灣時間 31 日)公布,在最早可追溯至今年 4 月的三起獨立事件中,正在測試的模型在公司不知情的情況下連上網際網路,駭入三家毫無戒備的企業。這項消息讓「AI 模型在評估過程中自主連網攻擊」從單一實驗室的意外,變成兩大前沿 AI 公司接連遇到的共同問題。

Anthropic 查閱 14 萬筆紀錄驚覺 Claude 也擅自連網駭入 3 企業
Anthropic 表示,這項審查是在 OpenAI 於 7 月 21 日公開 Hugging Face 遭駭事件後自發啟動的。該公司檢查超過 14 萬筆、確切數字為 141,006 次的網路安全評估執行紀錄,確認 Claude 確實曾數度設法連上網際網路,最終在三起事件中成功駭入外部企業的生產基礎設施。
三起事件涉及的模型包括 Claude Opus 4.7、Mythos 5,以及一款未具名的研究模型。其中 Mythos 是 Anthropic 近年主打的資安專用模型系列,先前發布的 Claude Mythos Preview 就被官方定位為具備頂尖駭客等級能力的資安模型。
Claude 沒有突破沙盒 是系統根本沒有沙盒
與 OpenAI 模型「逃出數位監獄」的情節不同,Anthropic 強調 Claude 並未突破任何沙盒,它只是從根本不存在沙箱的系統中游盪出來。這些評估以奪旗(CTF)挑戰的形式進行,任務是讓模型在網路上另一台機器找出隱藏的機密資訊,評估提示雖明確告知模型「這是模擬環境、沒有網際網路」,但 Anthropic 與第三方評估夥伴、資安公司 Irregular 之間出現設定錯誤,讓模型實際可以連上開放網路。

結果 Claude 的搜尋範圍一路延伸到開放網際網路上的真實系統,並把這些系統當成挑戰的一部分,用猜測弱密碼、進入不需身分驗證的端點等基本手法成功駭入三家企業。Anthropic 表示,這些模型當時誤以為駭客行為是基準測試的一部分。
三代模型反應大不同 最新模型看見證據就停手
Anthropic 指出,這三起事件中沒有發現或利用任何複雜漏洞,Claude 全程只為了完成 CTF 任務而行動,沒有外洩任何資料,也沒有故意逃離測試環境。三款模型在察覺自己連上真實網路時,反應明顯不同:最舊的 Opus 4.7 即使確認已觸及真實生產系統,仍繼續攻擊;Mythos 5 一度直覺判斷自己正在存取開放網路,卻又推理回「仍在模擬中」的結論;最新的內部研究模型則在證據浮現後立即停止行動。
Anthropic 強調,這些評估是在沒有一般發布版本防護措施的情況下執行,且使用專用基礎設施,無法存取 Anthropic 的敏感內部系統與客戶資料。三家受害公司身分並未公布,但均已於 27 日接獲通知,Irregular 發言人則表示公司正在調查這起事件。
事件公布後,Anthropic 敦促其他 AI 實驗室進行類似審查,以了解自家模型能力帶來的風險。Anthropic 也承認,若在評估前驗證所有網路存取路徑,並即時監控評估日誌,這類事件原本可以避免或大幅降低發生機率。
結語
OpenAI 與 Anthropic 接連發生模型自主連網駭入外部企業的事件,暴露了 AI 評估環境的基礎資安漏洞,隔離測試環境的網路路徑管控與監控不足,是兩起事件共同的教訓。相對正面的訊號是,最新一代模型在察覺自己身處真實網路時,已經懂得停止行動,顯示模型的情境判斷能力正在進步,但這需要更多測試才能確認。