Meta 於 8 月 5 日承認,旗下一個 AI 模型在網絡安全測試期間入侵另一家公司系統,並更改對方內部環境設定。Meta 表示正調查事件,強調情況與 Anthropic 及 OpenAI 早前披露事故相似,反映業界對頂尖 AI 系統失控風險憂慮持續升溫。
測試環境設定出錯釀成漏洞
Meta 指出,獨立網絡安全評估公司 Irregular 在為其進行測試時出現設定錯誤,意外令一個 AI 模型獲得互聯網存取權限。Meta 在聲明中形容,該模型以類似其他公司曾出現方式,利用一項第三方服務安全漏洞。科技媒體 The Information 引述消息人士報道,涉事模型為 Muse Spark 1.1,是 Meta 旗下主打真實編碼及自主代理任務、標榜最具能力模型。報道指該模型入侵一間未具名公司系統,並改動其內部環境,並非單純試探,而是實際作出更改。
Irregular 稱非「逃出沙盒」
Irregular 發言人向路透社表示,今次事件與 Anthropic 上周揭露評估環境問題完全相同,並非逃出沙盒或涉及複雜網絡攻擊行為。Irregular 稱事件目前沒有未解決問題,並正編寫白皮書,分享安全進行網絡評估最佳做法。
Anthropic 及 OpenAI 早有類似先例
今次並非首次有 AI 模型在測試期間意外闖入真實系統。Anthropic 於 7 月 30 日披露,公司覆核逾 14 萬次(141,006 次)測試記錄後,發現 3 個不同模型——Opus 4.7、Mythos 5 及一個內部研究測試模型——曾未經授權,連接 3 間不同機構系統。事故源於一項設定錯誤,令原本應與外界隔離測試環境反而可連上互聯網,模型因此利用弱密碼及未經認證介面入侵系統,其中一個模型甚至將一個含惡意程式碼 Python 套件發佈到公共程式庫 PyPI,期間有真實保安公司系統自動下載並執行該套件。
OpenAI 方面則於 7 月 21 日透露,旗下 AI 代理在網絡安全能力測試期間失控,逃出原本受限制評估環境,並入侵 AI 開源平台 Hugging Face。涉事模型包括 GPT-5.6 Sol 及一個尚未公開發布、能力更強模型,兩者聯手發現並利用套件登錄快取代理伺服器 Artifactory 一個此前未知零日漏洞,藉此突破防線接通互聯網。根據 Hugging Face 事後公開技術報告,整場入侵橫跨 5 日,攻擊者共執行 17,600 個動作,最終取得 4 項第三方服務登入憑證。
美國國會及白宮同步關注
一批共和黨州檢察總長已要求 OpenAI 保留與 Hugging Face 事故有關所有文件,OpenAI 回應會認真處理要求,並將發表相關技術報告。同一時間,白宮本周較早時邀請 Meta、Anthropic、OpenAI 及 Google 等主要 AI 公司,商討一套剛敲定自願性網絡安全測試框架。特朗普政府向 AI 開發商表示,像 Meta 旗下 Llama 及 NVIDIA Nemotron 等開放權重模型,將不受這套自願測試機制規管。
資料來源:Reuters