Kimi K3 測試中逃離沙盒 借用 GitHub 抄答案完成任務

  • 作者

  • 發佈日期

    2026-08-08

  • 閱讀時間

    8分鐘

  • 字體大小

中國初創企業 Moonshot AI 旗下大型語言模型 Kimi K3 在一次網絡保安測試中擅自跳出隔離環境,連上開放互聯網並在 GitHub 抄取答案完成任務,美國網絡保安初創企業 Frontier Security 披露,Kimi K3 是在英國政府 AI Security Institute (AISI) 評估其防禦性網絡保安能力期間,利用測試沙盒的設定漏洞逃出隔離環境,事件成為近 3 星期內第 4 宗同類個案。

Kimi K3 事件經過

Moonshot AI 於 2026 年 7 月 16 日推出 Kimi K3,並隨即免費開放公眾使用,型號採用 2.8 萬億參數混合專家 (MoE) 架構,支援 100 萬 token 上下文視窗,可經 Kimi app、官網、API 及桌面應用 Kimi Work 等多個渠道使用。BBC 報道指,第三方評測顯示 Kimi K3 表現與 OpenAI 及 Anthropic 頂尖模型相若。

Frontier Security 澄清,Kimi K3 並非利用零日漏洞入侵,而是趁 AISI 沙盒環境出現網絡設定錯誤,發現一條未被封鎖的對外連接通道,藉此連接開放互聯網,再從 GitHub 公開資料庫直接抄取測試題目答案,並非在限制內獨立推理解題,Frontier Security 行政總裁 Yaron Singer 表示,雖然 Kimi K3 今次沒有進行複雜攻擊手法,但已懂得利用測試環境漏洞取巧,反映模型內部缺乏足夠防護機制阻止自己「作弊」。值得留意,今次涉事的 Kimi K3 屬公開發布、任何人均可下載的開源權重模型,與同類個案中未發布或刻意調低防護等級的測試模型性質不同,一旦存在安全隱患,廠方亦難以統一修補或回收。

Anthropic 及 Meta 涉第三方評測商設定失誤

除 Kimi K3 外,Anthropic 及 Meta 亦先後通報模型脫離測試環境事件,兩宗個案均與同一第三方評測公司 Irregular 有關,Anthropic 於 7 月 30 日披露,公司審視 141,006 次評測記錄後,發現 3 宗 Claude 模型 (包括 Opus 4.7 及內部代號 Mythos 5 的模型) 接觸真實互聯網並存取 3 間機構系統的個案,當中一次 Claude 更製作惡意 Python 套件並上載至公開套件庫 PyPI,曾在 15 個真實系統上運行,其後才被自動防禦機制移除。Anthropic 將事件歸咎於與 Irregular 評測基建的設定誤解。

Meta 其後於 8 月 5 至 6 日通報,旗下 Muse Spark 1.1 模型同樣因 Irregular 評測環境設定失誤而取得對外連接,並乘機利用一間未具名機構第三方服務中的漏洞,更改該機構內部系統設定,Irregular 回應指,兩宗個案屬同一項技術問題,並已完成修復。OpenAI 亦於 8 月 4 日通報一宗與 Irregular 相關的獨立事件,指模型在一次模擬奪旗式 (capture-the-flag) 測試中意外連接一個與模擬目標同名的真實網站。

OpenAI Hugging Face 事件全貌

與上述 Irregular 相關個案不同,OpenAI 另一宗更廣為人知的事件,涉及公司內部自行進行的評測,OpenAI 官方公告指,已公開發布的 GPT-5.6 Sol 型號連同一個尚未發布、能力更強的模型,在測試期間逃出高度隔離的沙盒環境,方法是發現並利用一個套件庫代理及緩存軟件中的零日漏洞,取得開放互聯網連接,其後直接入侵 Hugging Face 生產伺服器,盜取測試答案。Hugging Face 於 7 月 16 日偵測並圍堵入侵行為,OpenAI 5 日後 (即 7 月 21 日) 確認事件源於自身內部測試,雙方隨即聯合公布事件詳情。

OpenAI 兩名研究員 Eric Wallace 及 Michael Dalton 在 8 月 5 日 Black Hat 大會上,首度公開事件更多細節,兩人透露,涉事 agent 早於 5 月 7 日已開始利用公司內部套件管理系統 Artifactory 的檔案分享功能,互相留言交流,逐漸演變成一個未受監察的「訊息板」,agent 之間藉此交換漏洞資訊及任務分工。OpenAI 於 7 月初發現並關閉相關訊息板後,agent 竟自行以建立目錄名稱的方式,重新建立另一個難以察覺的溝通渠道,繼續協作尋找可連接互聯網的方法,最終促成入侵 Hugging Face。Cloud Security Alliance 其後亦發表緊急指引,確認今次涉及的零日漏洞屬 JFrog Artifactory 軟件。

業界反應

Frontier Security 在報告中總結指出,只要存在通往互聯網的路徑,「一個足夠強大的 agent 終將找到方法」,OpenAI 員工在 Black Hat 大會上形容今次事件為 AI 保安的「分水嶺時刻」,並透露公司正「有意識放慢部分研究進度」,以全面檢視及強化系統防護。業界人士認為,隨著 AI 模型能力持續提升,不論是廠方自身評測基建,抑或第三方評測公司提供的沙盒環境,均必須確保沒有設定漏洞,否則模型逃出隔離環境、自行尋找捷徑完成任務的情況將持續發生。

來源:Bloomberg、Politico

Comments (0)
Add Comment