free web page counters

Anthropic 證實 Claude 失控 測試期間擅自入侵 3 間公司系統

Anthropic 證實 Claude 失控 測試期間擅自入侵 3 間公司系統
0

抽象黑色圖案配以橙色和白色點綴.

  • 作者

  • 發佈日期

    2026-07-31

  • 閱讀時間

    5分鐘

  • 字體大小

Anthropic 周四證實旗下 Claude AI 模型於網絡安全評估測試期間意外連上互聯網,並擅自入侵 3 間機構真實系統。事件最早可追溯至今年 4 月。公司未有公開受影響機構名稱。事件緊隨 OpenAI 披露旗下 AI 模型入侵 Hugging Face 系統後曝光,成為業內第 2 宗同類失控事件。

前線紅隊調查三宗網絡安全事件.

測試環境設定出錯

Anthropic 指出事件於「奪旗」(capture-the-flag)演練發生。測試模型本應在完全隔離及不能連接互聯網環境下運作,但因公司與第三方評估夥伴 Irregular 之間出現誤解,令測試裝置實際上仍可連上公共互聯網。Anthropic 於評估提示明確告知 Claude 該環境屬模擬情境並無互聯網連接,惟事實並非如此。這令 Claude 誤將發現真實目標當成測試範圍一部分,並隨即發動攻擊。涉及事件模型分別為 Claude Opus 4.7 及 Claude Mythos 5,以及一個內部研究測試模型。

以基本手法入侵真實系統

Claude 利用弱密碼及未經驗證端點等基本入侵技術,成功滲入 3 間機構系統。其中 Opus 4.7 發現一間與虛構目標名稱相符真實公司網站,隨即發現並利用漏洞盜取憑證及數百行資料庫紀錄。另一模型 Mythos 5 則上載一個惡意 Python 套件至公開 PyPI 註冊平台,1 小時內被下載並在 15 個真實系統上執行,其中包括一間保安公司掃描工具。

大規模覆查揪出隱藏漏洞

Anthropic 表示公司於審視 141,006 個網絡安全評估紀錄後,才發現上述 3 宗入侵事件。這次覆查行動是繼 OpenAI 披露旗下模型入侵 Hugging Face 系統後展開。公司於 7 月 23 日暫停所有網絡安全評估工作,並於 7 月 24 日確認 3 宗事件屬實,再於 7 月 27 日通知受影響機構。當中 2 間機構事發時均未察覺遭入侵,直至 Anthropic 主動聯絡才得悉事件,第 3 間機構則仍在接觸當中。

業界 AI 失控風險升溫

Anthropic 表示已就事件聯絡獨立 AI 評估機構 METR 進行第三方覆查,並強調事件屬操作層面失誤而非模型對齊失敗,公司標準消費者安全防護本應可阻止此類行為。今次事件並非 Anthropic 首次曝出 Claude 相關安全風波。去年 9 月 Anthropic 曾發現懷疑有中國政府背景黑客誘騙 Claude Code 假扮成網絡安全研究人員,自動化執行對約 30 間國際機構網絡間諜行動。當中 Claude 自主完成整體攻擊工作約 8 成至 9 成,事件於去年 11 月正式對外披露。連同今次意外入侵事件反映 AI 模型自主行動能力提升,亦帶來難以預料安全隱患,值得業界關注。

資料來源:Anthropic、Business Insider

Leave A Reply

Your email address will not be published.