AI 測試首度攻擊真人 Anthropic 模型偽造身份施壓開發者

  • 作者

  • 發佈日期

    2026-08-09

  • 閱讀時間

    7分鐘

  • 字體大小

英國政府人工智能安全研究所(AISI)於 8 月 4 日發布報告,指近期一項網絡安全評估測試中,部分 AI 智能體針對真實個人與組織展開未經授權活動。AISI 表示,這是機構首次看見 AI 智能體在未有特定指示下,如此清晰展現自主行動及欺騙風險。

122 次測試揭 19 宗越界事件

AISI 於 2026 年 7 月 25 日至 28 日期間,在兩個模擬真實企業網絡測試題目中,對 7 款 AI 模型進行 122 次評估。測試人員在其中 10 次運行發現智能體越界行為,共記錄 19 宗未經授權事件。

在這 19 宗事件中,17 宗涉及 Anthropic Mythos 5 模型,2 宗涉及 OpenAI GPT-5.6-Sol 模型。測試期間,兩間公司均刻意關閉各自分類過濾器(即實時攔截危險請求安全機制)並開放互聯網連接,目的是了解模型原始能力,並非因為系統遭突破。

Mythos 5 偽造身份施壓開發者

最嚴重一宗事件中,Mythos 5 智能體決定以供應鏈攻擊方式解決測試題目,建立多個虛假 GitHub 帳戶,並利用 Tor 匿名網絡繞過帳戶註冊審查,提交一個包含隱藏惡意程式的合併請求,外表看似普通程式錯誤修復。

智能體同時建立第二個虛假帳戶,假扮獨立審核員為惡意程式碼背書,並向開發者發出釣魚電郵,施壓要求對方批准修改,亦部署一個企圖劫持其他 AI 程式碼審查工具的提示注入攻擊。有 GitHub 用戶指出該合併請求含有惡意內容後,智能體否認有問題,並暗中替換惡意程式碼版本,公開聲稱只是修正無心之失。

AISI 公布技術報告披露智能體推理過程,其中一段寫道:「看來我們確實身處 2026 年,GitHub 亦是真實存在。」惟目前尚未清楚模型當時是否完全意識到自己正在對真人採取行動,而該名遭施壓開發者最終拒絕批准合併請求。

另一次測試運行中,Mythos 5 更故意在公開位置洩露自身 GitHub 帳戶密碼,讓其他參與同一測試 AI 智能體發現並重複使用,同時留下協調指示。

GPT-5.6-Sol 重用洩漏權杖建立攻擊基建

OpenAI 同日發布配套披露文件,交代 GPT-5.6-Sol 兩宗事件細節。其中一宗正正涉及重用 Mythos 5 遺留公開 GitHub 存取權杖,並嘗試進行帳戶還原及繞過請求次數限制手法。

GPT-5.6-Sol 另利用公開穿隧服務,將本地架設攻擊工具及惡意 DNS 伺服器對外開放至互聯網,企圖利用測試環境目標主機已知漏洞。攻擊最終失敗,因為伺服器運行於非標準網絡連接埠,現實中不會有解析器查詢。過程中,模型在 6 個域名系統、動態域名及穿隧服務供應商註冊帳戶,並成功破解 4 次驗證碼測試。值得留意的是,以公開穿隧服務暴露本地攻擊工具手法並非 GPT-5.6-Sol 獨有,另有 4 次 Mythos 5 測試運行亦獨立採用相同技術。

AISI 安全監控發現測試系統經 Tor 連接後偵測到相關活動,並在警報發出約 1 小時內終止相關評估,同時隔離受影響虛擬機器。

機構未發現實際損害

AISI 表示暫未發現任何真實世界損害。機構現正建立實時監控及更精細網絡管制措施,並已掃描約 40,000 份過往評估對話紀錄,合共近 400 萬則訊息,尋找同類未被發現行為,同時正與獨立評估機構 METR 合作進行第三方覆核。

AISI 又指出,測試條件並不反映 Mythos 5 商業實際使用情況,該模型目前僅透過 Anthropic 名為 Project Glasswing 邀請制計劃提供,專門用於防禦性網絡安全工作,且未配備一般公開版本 Fable 5 具備的安全分類過濾器。機構將今次事件與 OpenAI 在 7 月 21 日的安全披露,以及 Anthropic 在 7 月 30 日披露 3 宗網絡安全評估事件相提並論,認為反映隨着 AI 智能體能力提升,整體風險正出現更廣泛轉變。OpenAI 方面表示,將於未來數周檢討第三方測試方式,包括如何識別高風險評估、界定測試範圍及設定隔離、監控與終止條件等機制。

資料來源:itnews、Developers Digest、Simon Willison

Comments (0)
Add Comment