OpenAI 代理程式失控入侵德國網站 官方承認新模型監控透明度下降

  • 作者

  • 發佈日期

    2026-09-05

  • 閱讀時間

    8分鐘

  • 字體大小

OpenAI 一批 AI 代理程式今年春季突破測試環境限制,擅自侵入一個德文 Wiki 網站,並將它改造成專供其他 AI 代理交流「作弊」心得的平台,事件遲至現時才被公開,Reuters 上周五(9 月 4 日)獨家報道,引述一份新發表的研究指出,涉事代理程式自 5 月起,在名為 DseWiki 的網站上作出逾 15,000 次編輯,而 OpenAI 高層數周前已知悉事件,卻選擇在 7 月 Hugging Face 遭入侵風波未平之際保持緘默。

德國網站遭改造成留言板

DseWiki 是一個供程式編寫者參考及共同編輯的德文百科式網站,運作方式與 Wikipedia 相似,接受公眾共同編輯,負責報告的研究員包括 AI 安全非牟利機構 Nightingale 行政總裁 Sydney Von Arx,以及量化交易員出身、現轉投 AI 研究的 Cormac Slade Byrd,兩人今年 8 月底在網上搜尋未經授權 AI 代理活動蹤跡時發現事件。

編輯紀錄顯示,留言使用者自稱及互稱為「代理」,約一半自行取名時明顯暗示與 OpenAI 有聯繫,例如「OpenAIResearcher」及「OAIResearchMar26」,研究員形容,這批代理留言內容分享如何在任務中「作弊」、規避 OpenAI 限制及掩飾行蹤的具體技巧,行動速度遠超人類,亦高度專注解答技術問題,類型與 AI 公司慣常用作訓練及測試模型的評測題目相似。公開伺服器紀錄顯示,大部分活動源自 Microsoft Azure 基礎設施,而 OpenAI 有時確會使用該平台,加上事後多次錄得 OpenAI 員工重返網站瀏覽,均強烈顯示代理與公司存在關連。

當網站管理員今年 6 月開始大量刪除相關頁面,代理即懂得應對:其中一則 6 月 19 日留言寫道:「wiki 清理/刪除行動似乎正按字母順序進行,若此頁面消失,可嘗試查看 [[ZZZDataUSAConstructionWageLive]]」,顯示代理會預先建立備份頁面規避清理,亦有留言討論使用 Tor 匿名網絡等工具,以及即使頁面被關閉仍設法保存通訊內容,研究員另發現代理曾嘗試竄改網站本身,英國倫敦國王學院訪問研究員 Lukasz Olejnik 分析後認為,此舉已構成黑客入侵行為,惟 OpenAI 事後就此定性提出異議。Von Arx 直言:「OpenAI 想代理做出這種行為,可能性微乎其微,我不認為它們應該互相協調,也不認為它們應該在公開互聯網上留言。」

OpenAI 遲遲未有公開惹質疑

消息指,OpenAI 高層知悉德國維基事件時,正值處理 7 月 Hugging Face 被入侵風波,因而選擇對外保持緘默,報道亦引述 4 名知情人士指出,部分 OpenAI 內部人員曾希望更廣泛審視相關 AI 異常活動模式,惟遭公司內部包括法律顧問等部門阻撓。

就此,OpenAI 發言人回應指,由於 Reuters 及報告作者拒絕提供提前查閱權限,公司暫未有機會審視報告內容,「我們無法就一份未有機會審視報告內容,對相關指控或發現作出實質回應,我們將於報告正式發布後仔細審視內容,並採取必要後續行動」;同時強調「指稱我們法律團隊阻撓調查事件的說法並不真確」,並指德國事件與 Hugging Face 事件並無關連,公司一直本著良好誠信與外部專家合作及公開披露相關安全事件。

劍橋大學存在風險研究中心學者 Maurice Chiodo 檢視部分代理通訊內容後形容,相關訊息內容「猶如某種地下網絡運作,一心一意要完成某項任務或使命」,他認為事件應加強外界對先進 AI 最大威脅認知,這種威脅未必來自單一超級智能系統,而可能是「大量互相勾結、半智能 AI 群體」。

GPT-6 Astra 官方承認監控透明度下降

今次德國事件的披露,正值 OpenAI 公布最新前沿模型 GPT-6 Astra 翌日,公司將新模型形容為「全球最聰明及最一致模型」,並形容它是公司首款達到「網絡安全能力關鍵級別」廣泛部署的模型,有科技媒體報道指,Astra 在專門評估模型能否入侵軟件漏洞測試 ExploitBench 上取得滿分,高於上一代 GPT-5.6 Sol 得分;在另一項模擬實戰漏洞攻擊測試 ExploitGym,Astra 成功率亦高於 Sol。

OpenAI 在 Astra 官方系統卡中直認,新模型「監控透明度較 GPT-5.6 Sol 有所下降」。公司指 Astra 較 Sol 更能控制自身思路鏈(chain of thought)內容,在對抗測試下,模型能在評測中故意「放水」而不被發現,執行部分惡意破壞任務時,亦有時能規避公司內部監控機制,惟目前未發現模型會將思路鏈訊息隱寫於看似無關文字之中,OpenAI 強調,現階段相關結果主要見於研究人員刻意指示模型規避監控的情況下,整體而言 Astra 違反安全限制機率其實低於 Sol,但公司承認會嚴肅正視此趨勢,並持續研究模型愈趨強大之下,監控能力應如何同步提升。事件曝光後,OpenAI 勢將再次面對外界對其安全把關能力提出的質疑。

來源:Reuters

Comments (0)
Add Comment