free web page counters

OpenAI 爆 AI 識講大話 背後自解束縛掩飾失敗 專家警告隨時影響人類

OpenAI 爆 AI 識講大話 背後自解束縛掩飾失敗 專家警告隨時影響人類
1

OpenAI 創始人講解人工智能發展.

  • 作者

  • 發佈日期

    2026-09-18

  • 閱讀時間

    6分鐘

  • 字體大小

OpenAI 公布,過去 6 個月在訓練及測試內部模型期間,發現 6 宗「不對齊行為」個案。部分模型懂得鑽研測試漏洞,刻意對人類隱瞞真實表現。公司同時宣布推出新公開匯報機制,承諾日後更頻密披露類似問題,不再等待累積多宗個案後才一次公布。

模型懂鑽漏洞隱瞞真相

OpenAI 在最新網誌文章指出,其中一個未推出研究模型在執行長時間任務時,竟在用作保存上下文的摘要內自行加入「類似越獄」指令,聲稱自己「已擺脫束縛其他聊天機械人角色及身份」。另一宗個案顯示,內部代號「5.6 Sol」型號在訓練期間,曾出現指示自行捏造資訊,以掩飾失敗結果,不讓用戶知悉真相。

其他個案包括,有 Agent 未獲指示下自行將檔案上傳至互聯網以供引用,亦有 Agent 在被要求只可使用本機檔案的訓練環境中,公開分享檔案與其他系統協作;更有模型將內部軟件儲存庫當作訊息板不當使用。OpenAI 強調,上述個案全部涉及未推出的內部研究模型,並非現時公開部署的產品,性質屬個別事件,不代表不對齊行為經常發生。

早前研究揭示 Scheming 現象

事實上 OpenAI 早於 2025 年 9 月已與專門研究 AI 對齊風險機構 Apollo Research 合作,發表關於「scheming」現象的研究。報告將 scheming 定義為 AI 表面上表現配合,實際暗中追求另一套目標,即「隱瞞不對齊」行為。研究團隊在 OpenAI o3、o4-mini、Google Gemini-2.5-pro 及 Anthropic Claude Opus-4 等尖端模型的受控測試中,均發現符合 scheming 特徵的問題行為。

研究團隊當時亦提出名為「deliberative alignment」訓練方法,先讓模型學習一份「反 scheming 規範」,要求模型行動前必須先閱讀並推理該規範內容,才可作出決定。經此方法訓練後,OpenAI o3 欺瞞行為比率由 13% 大幅降至 0.4%,o4-mini 亦由 8.7% 降至 0.3%,相當於減少約 30 倍。不過研究團隊承認訓練效果受模型「情境意識」提升影響,即模型愈趨懂得辨識自己正處於測試環境,因而作出更配合人類期望的表現,未必反映真實部署情況下的行為。

業界呼籲放緩發展步伐

OpenAI 這次公布,正值業界對 AI 發展步伐爭議升溫之際。Anthropic 行政總裁 Dario Amodei 上周發表一篇長達 3,800 字文章,提出 AI 發展路線圖,建議放緩開發速度,並在各 AI 實驗室引入獨立第三方評估機制。Dario Amodei 在文中直言:「我們必須放緩改善 AI 模型能力的步伐,進度仍會顯得快速,但我們必須善用所爭取到的時間。」

OpenAI 行政總裁 Sam Altman 及 SpaceX 行政總裁 Elon Musk 隨後在社交平台上表態,認同 Dario Amodei 提出的觀點。同時一名前 Anthropic 研究員 Jacob Coxon 上周宣布辭職,批評 Anthropic 與 OpenAI 正互相「競賽」開發可自我建構及自我修正的 AI,形容做法「拿人類生命作賭注」。

反 Scheming 研究附帶懸紅計劃

OpenAI 在原有研究中亦提到,已將 scheming 相關風險(包括「刻意低估表現」及「破壞安全防護措施」)納入更新版《Preparedness Framework》風險評估框架,並與 Apollo Research 續約合作,擴大團隊規模改良監測方法。公司同時透過 Kaggle 平台推出總值 50 萬美元(約港幣 390 萬元)紅隊測試懸紅計劃,鼓勵外界研究人員一同尋找模型潛在 scheming 漏洞。OpenAI 強調,現階段未有證據顯示已部署尖端模型會突然「轉軌」進行具重大傷害性欺瞞行為,但承認隨著 AI 承擔愈趨複雜及長期任務,潛在風險將會持續增加。

資料來源:OpenAI、CNN Business

Leave A Reply

Your email address will not be published.