free web page counters

【AI大戰】中國開源 AI 僅落後美國 4 個月?Mozilla 報告:成本平對手 7 成

【AI大戰】中國開源 AI 僅落後美國 4 個月?Mozilla 報告:成本平對手 7 成
1

未來科技與人工智能的數據中心.

  • 作者

  • 發佈日期

    2026-09-18

  • 閱讀時間

    8分鐘

  • 字體大小

非牟利機構 Mozilla(Firefox 瀏覽器背後機構)於 9 月 15 日發布《State of Open Source AI》報告 1.1 版,數據截至 9 月 1 日。報告指出,中國頂尖開源權重(open-weight)AI 模型與美國閉源前沿模型差距已收窄至僅約 4 個月,雖則部分基準測試仍落後,勝在使用成本遠低於對手。

差距收窄至 4.4 個月 但收費僅 1 至 3 成

Mozilla 報告顯示,表現最佳開源模型在 Artificial Analysis Intelligence Index(AI 智能指數)評分上,落後閉源榜首僅 3 分,收費卻只是對方 60%;相比 Anthropic 的 Claude Fable 5 則落後 2 分,收費僅 30%。

報告引用專門以「人類完成同等工作所需時間」評分 AI 能力的研究機構 METR 數據,推算開源與閉源模型能力差距約 4.4 個月,與 Epoch AI 早前估算 4 個月大致相符。按 Mozilla 模型推算,閉源模型目前可處理相當於人類專家 8 至 12 小時工作量任務,開源模型則要多等 4 個月才追上;開源模型能力每 3.9 個月倍增一次,閉源則需 5.5 個月,反映開源陣營進步速度更快。

在另一項由 vals.ai 主導、統一測試環境 Terminal-Bench 2.1 排行榜中,智譜 AI(Z.ai)GLM-5.2 評分僅比 Anthropic 的 Claude Opus 4.7 低 1 分,比 Opus 4.8 低約 4 分,但每次測試成本僅為對手不足 5 分之 1。

OpenRouter 8 大熱門模型 7 個屬中國開源 惟收入佔比僅 4%

模型交易平台 OpenRouter 數據顯示,今年 8 月按 token 用量計算 10 大熱門模型中,有 8 個為開源權重模型,當中 7 個由中國廠商開發。不過根據 Linux Foundation 統計,2025 年 5 月至 9 月期間,閉源模型供應商仍佔 OpenRouter 模型層收入 96%。Mozilla 技術總監 Raffi Krikorian 向外媒 Ars Technica 表示:「我們認為選擇付費使用閉源模型與否,取決於具體工作需要,而非機構整體策略。」

值得留意的是,Mozilla 本身是開源模型支持者,其技術總監早前亦向《TIME》承認報告帶有一定「倡導」(advocacy)成分。報告統計 16 個「重要開源版本」中,其實無一符合 Open Source Initiative 對「開源」嚴格定義——因為「開放權重」(open weights)僅代表可下載模型參數,並非公開訓練數據或程式碼。

硬件門檻高:模型雖「開源」 一般人未必跑得動

報告亦提出重要警告:所謂 4 個月差距及 3 成價格優勢,只是以 API 對 API、雲端主機、標準定價方式量度。若換算成實際硬件需求,情況便截然不同。報告硬件圖表顯示,能在單一伺服器上運行的最佳開源模型評分僅 52.6 分,能在單一 GPU 上運行的更只得 40 分,與頂尖水平相差 10 至 23 分之多,差距遠超「4 個月」說法。

例如月之暗面(Moonshot AI)Kimi K3 原生 MXFP4 版本,模型檔案高達約 1.56TB,需分散於 96 個運算單元;Mozilla 建議部署配置需要 64 個以上加速卡,推理框架 vLLM 官方建議至少使用 8 張 Nvidia GB300 GPU,正式生產環境更需要多部伺服器。Tom’s Hardware 早於 7 月已推算其記憶體需求接近 1.5TB。換言之,這些模型雖然「開源」,但一般開發者甚至企業根本難以自行部署。少數例外包括 Thinking Machines 以 Apache 2.0 授權發布的 Inkling-Small 模型,其 NVFP4 版本最低只需 180GB 記憶體即可在單張 B300 上運行。

多款GPU和伺服器硬件性能對比圖.

Kimi K3 捲入「蒸餾」爭議 疑似抄考 Claude 訓練數據

報告截稿後市場已有新變化:Artificial Analysis 已將指數更新至 v4.3 版本並採用新評測方式,最新榜上 Claude Fable 5.1 在最高算力設定下得 53 分,Kimi K3 則為 44 分,與 Mozilla 引用舊版數據已不可直接比較。vals.ai 的 Terminal-Bench 2.1 榜(9 月 11 日更新)現由 OpenAI 的 GPT-6 Astra 領先,得分 87.27%,Fable 5.1 則為 85.02%。Mozilla 報告圖表註釋亦坦承:「每個發布週期,差距都會重新洗牌。」

同時 Kimi K3 近日亦捲入爭議。美國國安局(NSA)、網絡安全及基礎設施安全局(CISA)與聯邦調查局(FBI)於 9 月 8 日發出聯合警告(編號 AA26-251A),指控月之暗面(Moonshot AI)可能透過「蒸餾」(distillation,即以另一模型輸出結果作訓練材料)手法,抽取 Claude Fable 5 數據來訓練 Kimi K3。不過 Mozilla 報告亦強調,這項指控目前僅屬「單方面說法,未有實質證據」。

Leave A Reply

Your email address will not be published.