-
作者
-
發佈日期
2026-07-21
-
閱讀時間
7分鐘
-
字體大小
月之暗面(Moonshot AI)本週推出 Kimi K3,總參數高達 2.8 兆,成為史上首個「3T 級」開源模型。官方技術網誌建議本地部署使用 64 張或以上加速器組成的超節點配置。完整開源權重預計 7 月 27 日前推出,惟單機玩家已無力自行部署,只能轉用 K2 系列或直接呼叫官方 API。

MoE 架構拆解
Kimi K3 採用混合專家(MoE)架構,模型內部設有 896 個專家子網絡。每次處理一個 token 時,系統只會挑選其中 16 個路由專家加上共享專家運算,不會全部啟動。實際運作參數只有 500 億至 600 億左右,這亦是模型能兼顧龐大規模與運算效率的原因。
模型同時搭載新架構 Kimi Delta Attention(KDA),並配合 Attention Residuals 技術。官方表示這套組合在 100 萬 token 長上下文環境下,解碼速度最高可提升 6.3 倍。上下文視窗達 100 萬 token,同時亦原生支援視覺輸入,令模型可直接處理圖像與影片資料。

官方門檻:64 張 GPU 起跳
月之暗面官方技術文件明確建議,考慮到推論效率需要更大的高頻寬通訊域,本地部署 K3 宜使用 64 張或以上加速器組成的超節點配置。原生 MXFP4 權重約 1.4 TB 至 1.5 TB,屬 DeepSeek-R1 671B(Q4 量化版本約 350 GB 至 400 GB,各方報告數字略有差異)的 3 至 4 倍左右。
單純換算放置權重所需的 GPU 數量:H100(80 GB)約需 19 張,H200(141 GB)約需 11 張,B200(192 GB)約需 8 張。以上數字尚未計及 KV cache,即模型記錄對話上下文所需的記憶體。100 萬 token 長上下文的 KV cache 需求,官方目前尚未公佈,但需求只會更高。價格方面,H100 80 GB PCIe 版本單張現時約 25,000 美元至 33,000 美元(約港幣 HK$195,000 至 HK$257,400),SXM 版本則達 35,000 美元至 40,000 美元以上(約港幣 HK$273,000 至 HK$312,000 以上)。8 卡 H100 伺服器一台已超過 30 萬美元(約港幣 234 萬元)。按 64 張規格計算,即相當於 8 台 8 卡伺服器,單是硬件採購費用已超過 240 萬美元(約港幣 1,872 萬元以上)。
功耗方面,H100 SXM 版本單張最高功耗達 700 W,PCIe 版本則為 350 W。若以 64 張 SXM 版本計算,單是顯示卡本身已消耗約 45 kW 電力,遠超一般家庭供電容量。一台 8 卡 H100 伺服器實際運作已需要 6.5 kW 至 7.5 kW,屬於機房級用電規模。
上一代還塞得進一部電腦
對照上一代 K2 系列(1 兆參數,約 320 億啟用參數),落差更為明顯。社群 Unsloth AI 為 K2 製作的 1.8-bit 極限量化版本,將原本 1.09 TB 的模型壓縮至約 245 GB,一張 24 GB 消費級顯示卡搭配 256 GB 系統記憶體卸載亦能運作,但速度僅約每秒 1 至 2 個 token。較平衡的 Q2_K_XL 版本則約需 381 GB。
上一代一台 512 GB Mac Studio 已勉強能運作,K3 卻直接將門檻推回數據中心級別。市場上其他大型開源模型如 DeepSeek V4 Pro(約 1.6 兆參數)同樣規模龐大,而 K3 仍以 2.8 兆參數,較 DeepSeek V4 Pro 大出約 75%,成為現時最大開源模型。Kimi K3 在多項編碼及代理任務基準上表現超越 Anthropic Claude Opus 4.8,但整體性能仍落後於 Claude Fable 5 及 GPT-5.6 Sol 等頂級私有模型,這一點月之暗面官方亦明確承認。對於一般用戶而言,若想使用相關技術,暫時只能轉用 K2 系列,或直接呼叫官方 API。
資料來源:動區動趨 BlockTempo、Kimi 官方網誌