Mac Studio M5 Ultra vs M3 Ultra – Local LLM 開箱評測:125B 本地 LLM 達 114 token/s

Mac Studio 2026

搭載 M5 Ultra 處理器

HK$19,999 起(本次測試機:HK$95,999)

查詢:800-908-988 (Apple)

  • 晶片 M5 Max 或 M5 Ultra(本次測試機:M5 Ultra)
  • 核心數目(M5 Max) 18 核心 CPU 配備 6 個超級核心及 12 個高效核心 32 核心 GPU(可配置:配備 18 核心 CPU、40 核心 GPU 及 16 核心神經網絡引擎 (614GB/s 記憶體頻寬))
  • 核心數目(M5 Ultra) 30 核心 CPU 配備 10 個超級核心及 20 個高效核心 64 核心 GPU(可配置:配備 36 核心 CPU、80 核心 GPU 及 32 核心神經網絡引擎 (1.2TB/s 記憶體頻寬))
  • 記憶體頻寬(M5 Max) 460GB/s 或 614GB/s
  • 記憶體頻寬(M5 Ultra) 1.2TB/s
  • 記憶體(M5 Max) 36GB(可配置:48GB、64GB 或 128GB (M5 Max 配備 18 核心 CPU 及 40 核心 GPU))
  • 記憶體(M5 Ultra) 96GB(可配置: 256GB 或 512GB (M5 Ultra 配備 36 核心 CPU 及 80 核心 GPU))
  • 儲存空間(M5 Max) 512GB(1TB、2TB、4TB 或 8TB)
  • 儲存空間(M5 Ultra) 1TB(可配置: 2TB、4TB、8TB 或 16TB)
  • 顯示器支援(M5 Max) 支援多達 5 個外置顯示器
  • 顯示器支援(M5 Ultra) 支援多達 8 個外置顯示器
  • 音訊 內置揚聲器、3.5 毫米耳筒插口進階支援高阻抗耳筒、HDMI 連接埠支援多聲道音訊輸出
  • 連接及擴充性(背面) 背面四個 Thunderbolt 5 (USB‑C) 連接埠 (快達 120Gb/s)、兩個 USB 3 (USB‑A) 連接埠 (快達 5Gb/s)、HDMI 2.1 連接埠、10Gb Ethernet、3.5 毫米耳筒插口
  • 連接及擴充性(正面,M5 Max) 兩個 USB-C 連接埠 (快達 10Gb/s)、SDXC 卡槽 (UHS-II)
  • 連接及擴充性(正面,M5 Ultra) 兩個 Thunderbolt 5 連接埠 (快達 120Gb/s)、SDXC 卡槽 (UHS-II)
  • 尺寸 高度:9.50 厘米 (3.7 吋) 寬度:19.70 厘米 (7.7 吋) 深度:19.70 厘米 (7.7 吋)
  • 重量 M5 Max:2.73 千克、M5 Ultra:3.64 千克
  • 本次測試機 M5 Ultra, 256GB 統一記憶體, 4TB 儲存空間, 30 核心 CPU, 64 核心 GPU, 1.2TB/s 記憶體頻寬
  • 優點

    • 頂級本地 AI(Local LLM)執行能力
    • 極高頻寬的超大容量統一記憶體
    • I/O 連接與擴充性極佳
    • 一機多用的全方位終極效能
    • 散熱極佳且極致寧靜
  • 注意點

總分 96

  • 設計、用料 90
  • 效能 96
  • 散熱效能 96
  • 擴充性 92

搭載全新 M5 Ultra 處理器的 Mac Studio 正式推出,作為 Apple 旗下最強大的桌面級工作站,今代不單將官方記憶體頻寬提升至 1.2TB/s,GPU 更於每個核心新增神經網絡加速器(Neural Accelerator),並配備全新著色器核心(Shader Core)、第二代動態快取(Dynamic Caching)以及應用了全新晶片封裝架構(UltraFusion),加上讀寫速度分別高達 13.76GB/s 及 11.35GB/s (我們今次實測速度)的極速 SSD,帶來全面的效能提升。不過對於專業用戶與開發者而言,最關心的莫過於大容量統一記憶體(Unified Memory)的實戰能力。今次我們將會進行深度實測,以 MTPLX 環境挑戰 Qwen 3.8 27B 以及高達 125B 參數的 Qwen 3.8 Flash-Next 等本地 AI 大型語言模型(Local LLM),從生成速度、回應延遲(TTFT, 首字回應時間)、記憶體頻寬以至功耗,全面剖析 M5 Ultra 運行 Local AI 的真實實力,並探討 M3 Ultra 用家到底值不值得升級!

相關影片:

同樣 256GB RAM 大型 Local LLM 是否真正夠快?

Apple Silicon 跑 Local LLM,一直有統一記憶體(Unified Memory)容量夠大的優勢,但「模型放得入」與「真正好用」是兩回事。今次我們以同樣配備 256GB 統一記憶體、4TB SSD 的 Mac Studio M3 Ultra 與 M5 Ultra 比較,重點不是單看 CPU、GPU 跑分,而是實際跑大型語言模型時,生成速度、回應延遲、記憶體頻寬及功耗有多大分別。

結果相當明顯:M5 Ultra 跑 Qwen 3.8 27B 快約四成;Qwen 3.8 Flash-Next 更由 M3 Ultra 的 69.4 tok/s 提升至 M5 Ultra 的 115 tok/s。對 Local AI 而言,新一代 Mac Studio 已不只是「可以裝下大型模型」,而是開始將高能力模型推到相當流暢的速度。

▲ M5 Ultra 跑 Qwen 3.8 Flash-Next,今次主要測試錄得 115 tok/s,另外兩次相近測試亦有 116 及 118 tok/s。

兩款模型差異很大 36GB Dense 對 109GB MoE

今次使用 MTPLX 作為 Local LLM 運行環境。為了全面評估,我們挑選了兩款架構截然不同的熱門開源模型來進行壓力測試。

第一款 Qwen 3.8 27B Optimized Quality(動態 8-bit)是 27B Dense 模型,即傳統的密集型神經網絡,運算時會調用所有參數。MTPLX 版本採用 Dynamic 8-bit,取向較重視保留模型品質。Dashboard 顯示,M3 Ultra 測試時約使用 36.1GB 統一記憶體,M5 Ultra 則為約 33.7GB。

第二款 Qwen 3.8 Flash-Next Optimized Speed(Dynamic 4-bit, Sparse Attention 8-bit)則是大型 125B-A6B MoE 混合專家模型,運算時只會根據需求啟用部分參數以提高效率。主語言模型有 125B 參數,而每個 token 約啟用 6B;MTPLX 版本主要採用 Dynamic 4-bit,Sparse Attention projection 保留 8-bit。今次兩機測試均使用約 109GB 記憶體。Qwen 官方亦另列 51B n-gram embedding 及 MTP,因此 125B 是主語言模型規模,而非整個套件所有參數的簡單總和。

▲ M3 Ultra 跑 Qwen 3.8 27B Optimized Quality 時,Dashboard 顯示約使用 36.1GB 記憶體。

▲ M5 Ultra 跑 Qwen 3.8 Flash-Next Optimized Speed 的相近測試畫面,記憶體使用量約 109.4GB。

模型 架構 / 設定 測試記憶體佔用
Qwen 3.8 27B Optimized Quality 27B Dense
Dynamic 8-bit
M3 Ultra:約 36.1GB
M5 Ultra:約 33.7GB
Qwen 3.8 Flash-Next Optimized Speed 125B-A6B MoE
Dynamic 4-bit
Sparse Attention 8-bit
M3 Ultra:約 109.6GB
M5 Ultra:約 109.4GB

▲ 今次測試同時涵蓋約 34–36GB 的 27B Dense 模型,以及記憶體佔用超過 100GB 的大型 MoE 模型。

用 Python Debug 題比較 避免只測「Gen 文」

很多人測試 AI 只會叫它寫篇短文,但這無法反映專業用戶的真實高強度需求。為了增加測試難度和實用性,測試採用一條改編自 LeetCode Hard「Reverse Nodes in k-Group」的 Python Debug 題,程式預先加入兩個真正邏輯 Bug,要求模型理解程式、找錯並完整修正。題目有標準答案,較單純要求模型生成長文更接近 Coding 工作負載。

兩機均使用新 Session、Cache Miss、MTP Depth 3 及 Reasoning Auto。今次屬單一短上下文 Debug workload,大部分配置以一筆主要紀錄比較;M5 Ultra Flash-Next 額外有兩筆相近結果。由於每次回答輸出長度並不相同,因此主要比較 generation tok/s,而不是整次回答完成時間。

▲ M3 Ultra 跑 27B 的 Debug 回答畫面,可看到模型對程式錯誤的分析及修正。

▲ M5 Ultra 的 27B 測試結果及執行狀態;今次主要以生成速度作兩代平台比較。

27B 快 42% Flash-Next 更快 66%

進入最核心的效能對決,我們實際比較了兩部主機在處理剛才的 Python Debug 題目時,到底能有多快的文字生成速度。首先在較輕量的 27B 級別測試中,Qwen 3.8 27B 在 M3 Ultra 錄得 56.4 tok/s,M5 Ultra 達 80.3 tok/s,效能提升達到 42.4%;開始生成首個 token 的 TTFT(Time To First Token,即按下 Enter 後到 AI 開始打字的反應等待時間)亦由 M3 Ultra 的 1.50 秒降至 M5 Ultra 的 0.54 秒。

測試 1(Qwen 3.8 27B):

▲ M3 Ultra 跑 Qwen 3.8 27B,主要測試錄得 56.4 tok/s。

▲ M5 Ultra 同一款 27B 模型錄得 80.3 tok/s,比 M3 Ultra 提升約 42%。

面對中型模型,M5 Ultra 已經表現出極大優勢,但當我們切換到佔用過百 GB 記憶體的大型模型時,兩者的硬體效能分野才真正浮現。在 Flash-Next 測試中效能差距更大,由 M3 Ultra 69.4 tok/s 升至 M5 Ultra 114 tok/s,效能提升達到 65.7%,TTFT 則由約 M3 Ultra 的 1.10 秒縮短至 M5 Ultra 的 0.43 秒。按相同輸出量換算,若生成 1,000 tokens,27B 約由 M3 Ultra 的 17.7 秒縮至 M5 Ultra 的 12.5 秒;Flash-Next 則約由 M3 Ultra 的 14.4 秒縮至 M5 Ultra 的 8.7 秒。這是按 generation tok/s 換算的時間,並非另一輪同步測試。換句話說,當你需要 AI 生成大段程式碼或長篇文章時,M5 Ultra 不單起步思考的時間縮短了一半以上,整體輸出的流暢度更帶來了肉眼可見的升級體驗,大幅減少了用家苦等的折磨。

測試 2(Qwen 3.8 Flash-Next):

▲ M3 Ultra 跑 Qwen 3.8 Flash-Next 錄得 69.4 tok/s。

▲ M5 Ultra 同一款 Qwen 3.8 Flash-Next 模型錄得 114 tok/s,比 M3 Ultra 提升約 65%。

LLM 大型語言模型測試總結

模型 M3 Ultra M5 Ultra 提升
Qwen 3.8 27B 56.4 tok/s 80.3 tok/s +42.4%
Qwen 3.8 Flash-Next 69.4 tok/s 114 tok/s +65.7%
模型 M3 Ultra TTFT M5 Ultra TTFT 縮短
Qwen 3.8 27B 1.50 秒 0.54 秒 約 64%
Qwen 3.8 Flash-Next 1.10 秒 0.43 秒 約 61%

▲ M5 Ultra 不只持續生成速度較高,開始生成首個 token 的等待時間亦明顯縮短。

記憶體頻寬快五成 但不能只歸功於 RAM

為什麼速度會有如此顯著的提升?我們透過專門測試記憶體頻寬(資料傳輸速度)的軟件來尋找答案。我們在 StreamBench GPU Triad 實測,M3 Ultra 記憶體頻寬為 688.47GB/s,M5 Ultra 達 1,035.82GB/s,提升達 50.5%。持續 LLM 生成通常對記憶體頻寬敏感,因此這是解釋速度改善的重要原因。

不過,模型佔用 109GB 並不等於每生成一個 token 都會讀取全部 109GB;Flash-Next 又屬混合專家模型 MoE,所以不能直接以模型容量推論頻寬需求。其 66% 的速度增幅亦可能涉及 MoE 運算、MTP 驗證效率及其他軟硬件因素。M5 Ultra 官方記憶體頻寬為 1.2TB/s,比 M3 Ultra 高 50%,而每個 GPU Core 亦新增 Neural Accelerator,並採用新 Shader Core、第二代 Dynamic Caching 及新版 UltraFusion。這意味著不單止是「資料通道變闊了」,連底層的處理引擎架構也全面升級了。

Memory Bandwidth M3 Ultra M5 Ultra 差距
Apple 官方規格 819GB/s 1.2TB/s 約 +46.5%
StreamBench GPU Triad 688.47GB/s 1,035.82GB/s +50.5%

▲ StreamBench 實測頻寬提升約五成,與 Apple 官方規格的代際升幅方向一致。

▲ M3 Ultra StreamBench GPU 測試,Triad 實測為 688.47GB/s。

▲ M5 Ultra 同一測試的 Triad 達 1,035.82GB/s,實測提升約 50.5%。

功耗只小幅增加 傳統 Benchmark 亦全面提升

性能大幅躍升,會不會導致極度耗電?在 LLM 測試時我們同時運行 Powermetrics 測試,當中 27B 的 GPU 平均功耗估算由 M3 Ultra 約 63.9W 升至 M5 Ultra 67.7W;Flash-Next 則由 M5 Ultra 的 45.2W 升至 M5 Ultra 的 48.0W,兩者約增加 6%。相對 generation throughput 分別增加了 42% 以及 66%,顯示 GPU 推理效率有改善跡象。不過功耗與速度來自不同輪次,而且 powermetrics 是軟件估算而非通過電源插座偵測耗電量,因此我們只作趨勢參考。

Workload M3 Ultra GPU M5 Ultra GPU 功耗變化 生成速度提升
Qwen 3.8 27B 約 63.9W 約 67.7W 約 +5.9% +42.4%
Qwen 3.8 Flash-Next 約 45.2W 約 48.0W 約 +6.0% +65.7%

註:GPU Power 為 macOS powermetrics 軟件估算,而且來自分開輪次測試,並非插座量得的整機耗電。
▲ 今次測試中 GPU 功耗估算只增加約 6%,但 generation throughput 提升約 42% 至 66%。

▲運行 Qwen 3.8 Flash-Next 時 M5 Ultra 的 GPU 平均功耗為 48.0W,只比 M3 Ultra 略為增加,但生成速度可提升 42% 以及 66%

除了專攻 AI 領域,M5 Ultra 在傳統的電腦效能指標上,也看得出並非是小幅度升級。在 Geekbench 7 效能測試當中,單核跑分相比 M3 Ultra 提升達 30.3%,而多核跑分測試有 37.6% 提升,而 GPU Metal 跑分更有 40.8% 提升。然後我們在 Cinebench 2026 進行跑分,多核及 GPU 分別提升 59% 及 72.2%。

SSD 速度方面,我們今次兩部測試機同為 4TB SSD,在 Blackmagic Disk Speed Test 寫入由 M3 Ultra 的 7.05GB/s 提升至 M5 Ultra 的 11.35GB/s,速度提升 61%;讀取更由 M3 Ultra 的 5.76GB/s 升至 M5 Ultra 的 13.76GB/s,速度提升約 139%。

測試 M3 Ultra M5 Ultra 提升
Geekbench 7 CPU Single 2,884 3,758 +30.3%
Geekbench 7 CPU Multi 38,140 52,464 +37.6%
Geekbench 7 Metal 252,258 355,158 +40.8%
Cinebench 2026 CPU Multi 11,179 17,774 +59.0%
Cinebench 2026 GPU 81,831 140,943 +72.2%
SSD Write 7.05GB/s 11.35GB/s +61%
SSD Read 5.76GB/s 13.76GB/s +139%

▲ 除了 Local LLM,M5 Ultra 在 CPU、GPU 及 SSD 測試亦有明顯提升;SSD 讀取速度在今次 4TB 對 4TB 測試中達約 2.4 倍。

▲M5 Ultra Geekbench 7 效能測試

▲M3 Ultra Cinebench 2026 跑分

▲M5 Ultra Cinebench 2026 跑分。 Cinebench 2026 對比:M5 Ultra CPU Multi 及 GPU 分別比 M3 Ultra 高約 59% 及 72%。

▲M3 Ultra SSD 速度測試(Blackmagic Speed Test)

▲M5 Ultra SSD 速度測試(Blackmagic Speed Test)。兩部機同為 4TB SSD,M5 Ultra 在今次 Blackmagic 測試中寫入快約 61%,讀取快約 139%。

結論:M3 Ultra 未過時 但每日用 Local AI 就有升級理由

在總結兩代 Mac Studio 的表現之前,我們必須先釐清今次選用測試模型的意義。Qwen 3.8 Flash-Next 值得測試,不只是因為模型大,而是它已有相當強的公開能力評測。根據第三方機構的數據,它的 Artificial Analysis Intelligence Index 為 40 分,表現極之接近雲端頂級模型 Gemini 3.8 Flash High 的 41 分的成績;而在專注程式開發評測的 Qwen 官方 SWE-bench Pro Agentic Coding 亦錄得 62.5。

當然,我們要補充一點,這些分數只是交代模型能力背景,並非今次 MTPLX Dynamic 4-bit 版本的能力重測,也不代表 Flash-Next 與 Gemini 在所有任務表現相同。不過今次結果至少證明,一個公開能力評測已相當高、實際佔用約 109GB 記憶體的大型 Local LLM,可以在 M5 Ultra 單機達到 114 tok/s 的驚人流暢度,這代表著以往只能依賴雲端伺服器龐大算力的模型,現在已能真正在地化實用。

那麼回到最核心的問題:到底應否升級?對 M3 Ultra 用家而言,69.4 tok/s 本身已很實用,只是偶爾跑 Local AI 未必需要急於升級;但如果 Local LLM、Coding 已是你的每日主要工作負擔,在升級後我們獲得從 M3 Ultra 的 69.4 tok/s 提升至 M5 Ultra 的 114 tok/s 的效能提升,加上 TTFT 明顯下降,實際等待時間就有分別。不過客觀來說,今次沒有測完整工具呼叫、多檔案修改或 Coding Agent workflow,因此不能把 66% generation speed 直接理解成 Agent 任務亦快 66%,實際整體效率提升幅度仍會因應具體操作而有所不同。

最後,除了今次我們測試的 AI 跑分,我們不能忽略 M5 Ultra Mac Studio 的另一個價值,是它並非 AI 專用機器,仍可用作剪片、執相、Coding、娛樂及日常工作的主力電腦。擁有 256GB 級記憶體、能流暢運行高能力大型 Local LLM、生成速度達過百 tok/s,加上一機多用,才是今次 M5 Ultra 最有意思的定位。對於預算充足且需要極致工作效率的專業人士來說,絕對是一個極具吸引力的投資。

▲ 最終回到今次最具代表性的結果:M5 Ultra 單機跑 Qwen 3.8 Flash-Next 達 114 tok/s,而 Mac Studio 本身仍是一部完整的多用途工作站。

由於今次測試時間有限,主要集中在短上下文、單一 request 的 Local LLM 推理表現。下一步會再測試如更長 Context Prefill及長時間持續負載等,進一步看看 M5 Ultra 在單機 Local AI 工作站上的真正上限。

Comments (0)
Add Comment