Gemma 4 實測文可以看出 Google DeepMind 研發的第四代開放權重模型系列的效能差異,其技術與研究基礎源自 Google 的旗艦模型 Gemini。Gemma 4 模型提供 5 種參數大小:E2B、E4B、12B、31B 和 26B A4B。
小型高效版(如 E2B、E4B):專為手機和瀏覽器等邊緣裝置設計,具備極佳的效能與功耗比。
中大型版本(如 12B、31B Dense 及 26B A4B MoE):提供強大的推理、編碼與代理(Agent)功能。
本文將針對雙卡 RTX 5060 Ti 16GB 在 llama.cpp 環境下運行 Gemma 4 實測表現進行深度剖析。重點對比兩種截然不同的模型架構:
傳統稠密(Dense)架構的 12B 版本
混合專家(Mixture-of-Experts, MoE)設計的 26B A4B 版本
讀者能看到在不同上下文長度下,Token 生成速度(tok/s)、電源消耗的數據。無論是計畫建置本地 AI 工作站的開發者,還是需要評估硬體投資回報率的決策者,本文提供最直接的參考依據。
雙卡 RTX 5060 Ti 16GB 優勢:高 CP 值解鎖 32GB VRAM
雙卡部署的核心挑戰在於跨顯示卡資料傳輸的匯流排頻寬。在 Windows 環境下透過 llama.cpp 進行層切分(Layer Splitting)時,模型權重會被平均分配至兩張 GPU 上。
儘管 GDDR 記憶體頻寬與 PCIe 通道在跨卡交換資料時會產生些許通訊延遲,但雙卡低成本實現 32GB 的總容量,有充足的空間來存放 KV 快取(KV-cache),從而支持更長的上下文視窗。
這種組合可打破單卡 16GB 只能跑 Q4 中小模型的限制,成為個人開發者與 Homelab 玩家搭建 AI 工作站的極佳平衡點。
- 預算優勢:雙卡 16GB 提供總計 32GB VRAM,建置成本遠低於單張高階旗艦顯卡。
- 精度突破:足夠的記憶體空間允許運行 Q8_K_XL 等高品質量化,顯著降低 Perplexity 損失。
- 運算機制:透過 llama.cpp 的多 GPU 切分技術,將模型層動態載入兩張 GPU 中執行。
- 頻寬考量:需注意主機板 PCIe 通道配置,確保雙卡傳輸不成為嚴重效能瓶頸。

Gemma 4 實測平台
Google 發布的 Gemma 4 系列展現了兩種不同的模型設計路線:
採用混合專家(Mixture-of-Experts, MoE)架構的 26B A4B
採用傳統稠密(Dense)架構的 12B 模型。
在雙卡 RTX 5060 Ti 16GB 的環境下,這兩種架構呈現出截然不同的推論特性。26B A4B 雖然總參數高達 26B,但每次生成 Token 時僅激活約 4B 的專家參數(Active Parameters),大幅減少了單次推論的計算量。
實測顯示,Gemma 4 26B A4B 在 Q8 精度下雖然佔用了較多 VRAM(約 27GB),但其 Token 生成速度依然保持極高水準,甚至超越了全量激活的 12B Dense 模型。
這是因為 MoE 架構極大程度減輕了 GPU 核心的運算負擔,使雙卡系統能將更多效能專注於記憶體讀取與跨卡傳輸。對於需要即時回應、快速對話或處理複雜邏輯的應用,26B A4B MoE 架構展現出壓倒性的架構優勢。
- MoE 運算機制:26B A4B 總參數 26B 但僅激活 4B 參數,極大化提升推論吞吐量。
- Dense 運算特性:12B 模型每次生成皆全量運算,在雙卡上推論速度受限於核心運算開銷。
- 速度對比:在相同 Q8 精度下,26B A4B MoE 的生成速度表現優於 12B Dense 模型。
- 架構選擇:若追求高智商與高生成速度,MoE 架構是 32GB VRAM 環境的最佳選擇。
Gemma 4 實測硬體規格
| 品名 | 型號/規格 |
|---|---|
| CPU | Intel Xeon Silver 4310 |
| 主機板 (PCIe 4.0) | Supermicro X12SPL-F |
| 記憶體 | 8* 16GB DDR4-3200MHz |
| GPU (PCIe 5.0) | 2* RTX 5060 Ti 16GB |
| 作業系統 | Windows 11 專業版 |
Gemma 4 實測軟體與模型
| 品名 | 型號/規格 |
|---|---|
| Unsloth Gemma 4 26B A4B | gemma-4-26B-A4B-it-UD-Q8_K_XL.gguf |
| Bartowski Gemma 4 26B A4B | google_gemma-4-26B-A4B-it-Q8_0.gguf |
| Unsloth Gemma 4 12B | gemma-4-12b-it-UD-Q8_K_XL.gguf |
| Gemma 4 12B | gemma-4-12b-it-Q8_0.gguf |
| llama.cpp | llama-bench.exe |
Gemma 4 實測對決:26B A4B MoE vs 12B Dense 效能分析
在量化檔案的選擇上,本次測試特別對比了 Unsloth 動態量化的 gemma-4-26B-A4B-it-UD-Q8_K_XL 與社群常見的 bartowski/google_gemma-4-26B-A4B-it-Q8_0。
傳統 Q8_0 對所有矩陣採用統一的 8-bit 量化,而 UD-Q8_K_XL (Ultra-Diluted) 則透過演算法分析模型各層的重要性,對關鍵權重保留更高的精度,同時最佳化記憶體排列。
GPU 卸載層數與 Token 生成速度
當 NGL < 30 時,部分層留給 CPU,資料跨 PCIe 傳輸形成嚴重的效能瓶頸(速度 < 20 tok/s)。當雙卡擁有 32GB VRAM 時,可以將所有模型層完全卸載(NGL=99),生成速度瞬間暴增 3 至 4 倍。
意義:展示模型神經網絡層從 CPU 系統記憶體逐步卸載(Offload)至 GPU 顯存時的速度躍升曲線。
優點: 清楚標示出全顯存卸載(NGL=99)的巨大優勢,證明 32GB 大顯存是流暢運行的關鍵。
缺點: 若顯存不足導致部分層遺留在 CPU(如 NGL < 30),推論速度會出現斷崖式下跌。

GPU 卸載層數與 VRAM 峰值用量
展示兩張 RTX 5060 Ti 如何依序填滿 16GB + 16GB 的實體空間。26B 模型在 NGL=40–50 時即完全佔滿所需的 27,309 MB–28,052 MB 顯存,後續 NGL 增加不再佔用額外 VRAM。
意義:呈現在設定不同 GPU 卸載層數(NGL 0–99)時,VRAM 的線性階梯式用量變化。
優點:提供精準的顯存配置參考,方便使用者設定邊界值。
缺點:26B 模型對 VRAM 門檻要求高,單張 16GB 顯卡(NGL ≈ 20)無法完整載入。

GPU 卸載層數與 Prompt 處理速度
只有當 26B 模型 100% 卸載至雙卡 GPU 時,才能完全調動兩張顯卡共 8,704 個 CUDA 核心進行併行計算,使 Prompt 處理速度從 CPU 端的 140 tok/s 瞬間噴發至近 3,800–3,900 tok/s。
意義:評估 GPU 加速對 Prompt 預處理(Prompt Processing)的提速臨界點。
優點:全顯存卸載能讓千字 Prompt 達到「瞬間讀取完畢」的極致體驗。
缺點:只要有少數層未卸載至 GPU,預處理速度就會受限於 CPU 與 RAM 頻寬。

Context 視窗與 Token 生成速度
文字生成屬於典型的記憶體頻寬受限(Memory-bound)任務。26B MoE 模型每次僅讀取 4B 激活參數,極大減輕了雙卡 PCIe 匯流排與 GDDR6 記憶體頻寬的負擔,使兩張 RTX 5060 Ti 能爆發出 62.7–72.8 tok/s 的極速,遠超 12B Dense(27.5–29.4 tok/s)。
意義:評估模型在輸出文字(Text Generation)時的速度(tok/s)是否會受 Context 長度影響而變慢。
優點: 上下文長度從 0 到 128K 的過程中,生成速度呈現一條平直水平線,毫無卡頓或降速感。
缺點: 12B Dense 受限於全量參數讀取,即便顯存充足,生成速度也無法突破 30 tok/s。

Context 視窗與平均功耗對比
兩張 RTX 5060 Ti 16GB 提供實體 32.6 GB (32,622 MB) 的空間上限。此圖精準證明:26B A4B 模型在 Q8 高精度量化下(靜態權重約 27 GB),搭配 Flash Attention,當 Context 達到極限 128K 時峰值為 30,740 MB–30,914 MB,完美吃滿並貼合雙卡 32GB VRAM 的極限,完全不發生 OOM(記憶體溢出)。
意義:呈現模型靜態權重加上動態 KV 快取(KV-cache)隨上下文拉長時的顯存吃用
優點:證實雙卡 32GB VRAM 足以完整承載 26B 級別模型加上 128K 超長文本的動態快取。
缺點:若未啟用 Flash Attention,26B Q8 模型的 128K KV 快取可能會突破 32GB 限額。

Context 視窗與 Prompt 處理速度
Prompt 處理屬於運算密集型任務。llama.cpp 透過雙卡層切分(-ts 1,1)同時調動兩張 RTX 5060 Ti 的 CUDA / Tensor Cores 進行矩陣運算。得益於雙卡優異的核心算力,26B A4B Q8_0 在 4K–8K 上下文時爆發出近 4,900 tok/s 的驚人速度。
意義:展示模型在解讀與預處理長篇輸入文章(Prompt / Context)時的處理速度(Token/s)變化。
優點:26B MoE 架構在短至中長文本(1K–16K)下預處理極快,能秒讀萬字長文;12B Dense 版本速度穩定維持在 1,800–3,600 tok/s。
缺點:UD 動態量化在 Prefill 階段(Prompt Processing)發生效能瓶頸,26B A4B UD Q8_K_XL 在處理輸入文本時,速度僅有 1,475 ~ 3,038 tok/s,相比同為 26B MoE 架構的標準 Q8_0(2,829 ~ 4,895 tok/s),速度大幅落後了 35% ~ 50%。甚至在 8K 以上的中長文本,其 Prompt 讀取速度比 12B Dense 模型還要慢。

每瓦特效能比與能源效率對比
評估雙卡系統長期運行的電費與發熱效益。26B A4B Q8_0 在 5060 Ti 雙卡上達到驚人的 1.60 tok/s/W(功耗僅 46.7W),UD-Q8_K_XL 為 1.25 tok/s/W,能效比高達 12B Dense(0.28 tok/s/W)的 5.7 倍!
意義:計算每消耗 1 瓦特電力所產生的 Token 數量 (tok/s per Watt),衡量長期的省電效益。
優點:26B MoE 架構具備壓倒性的能效優勢,長期運行可節省大量電費並保持低溫靜音。
缺點:12B Dense 模型每瓦特產出的 Token 數極低(0.28 tok/s/W),能源效率較差。

4 款 Gemma 4 模型綜合效能對比
一張 Gemma 4 實測圖解答雙卡 32GB 玩家選型疑慮:Gemma-4 26B A4B MoE 架構速度高達 60.1–74.6 tok/s 且吃用 ~27 GB VRAM,是雙卡 5060 Ti 16GB 最能發揮高 CP 值與高智商運算的旗艦組合。
意義:在全顯存(NGL=99)及標準 1024 Context 下,綜合評比 4 款模型的「生成速度 (tok/s)」與「VRAM 佔用 (MB)」。
優點:直觀對比 MoE 與 Dense、UD 動態量化與 Q8_0 的性能落差;26B MoE 在速度與品質上取得完美平衡。
缺點:12B Dense 模型雖然僅佔用 13.7–14.8 GB VRAM(單卡即可跑),但生成速度僅 27–29 tok/s,不如雙卡算力。

雙卡硬體配置與 llama.cpp 參數最佳化指南
要在 Windows 11 環境下讓兩張 RTX 5060 Ti 16GB 發揮 100% 效能,硬體與軟體設定非常重要。首先,主機板必須支援 PCIe 拆分(例如 PCIe 4.0 x8 + x8 或 x8 + x4),避免第二張顯示卡運行於 PCIe 3.0 x2 等過度受限的頻寬下。此外,電源供應器建議準備 750W 以上,以確保雙卡長時間滿載運作時的供電穩定。
在 llama.cpp 必須精準設定多卡分流參數。使用 –tensor-split 或 -sm layer 將模型層均勻分配至 GPU 0 與 GPU 1。針對 Gemma 4 實測模型,建議開啟 Flash Attention (-fa) 以降低 KV 快取對 VRAM 的動態佔用,並設定 -ngl 99 將所有層完全卸載(Offload)至 GPU VRAM 中,徹底避免 CPU 拖慢整體推論速度。
- 主機板通道:確保雙 PCIe 插槽具備足夠頻寬(建議至少 PCIe 4.0 x4 以上)。
- 電源與供電:建議採用 750W 以上金牌電源,確保兩張 5060 Ti 穩壓運作。
- llama.cpp 參數:設定 -ngl 99 全顯存卸載,並啟用 Flash Attention (-fa) 最佳化。
- 多卡負載均衡:透過 -ts 1,1 將模型層按 50%:50% 平均分流至兩張顯示卡。
雙卡 RTX 5060 Ti 16GB 成功以極高 CP 值解鎖 32GB VRAM,搭配 Gemma 4 26B A4B MoE 模型與 Q8_K_XL 量化,能兼具高精度與實用速度,是目前個人搭建本地 AI 工作站的最佳平衡方案。
常見問題
Q1: 為什麼選擇兩張 RTX 5060 Ti 16GB 而不是單張高階顯卡?
A1: 兩張 RTX 5060 Ti 16GB 能提供總計 32GB 的大容量 VRAM,成本僅為頂級單卡的三分之一左右。對於需要大記憶體來運行 26B 或 32B 量化模型(如 Q8 精度)的本地 AI 使用者來說,這是 CP 值極高的配置方案。
Q2: 雙卡 RTX 5060 Ti 16GB 跑 Gemma 4 26B A4B 需要多少 VRAM?
A2: Gemma 4 26B A4B 在 Q8 精度(如 UD-Q8_K_XL)下,模型權重靜態佔用約 27 GB VRAM。雙卡提供的 32GB 總容量能在全載入模型後,留出約 4-5 GB 的 VRAM 作為上下文 KV 快取使用。
Q3: 什麼是 Gemma 4 26B A4B 的 MoE 架構?
A3: MoE(Mixture-of-Experts 混合專家)架構意味著雖然模型總參數為 26B,但生成每個 Token 時僅調動約 4B 的專家參數(A4B = Active 4 Billion)。這使其能在保持大模型知識量的同時,達到極高的推論速度。
Q4: Gemma 4 26B A4B (MoE) 與 12B (Dense) 哪一個推論速度更快?
A4: 在雙卡 RTX 5060 Ti 環境下,26B A4B MoE 模型速度更快。因為 26B A4B 每次僅計算 4B 激活參數,計算負擔遠小於每次都需要全量運算 12B 參數的 Dense 模型。
Q5: 什麼是 UD-Q8_K_XL 量化?與標準 Q8_0 有何不同?
A5: UD-Q8_K_XL 是 Unsloth 推出的動態量化技術,它針對模型的關鍵神經網路層進行精細保護,相比傳統全層統一量化的 Q8_0,能在相同 VRAM 佔用下提供更好的邏輯推理能力與文字生成品質。
Q6: 雙卡顯示卡跑 LLM 需要 SLI 或 NVLink 連接線嗎?
A6: 不需要。現代 LLM 推論框架(如 llama.cpp、Ollama、vLLM)直接支援透過 PCIe 匯流排進行跨卡資料傳輸與模型分流,完全不需要 NVLink 或 SLI 橋接器。
Q7: 搭建雙卡 RTX 5060 Ti 16GB 工作站需要多大的電源供應器?
A7: 單張 RTX 5060 Ti TDP 約為 160W,雙卡全載約 320W。考量到 CPU 與其他系統組件,建議使用 750W 以上、具備品質認證的電源供應器以確保長期穩定運作。
Q8: llama.cpp 如何設定才能將模型均勻分配到兩張 RTX 5060 Ti?
A8: 在啟動指令中加入 –tensor-split 1,1(或 -ts 1,1)及 -ngl 99,即可將模型神經網路層以 50%:50% 的比例平均卸載至 GPU 0 與 GPU 1 上。
雙卡 RTX 5060 Ti 16GB 解鎖 32GB VRAM,高 CP 值本地 AI 部署首選
雙卡 RTX 5060 Ti 16GB 以高 CP 值解鎖 32GB VRAM,突破本地 AI 瓶頸。本文中的 Gemma 4 實測數據,更能確定 26B MoE 生成速度遠超 12B 且極省電,是兼具高智商與流暢體驗首選!
運行 LLM 大模型需要頻繁讀取數十 GB 的 GGUF 檔案。為了避免載入模型時的漫長等待,建議將模型存放於 NVMe Gen5 SSD、RAID 或 微軟的 StorageSpace 中。這樣在切換不同量化版本或更換模型時,能將載入時間從分鐘級縮短至秒級,大幅提升開發效率。
📚 Local AI 本地部署 系列
← Local AI 本地部署指南:Ollama、AnythingLLM、Whisper