Cuda on Tarragon

GPU Compute Backend

Tue, 12 May 2026 00:00:00 +0000

GPU compute backend 的核心概念是「推論軟體（如 llama.cpp、PyTorch）跟 GPU 之間的計算 API 抽象層」。不同廠商 GPU 對應不同 backend、同一推論軟體通常要為每個 backend 編譯獨立 build。選對 backend 直接影響 GPU 算力能否被有效利用。

概念位置

各家 GPU 對應的常見 backend（2026 年 5 月狀態、依社群實踐變化）：

Backend	主要 GPU 廠商	平台支援	llama.cpp 生態成熟度
CUDA	NVIDIA	Windows / Linux	最成熟、社群預設
ROCm	AMD	Linux 主、Windows 演進中	中、依 GPU 型號變化
Vulkan	跨廠商通用	Windows / Linux	中、通用 fallback
Metal	Apple Silicon	macOS	成熟（屬模組一範圍）
SYCL	Intel ARC	Windows / Linux	相對年輕
DirectML	多廠商（DirectX）	Windows	較少用於 LLM
OpenVINO	Intel	多平台	偏 Intel 生態

選 backend 的判讀依硬體跟平台：NVIDIA GPU 用 CUDA、AMD on Linux 優先 ROCm、AMD on Windows 多用 Vulkan、Intel ARC 用 Vulkan 或 SYCL、Apple Silicon 用 Metal。

事實查核註：上表的「llama.cpp 生態成熟度」是社群常見回報、不是經本卡系統實測的 benchmark；各 backend 的支援度跟 throughput 依推論軟體版本快速演進、引用前以對應 backend 的官方文件跟 llama.cpp release notes 為準。

設計責任

理解 GPU compute backend 後可以解釋三個現象：為什麼下載 llama.cpp release 要選 CUDA / ROCm / Vulkan 版本（每個 build 對應一種 backend）、為什麼同樣硬體 throughput 差很多（backend 不對或 fallback 到 CPU）、為什麼非 NVIDIA GPU 跑 LLM 經驗較少（CUDA 生態太成熟、其他 backend 仍在演進）。

選 PC GPU 跑本地 LLM 時、backend 成熟度是「工具鏈支援度」軸、跟硬體規格軸獨立、選卡時兩軸都要考慮。詳見 5.6 GPU 廠商差異。

5.3 llama.cpp 在 PC 上

Tue, 12 May 2026 00:00:00 +0000

llama.cpp 是 PC 場景跑本地 LLM 的主流推論伺服器、也是 Ollama、LM Studio 的底層 backend。在 PC 上直接使用 llama.cpp 的場景跟 Mac 不同：PC 需要選對 GPU compute backend（CUDA / ROCm / Vulkan）、處理 driver 版本對齊、調 MoE 卸載與 KV cache 量化旗標、產出的是 OpenAI 相容 API。本章把這些 PC 場景特有的設定串成一條完整的調參工作流。

讀完本章後、你應該能在自己的 PC 上：選對 llama.cpp build、用 llama-server 跑 OpenAI 相容 API、用 llama-bench 校準 throughput、知道多卡跟非 NVIDIA GPU 的入門設定方向。

本章目標

知道怎麼取得對應自己 GPU 的 llama.cpp build（pre-built release vs 自編譯）。
看懂 PC 場景常用旗標的分組與互相關係。
用 llama-server 啟動 OpenAI 相容 server、接到 VS Code Continue.dev。
用 llama-bench 校準 prefill 跟 generation throughput。
認識多卡 tensor split 的入門設定。
知道 ROCm（AMD）跟 Vulkan backend 的相對成熟度。

取得 llama.cpp build

llama.cpp 在 PC 上的取得方式有三條：

路徑一：官方 pre-built release（社群常見起點）

ggml-org/llama.cpp 的 GitHub release 提供 Windows / Linux 的 pre-built binary、含 CUDA 12.x、ROCm、Vulkan、CPU-only 等多種 backend。下載對應自己 GPU + driver 版本的 build、解壓即用。模型權重檔通常為 GGUF 格式。

選 build 時的判讀：

GPU 廠商	建議 backend	備註
NVIDIA（RTX 系列）	CUDA 12.x build	最成熟、社群回報最多、需對應 NVIDIA driver 版本
AMD（RX 系列、Radeon Pro）	ROCm build（Linux）/ Vulkan build（Windows）	ROCm Windows 支援仍在演進、Vulkan 跨平台但 throughput 通常較 CUDA 低
Intel（ARC）	Vulkan build / SYCL build	工具鏈相對年輕、社群實測案例較少
Apple Silicon	Metal build（屬模組一範圍）	見 1.2 Mac 版 llama.cpp

事實查核註：各 backend 的成熟度跟支援度依 llama.cpp 版本快速演進、上表為 2026 年 5 月常見回報的相對情況、建議引用時以 llama.cpp release notes 跟對應 backend 的官方文件為準。

路徑二：自編譯（需要特定功能或最新 commit）

從原始碼編譯適合下面情境：

想用 release 還沒包進去的新功能（如剛 merge 的 PR）。
想針對特定 CUDA compute capability 編譯、減少 binary 大小或開特定優化。
自己 patch 過 llama.cpp。

CUDA build 的常見編譯指令（以 Linux 為例、Windows 請參考官方文件）：

1git clone https://github.com/ggml-org/llama.cpp.git
2cd llama.cpp
3cmake -B build -DGGML_CUDA=ON
4cmake --build build --config Release -j

編譯選項依版本變化、以 CMakeLists.txt 跟 build 文件為準。

路徑三：透過上層工具（Ollama / LM Studio）

如果你不需要直接面對 llama.cpp 旗標、用 Ollama 或 LM Studio 通常更省事。它們把 llama.cpp 包裝在背後、提供更高層的設定介面。Mac / Windows 都適用、見 5.4 LM Studio 在 Windows。

直接面對 llama.cpp 的價值：完整控制旗標、看 log 直接 debug、用 llama-bench 做精確校準。

核心旗標地圖

PC 場景常用的旗標可以分成五組：

1. GPU 層分配

旗標	作用
`-ngl`	把 N 層 transformer block 放 GPU。常設 99 或 max 表示能放盡量放
`--n-cpu-moe`	MoE 模型：把 N 層的專家權重保留 CPU 記憶體、見 5.1
`--split-mode`	多卡模式（`none` / `layer` / `row`）
`-ts`	tensor split、多卡時各卡的權重比例
`-mg`	主卡 index、特定計算（如 KV cache）放在主卡

2. KV cache 與 context

旗標	作用
`-c`	context window 大小
`--cache-type-k`	K cache 量化（f16 / q8_0 / q4_0 等）、見 5.2
`--cache-type-v`	V cache 量化
`-fa` / `--flash-attn`	啟用 flash attention、部分量化組合需要

3. 平行與 batch

旗標	作用
`--parallel`	同時處理的 sequence 數、高併發場景使用
`-b`	logical batch size
`-ub`	micro-batch size、影響 prefill 速度
`-np`	num parallel slots（部分版本旗標、依版本變動）

4. 模型與量化

旗標	作用
`-m`	GGUF 模型路徑
`--alias`	對外宣告的 model name（OpenAI 相容 API 用）
`--lora`	LoRA adapter 路徑

5. server 設定

旗標	作用
`--host`	bind 位址、預設 127.0.0.1
`--port`	port、預設 8080
`--api-key`	API key 驗證
`-v`	verbose log

完整旗標清單見 llama-server --help 跟 tools/server/README.md；版本更新後旗標可能新增、改名或棄用、以實際版本為準。

完整啟動範例

下面三個範例對應三種常見硬體配置、皆為起點配置、需依實測調整。

範例一：16GB VRAM + 64GB RAM、跑 30B MoE 寫 code

 1./llama-server \
 2  -m ~/models/Qwen3-30B-A3B-Q4_K_M.gguf \
 3  --alias qwen3-30b-a3b \
 4  -ngl 99 \
 5  --n-cpu-moe 30 \
 6  --cache-type-k q8_0 \
 7  --cache-type-v q4_0 \
 8  -fa \
 9  -c 32768 \
10  --parallel 1 \
11  --host 127.0.0.1 \
12  --port 8080

對應的 Continue.dev 設定：

 1{
 2  "models": [
 3    {
 4      "title": "Local llama.cpp",
 5      "provider": "openai",
 6      "model": "qwen3-30b-a3b",
 7      "apiBase": "http://localhost:8080/v1",
 8      "apiKey": "not-needed"
 9    }
10  ]
11}

範例二：24GB VRAM + 64GB RAM、跑 32B Dense

1./llama-server \
2  -m ~/models/Qwen3-32B-Q4_K_M.gguf \
3  -ngl 99 \
4  --cache-type-k q8_0 \
5  --cache-type-v q8_0 \
6  -fa \
7  -c 65536 \
8  --parallel 1 \
9  --port 8080

Dense 32B Q4_K_M 體積落在 16 ~ 20 GB 級、24GB VRAM 可全載；KV cache 保留較保守的 Q8 / Q8、context 開到 64K。

範例三：8GB VRAM + 32GB RAM、跑 7B 級 Dense

1./llama-server \
2  -m ~/models/Qwen3-7B-Q4_K_M.gguf \
3  -ngl 99 \
4  --cache-type-k q8_0 \
5  --cache-type-v q8_0 \
6  -fa \
7  -c 16384 \
8  --port 8080

7B Q4_K_M 體積約 4 ~ 5 GB、8GB VRAM 可全載 + 適中 KV cache。

用 llama-bench 校準

llama-bench 是 llama.cpp 附帶的 benchmark 工具、用來測量特定模型 + 旗標組合的 prefill 跟 generation throughput。

基本用法：

1./llama-bench \
2  -m ~/models/Qwen3-30B-A3B-Q4_K_M.gguf \
3  -ngl 99 \
4  --n-cpu-moe 30 \
5  --cache-type-k q8_0 \
6  --cache-type-v q4_0 \
7  -p 512 \
8  -n 128

-p：prefill 測試的 prompt 長度；-n：generation 測試的 token 數。

輸出會列出 prefill t/s 跟 generation t/s。建議：

記錄基準：用「平衡起點」旗標跑一次、記下 prefill 跟 generation t/s。
逐項調整：每次只動一個旗標（如 --n-cpu-moe 從 30 改 25、再改 35）、看 t/s 怎麼變。
校準目標：找到「VRAM 用量、context 上限、t/s」三者組合符合工作流需求的設定。

llama-bench 的結果是「fixed prompt / 固定生成長度」、跟「實際工作流的混合長度」有差距；建議再用實際工作流的代表性任務做最終驗證。

事實查核註：llama-bench 的輸出格式跟旗標名稱依 llama.cpp 版本變動、以實際 llama-bench --help 為準。

多卡 tensor split 入門

如果你有兩張或以上的 GPU、llama.cpp 支援把模型權重分散到多卡：

1./llama-server \
2  -m ~/models/Llama-4-Scout.gguf \
3  -ngl 99 \
4  --split-mode layer \
5  -ts 0.5,0.5 \
6  --port 8080

--split-mode layer：以層為單位切分、最常用
--split-mode row：以張量的 row 切分、用於 tensor parallel
-ts 0.5,0.5：兩張卡各分一半權重；若兩卡 VRAM 不同、可調比例（如 -ts 0.4,0.6）

多卡的實際吞吐縮放比依下面因素變化：

主機板 PCIe lane 配置：消費級主機板常見「一條 x16 + 一條 x4」、第二張卡的 PCIe 頻寬可能受限。
GPU 之間是否有 NVLink：消費級 RTX 系列普遍不支援 NVLink、卡間通訊走 PCIe、相對資料中心級配置慢。
split-mode 選擇：row 模式需要更高的卡間頻寬、layer 模式對 PCIe 頻寬要求較低。

社群常見回報：多卡縮放比通常低於線性、layer 模式對長 prompt 的 prefill 提升較明顯、generation 提升相對小。具體效益依工作流跟卡間頻寬、需用 llama-bench 校準。

對單人寫 code 場景、多卡的邊際效益通常不如「先升級單卡」或「先優化單卡配置」。

ROCm 與 Vulkan backend 的相對成熟度

llama.cpp 對非 CUDA backend 的支援度依社群回報有以下相對位置：

Backend	平台支援	社群成熟度	常見適用情境
CUDA	NVIDIA、Windows/Linux	最成熟、PR 與文件最多	預設選項
ROCm	AMD、Linux 為主	演進中、Windows 支援較新	AMD GPU on Linux
Vulkan	跨廠商	通用但 throughput 通常較 CUDA / ROCm 低	AMD on Windows、Intel ARC、跨平台 fallback
SYCL	Intel	新興、社群實測案例較少	Intel ARC
Metal	Apple Silicon	成熟（屬模組一範圍）	Mac、見 1.2

事實查核註：各 backend 的成熟度跟性能對比是社群常見回報、不是經本文系統實測。建議引用前查閱 llama.cpp 的 PR 列表、對應 backend 的官方文件、跟自己硬體的實際 benchmark。

選 backend 的判讀：

NVIDIA GPU：用 CUDA build、不需考慮其他。
AMD GPU on Linux：優先試 ROCm build；不穩或不支援的卡型則退回 Vulkan。
AMD GPU on Windows：ROCm on Windows 在演進、Vulkan 通常較穩。具體選擇以 llama.cpp release notes 跟自己硬體實測為準。
Intel ARC：Vulkan 或 SYCL backend；社群實測案例較少、預期需要較多自己摸索。

跟 Ollama / LM Studio 並存

llama.cpp server、Ollama、LM Studio 可以同時跑、用不同 port：

推論伺服器	預設 port
Ollama	11434
llama-server	8080
LM Studio	1234

Continue.dev 可以同時接：

 1{
 2  "models": [
 3    {
 4      "title": "Ollama default",
 5      "provider": "ollama",
 6      "model": "qwen3-30b-a3b",
 7      "apiBase": "http://localhost:11434"
 8    },
 9    {
10      "title": "llama.cpp custom",
11      "provider": "openai",
12      "model": "qwen3-30b-a3b",
13      "apiBase": "http://localhost:8080/v1",
14      "apiKey": "not-needed"
15    }
16  ]
17}

實務上、多數情況只需要一個推論伺服器；同時跑多個的場景是「比較同一模型在不同 backend / 旗標下的差異」、屬於調參階段、不是常態。

下一章：5.4 LM Studio 在 Windows、給「不想直接面對 CLI」的讀者另一條路。

5.6 GPU 廠商差異

Tue, 12 May 2026 00:00:00 +0000

選 GPU 跑本地 LLM 不只看 VRAM 容量與 memory bandwidth、工具鏈支援度同樣重要。NVIDIA / AMD / Intel 三家廠商在 llama.cpp 生態的位置不同、GPU compute backend 中 CUDA 之外的選項仍在演進。本章整理三家在 2026 年 5 月的相對位置、跟選卡時值得考慮的判讀軸；多卡互連的議題見 NVLink 跟 PCIe。本章不重複統一記憶體的 Mac 場景、改聚焦 PC 獨立 VRAM 的廠商工具鏈差異。

事實查核註：GPU 工具鏈的支援度依 driver 版本、llama.cpp release 與廠商策略快速演進、本章描述為 2026 年 5 月的社群常見回報、建議引用前查閱對應 backend 的官方文件、llama.cpp release notes 跟自己硬體的實測。

本章目標

知道 NVIDIA CUDA、AMD ROCm、Intel SYCL、跨平台 Vulkan 各自的成熟度。
認識「工具鏈支援度」相對「硬體規格」對本地 LLM 體驗的重要性。
在選卡時、能用「工具鏈 × 規格 × 預算」三軸做判讀。
認識常見的混合場景（雲端 + 本地）。

NVIDIA CUDA：當前生態預設

NVIDIA GPU + CUDA backend 是 2026 年本地 LLM 社群的事實預設。原因不是「規格最好」、而是「工具鏈最成熟」：

llama.cpp CUDA backend 開發最久、PR 跟 issue 數量最多：新功能（新量化、flash attention 改進、speculative decoding 等）通常先在 CUDA backend 落地。
driver 跟 CUDA toolkit 對齊明確：driver 版本對應 CUDA 版本的表清楚、出問題容易查。
社群實測案例多：Reddit、HuggingFace forum、GitHub issue 上、絕大多數 benchmark 跟調參討論基於 CUDA。
上層工具（Ollama、LM Studio）優先支援：新版本通常先 CUDA、再 Vulkan、再 ROCm。

社群常見回報的 NVIDIA 卡分級（依 VRAM 容量為主、寫 code 場景）：

等級	代表卡型	適用情境
入門	RTX 5060 8GB / RTX 4060 8GB	試水溫、跑 7B 級模型
主流（甜蜜點）	RTX 5060 Ti 16GB / RTX 5070 Ti 16GB	30B MoE 卸載、寫 code 場景社群常見起點
進階	RTX 4090 24GB / RTX 5080 16GB	32B Dense 全載 / 70B MoE 卸載
旗艦	RTX 5090 32GB	70B Dense Q4 全載、長 context、多模型併存
上一代二手	RTX 3090 24GB	二手市場價格可能更友善、CUDA 支援度仍佳

選卡時的常見軸：

VRAM 容量決定模型上限：16GB 起步可跑 30B MoE 卸載、24GB 跑 32B Dense、32GB 跑 70B Dense。
VRAM 頻寬決定生字速度上限：同 VRAM 容量下、頻寬接近兩倍的卡（如 5070 Ti 對 5060 Ti）生字速度通常顯著差。
CUDA compute capability：影響某些優化能否啟用、新世代卡通常有額外指令支援。
driver 長期支援：較新世代卡的 driver 支援週期通常較長、適合長時間用。

AMD ROCm 與 Radeon

AMD GPU 在 llama.cpp 生態的位置：ROCm backend 在演進、Vulkan backend 是跨平台 fallback。

ROCm backend

ROCm（Radeon Open Compute）是 AMD 的 GPU 計算平台、定位類似 CUDA。社群常見回報的當前狀態：

Linux 支援度較 Windows 成熟：ROCm 在 Linux 上發展時間較長、Windows 版本相對年輕。
支援 GPU 清單：ROCm 對「官方支援」的 GPU 清單有明確限制、清單外的卡也許能跑、但走 unsupported 路徑。
llama.cpp ROCm build 跟 CUDA build 的功能差異：多數核心功能跨 backend 一致、新功能 cherry-pick 速度通常稍慢於 CUDA。
效能對比：同價格段、AMD 卡的 VRAM 容量有時較大；但生字速度依模型跟設定變化、社群回報的 NVIDIA / AMD 對比結果不一致、需自己硬體實測。

Vulkan backend

Vulkan 是跨平台 GPU API、llama.cpp 的 Vulkan backend 適合：

AMD GPU on Windows：ROCm Windows 不穩或不支援時的選項。
Intel ARC：見下節。
跨平台 fallback：希望同一份 binary 跑在多種 GPU 上。

社群常見回報：Vulkan backend 的 throughput 通常較同硬體的 CUDA / ROCm backend 低、但通用性高。

選 AMD 卡的判讀

情境	建議
Linux 主力使用者、想避開 NVIDIA driver	AMD + ROCm on Linux 是合理選擇、先確認卡型在 ROCm 支援清單
Windows 主力使用者	NVIDIA + CUDA 仍是社群預設較順的路徑
同價格段、AMD VRAM 容量明顯較大	評估「容量優勢 vs 工具鏈成本」、用自己工作流校準
已有 AMD 卡、想試本地 LLM	直接試 Vulkan / ROCm backend、看是否符合需求

Intel ARC

Intel 的獨立 GPU 系列 ARC（A 系列、後續預期 B 系列）在 llama.cpp 生態仍處於相對年輕的階段：

可用 backend：Vulkan（通用）、SYCL / OpenVINO（Intel 特化）。
VRAM 容量：ARC A770 16GB 的 VRAM 容量在價格段內競爭力較強。
工具鏈成熟度：社群實測案例較 NVIDIA / AMD 少、預期需要較多自己摸索。
driver 演進：Intel ARC driver 在 2026 年仍持續演進、不同版本的 throughput 可能差異較大。

選 Intel ARC 的合理情境：

想試「相對冷門但價格友善」的選項。
已有 Intel 平台、想保持廠商一致。
不介意花時間自己調工具鏈設定。

對「想最快跑起來、最少調參」的使用者、ARC 不是最順的選擇。

工具鏈 × 規格 × 預算的判讀框架

選卡時的三軸框架：

1工具鏈支援度（CUDA > ROCm > Vulkan > SYCL）
2  ×
3硬體規格（VRAM 容量 + VRAM 頻寬 + CUDA core / CU 數量）
4  ×
5預算（含後續電費、機殼散熱、電源升級）

判讀順序：

先確認工具鏈支援度符合自己的折騰意願：怕折騰選 NVIDIA、樂於折騰可考慮 AMD / Intel。
再依預算選 VRAM 容量級別：16GB 起步、24GB 進階、32GB 旗艦。
同容量下選頻寬較高的卡：對生字速度影響直接。
預留升級空間：機殼散熱、電源、PCIe lane 配置會影響後續多卡或換卡的選擇。

雲端 + 本地的混合場景

本地 LLM 不必獨自解決所有任務、雲端 + 本地的混合是社群多數使用者的實際做法：

任務類型	適合本地	適合雲端
補完、行內編輯（高頻、短回答）	本地反應快、不消耗 API quota	雲端 latency 較高、成本累積
跨檔案重構、設計討論	視本地模型能力	旗艦模型（Claude、GPT-5）能力較強
隱私敏感內容、未公開 codebase	本地 prompt 不離開機器	視服務的資料政策
試新 prompt、調 prompt 工程	本地快速迭代、無 quota 壓力	雲端做最終驗證
一次性 / 偶爾的複雜任務	投資本地硬體可能不划算	雲端按使用量付費較划算

社群常見的混合做法：本地跑 30B 級 MoE 處理日常補完、跨檔案重構或設計討論切到雲端旗艦。Continue.dev 等工具支援同時設定多個 model、可以快速切換、見 1.3 VS Code + Continue.dev 整合。

給讀者的選卡判讀

整合本章與 5.0 VRAM + RAM 分層預算的建議：

NVIDIA 是當前社群預設：怕折騰、想最大化「跑得起來」概率、選 NVIDIA。
VRAM 16GB 是常見起點：16GB VRAM + 64GB RAM 配 30B MoE 卸載、是 2026 年寫 code 場景的常見配置。
頻寬比容量更影響日常體感：同容量下、頻寬接近兩倍的卡（如 5070 Ti 對 5060 Ti）日常生字速度差異明顯。
二手卡也是選項：RTX 3090 24GB 二手市場價格依在地市場變化、CUDA 支援度仍佳、適合預算敏感但想要 24GB VRAM 的使用者。
多卡不是優先升級方向：單人寫 code 場景下、單卡 + 良好設定通常勝過雙卡入門配置。

下一步

本章是模組五的最後一章。下一步可以回到模組五 _index 看其他章節、或進入模組四應用層原理看 LLM 作為系統元件的設計取捨。