本地几个 GGUF 模型的 llama-server 启动命令记录。可执行文件统一是 D:\code\AI\llama.cpp\llama-server.exe。
一、速查表
| 模型 | 量化 | 别名 | 端口 | 上下文 | 监听 | 说明 |
|---|---|---|---|---|---|---|
| Qwen3.5-9B | Q8_0 | qwen3.5-9b | 8083 | 131072 | 本机 | 长上下文 |
| Qwen3-14B-abliterated | Q4_K_M | qwen3-14b-abliterated | 20000 | 98304 | 局域网 | abliterated 版 |
| Hermes-4-14B | Q4_K_M | hermes-4-14b | 8082 | 65536 | 本机 | 通用对话 |
| Qwen3-VL-4B-Instruct | Q4_K_M | qwen3-vl-4b | 8084 | 32768 | 本机 | 多模态,需 mmproj |
| Qwen3.8-27B-Ridge | 3.7bpw | qwen3.8-27b | 20000 | 131072 | 本机 | 3.7bpw 低比特 |
| Qwen3.8-27B-GSQ-RCO | IQ3_XXS | qwen3.8-27b-gsq-rco | 8081 / 20000 | 65536 起 | 局域网 | 另有 MTP 版 |
| Ornith-1.5-35B-A3B | Q4_K / IQ4_XS | ornith-1.5-35b-a3b | 20000 | 98304 / 131072 | 局域网 | MoE,有 mmproj |
二、模型启动命令
Qwen3.5-9B
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.5-9B\gguf\Qwen_Qwen3.5-9B-Q8_0.gguf" -ngl 99 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --host 127.0.0.1 --port 8083 --alias qwen3.5-9b |
-m:模型文件路径-ngl 99:放到 GPU 的层数,99 即全部上 GPU-c 131072:上下文长度 131072-np 1:并行请求槽位 1,单会话独占-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带的 chat template--host 127.0.0.1:仅本机可访问--port 8083:监听端口--alias qwen3.5-9b:接口里显示的模型名
Qwen3-14B-abliterated
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3-14B-abliterated\Qwen3-14B-abliterated.Q4_K_M.gguf" -ngl 99 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3-14b-abliterated |
-m:模型文件路径-ngl 99:全部层放 GPU-c 98304:上下文长度 98304-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3-14b-abliterated:接口模型名
Hermes-4-14B
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Hermes-4-14B\NousResearch_Hermes-4-14B-Q4_K_M.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 127.0.0.1 --port 8082 --alias hermes-4-14b |
-m:模型文件路径-ngl 99:全部层放 GPU-c 65536:上下文长度 65536-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 127.0.0.1:仅本机可访问--port 8082:监听端口--alias hermes-4-14b:接口模型名
Qwen3-VL-4B-Instruct
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3-VL-4B-Instruct\Qwen3VL-4B-Instruct-Q4_K_M.gguf" --mmproj "D:\code\AI\models\Qwen3-VL-4B-Instruct\mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf" -ngl 99 -c 32768 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --host 127.0.0.1 --port 8084 --alias qwen3-vl-4b |
-m:模型文件路径--mmproj:多模态投影文件,视觉输入需要-ngl 99:全部层放 GPU-c 32768:上下文长度 32768-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--host 127.0.0.1:仅本机可访问--port 8084:监听端口--alias qwen3-vl-4b:接口模型名
Qwen3.8-27B-Ridge
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-Ridge\Qwen3.8-27B-Ridge-3.7bpw.gguf" -ngl 99 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --host 127.0.0.1 --port 20000 --alias qwen3.8-27b |
-m:模型文件路径-ngl 99:全部层放 GPU-c 131072:上下文长度 131072-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--host 127.0.0.1:仅本机可访问--port 20000:监听端口--alias qwen3.8-27b:接口模型名
Qwen3.8-27B-GSQ-RCO
基础版:
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 8081 --alias qwen3.8-27b-gsq-rco |
-m:模型文件路径-ngl 99:全部层放 GPU-c 65536:上下文长度 65536-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 0.0.0.0:局域网内可访问--port 8081:监听端口--alias qwen3.8-27b-gsq-rco:接口模型名
MTP 版:
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 98304:上下文长度 98304-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--spec-type draft-mtp:启用 MTP 投机解码--spec-draft-n-max 2:每轮最多预测 2 个 token--spec-draft-p-min 0.8:投机草稿接受概率下限 0.8--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 65536:上下文长度 65536-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 49152 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 49152:上下文长度 49152-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--spec-type draft-mtp:启用 MTP 投机解码--spec-draft-n-max 2:每轮最多预测 2 个 token--spec-draft-p-min 0.8:投机草稿接受概率下限 0.8--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 73728:上下文长度 73728-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--spec-type draft-mtp:启用 MTP 投机解码--spec-draft-n-max 2:每轮最多预测 2 个 token--spec-draft-p-min 0.8:投机草稿接受概率下限 0.8--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 --cache-prompt --cache-reuse 256 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 73728:上下文长度 73728-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度-b 2048、-ub 512:批大小与子批大小--cache-prompt:缓存提示词--cache-reuse 256:复用缓存,最少 256 个 token--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--spec-type draft-mtp:启用 MTP 投机解码--spec-draft-n-max 2:每轮最多预测 2 个 token--spec-draft-p-min 0.8:投机草稿接受概率下限 0.8--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 73728:上下文长度 73728-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 256 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp |
-m:模型文件路径(-mtp 后缀)-ngl 99:全部层放 GPU-c 73728:上下文长度 73728-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度-b 2048、-ub 256:批大小与子批大小--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--spec-type draft-mtp:启用 MTP 投机解码--spec-draft-n-max 2:每轮最多预测 2 个 token--spec-draft-p-min 0.8:投机草稿接受概率下限 0.8--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias qwen3.8-27b-gsq-rco-mtp:接口模型名
Ornith-1.5-35B-A3B
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" -ngl 99 --n-cpu-moe 20 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b |
-m:模型文件路径-ngl 99:全部层放 GPU--n-cpu-moe 20:20 层专家权重放 CPU-c 131072:上下文长度 131072-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias ornith-1.5-35b-a3b:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" -ngl 99 --n-cpu-moe 16 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b --reasoning-off |
-m:模型文件路径-ngl 99:全部层放 GPU--n-cpu-moe 16:16 层专家权重放 CPU-c 98304:上下文长度 98304-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--reasoning-off:关闭思考过程输出--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias ornith-1.5-35b-a3b:接口模型名
1 | D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" --mmproj "D:\code\AI\models\Ornith-1.5-35B-A3B\mmproj-Ornith-1.5-35B-BF16.gguf" -ngl 99 --n-cpu-moe 20 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --image-min-tokens 1024 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b |
-m:模型文件路径--mmproj:多模态投影文件,视觉输入需要-ngl 99:全部层放 GPU--n-cpu-moe 20:20 层专家权重放 CPU-c 98304:上下文长度 98304-np 1:单会话-fa on:开启 Flash Attention-ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度--jinja:使用模型自带 chat template--temp 0.6、--top-p 0.95、--top-k 20:采样参数--image-min-tokens 1024:单张图片最少占 1024 个 token--host 0.0.0.0:局域网内可访问--port 20000:监听端口--alias ornith-1.5-35b-a3b:接口模型名
三、ComfyUI
1 | cd D:\code\AI\ComfyUI |
cd D:\code\AI\ComfyUI:切到 ComfyUI 目录TORCHINDUCTOR_CACHE_DIR:TorchInductor 的编译缓存目录.\.venv\Scripts\python.exe:用项目内的虚拟环境解释器--listen 127.0.0.1:仅本机可访问--port 8188:监听端口
四、模型下载
1 | $env:HF_ENDPOINT="https://hf-mirror.com"; $env:HF_HUB_DOWNLOAD_TIMEOUT="300"; uvx --from huggingface_hub hf download Qwen/Qwen3-VL-4B-Instruct-GGUF Qwen3VL-4B-Instruct-Q4_K_M.gguf mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf --local-dir "D:\code\AI\models\Qwen3-VL-4B-Instruct" |
HF_ENDPOINT:改用 hf-mirror 镜像HF_HUB_DOWNLOAD_TIMEOUT:下载超时设为 300 秒uvx --from huggingface_hub:临时环境运行 hf 命令hf download后面跟仓库名与要下的文件名--local-dir:保存目录
1 | $env:HF_ENDPOINT="https://hf-mirror.com"; $env:HF_HUB_DOWNLOAD_TIMEOUT="300"; uvx --from huggingface_hub hf download ISTA-DASLab/Qwen3.8-27B-3Bit-GSQ --local-dir "D:\code\AI\models\Qwen3.8-27B-3Bit-GSQ" |
HF_ENDPOINT:改用 hf-mirror 镜像HF_HUB_DOWNLOAD_TIMEOUT:下载超时设为 300 秒uvx --from huggingface_hub:临时环境运行 hf 命令hf download后面跟仓库名,整仓下载--local-dir:保存目录