llama.cpp 启动命令速查

本地几个 GGUF 模型的 llama-server 启动命令记录。可执行文件统一是 D:\code\AI\llama.cpp\llama-server.exe。

一、速查表

模型 量化 别名 端口 上下文 监听 说明
Qwen3.5-9B Q8_0 qwen3.5-9b 8083 131072 本机 长上下文
Qwen3-14B-abliterated Q4_K_M qwen3-14b-abliterated 20000 98304 局域网 abliterated 版
Hermes-4-14B Q4_K_M hermes-4-14b 8082 65536 本机 通用对话
Qwen3-VL-4B-Instruct Q4_K_M qwen3-vl-4b 8084 32768 本机 多模态,需 mmproj
Qwen3.8-27B-Ridge 3.7bpw qwen3.8-27b 20000 131072 本机 3.7bpw 低比特
Qwen3.8-27B-GSQ-RCO IQ3_XXS qwen3.8-27b-gsq-rco 8081 / 20000 65536 起 局域网 另有 MTP 版
Ornith-1.5-35B-A3B Q4_K / IQ4_XS ornith-1.5-35b-a3b 20000 98304 / 131072 局域网 MoE,有 mmproj

二、模型启动命令

Qwen3.5-9B

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.5-9B\gguf\Qwen_Qwen3.5-9B-Q8_0.gguf" -ngl 99 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --host 127.0.0.1 --port 8083 --alias qwen3.5-9b
  • -m:模型文件路径
  • -ngl 99:放到 GPU 的层数,99 即全部上 GPU
  • -c 131072:上下文长度 131072
  • -np 1:并行请求槽位 1,单会话独占
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带的 chat template
  • --host 127.0.0.1:仅本机可访问
  • --port 8083:监听端口
  • --alias qwen3.5-9b:接口里显示的模型名

Qwen3-14B-abliterated

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3-14B-abliterated\Qwen3-14B-abliterated.Q4_K_M.gguf" -ngl 99 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3-14b-abliterated
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • -c 98304:上下文长度 98304
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3-14b-abliterated:接口模型名

Hermes-4-14B

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Hermes-4-14B\NousResearch_Hermes-4-14B-Q4_K_M.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 127.0.0.1 --port 8082 --alias hermes-4-14b
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • -c 65536:上下文长度 65536
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 127.0.0.1:仅本机可访问
  • --port 8082:监听端口
  • --alias hermes-4-14b:接口模型名

Qwen3-VL-4B-Instruct

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3-VL-4B-Instruct\Qwen3VL-4B-Instruct-Q4_K_M.gguf" --mmproj "D:\code\AI\models\Qwen3-VL-4B-Instruct\mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf" -ngl 99 -c 32768 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --host 127.0.0.1 --port 8084 --alias qwen3-vl-4b
  • -m:模型文件路径
  • --mmproj:多模态投影文件,视觉输入需要
  • -ngl 99:全部层放 GPU
  • -c 32768:上下文长度 32768
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --host 127.0.0.1:仅本机可访问
  • --port 8084:监听端口
  • --alias qwen3-vl-4b:接口模型名

Qwen3.8-27B-Ridge

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-Ridge\Qwen3.8-27B-Ridge-3.7bpw.gguf" -ngl 99 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --host 127.0.0.1 --port 20000 --alias qwen3.8-27b
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • -c 131072:上下文长度 131072
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --host 127.0.0.1:仅本机可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b:接口模型名

Qwen3.8-27B-GSQ-RCO

基础版:

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 8081 --alias qwen3.8-27b-gsq-rco
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • -c 65536:上下文长度 65536
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 0.0.0.0:局域网内可访问
  • --port 8081:监听端口
  • --alias qwen3.8-27b-gsq-rco:接口模型名

MTP 版:

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 98304:上下文长度 98304
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --spec-type draft-mtp:启用 MTP 投机解码
  • --spec-draft-n-max 2:每轮最多预测 2 个 token
  • --spec-draft-p-min 0.8:投机草稿接受概率下限 0.8
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 65536 -np 1 -fa on -ctk q8_0 -ctv q4_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 65536:上下文长度 65536
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q4_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 49152 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 49152:上下文长度 49152
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --spec-type draft-mtp:启用 MTP 投机解码
  • --spec-draft-n-max 2:每轮最多预测 2 个 token
  • --spec-draft-p-min 0.8:投机草稿接受概率下限 0.8
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 73728:上下文长度 73728
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --spec-type draft-mtp:启用 MTP 投机解码
  • --spec-draft-n-max 2:每轮最多预测 2 个 token
  • --spec-draft-p-min 0.8:投机草稿接受概率下限 0.8
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 --cache-prompt --cache-reuse 256 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 73728:上下文长度 73728
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • -b 2048、-ub 512:批大小与子批大小
  • --cache-prompt:缓存提示词
  • --cache-reuse 256:复用缓存,最少 256 个 token
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --spec-type draft-mtp:启用 MTP 投机解码
  • --spec-draft-n-max 2:每轮最多预测 2 个 token
  • --spec-draft-p-min 0.8:投机草稿接受概率下限 0.8
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco-mtp:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 73728:上下文长度 73728
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Qwen3.8-27B-GSQ-RCO\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf" -ngl 99 -c 73728 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 256 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.8 --host 0.0.0.0 --port 20000 --alias qwen3.8-27b-gsq-rco-mtp
  • -m:模型文件路径(-mtp 后缀)
  • -ngl 99:全部层放 GPU
  • -c 73728:上下文长度 73728
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • -b 2048、-ub 256:批大小与子批大小
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --spec-type draft-mtp:启用 MTP 投机解码
  • --spec-draft-n-max 2:每轮最多预测 2 个 token
  • --spec-draft-p-min 0.8:投机草稿接受概率下限 0.8
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias qwen3.8-27b-gsq-rco-mtp:接口模型名

Ornith-1.5-35B-A3B

1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" -ngl 99 --n-cpu-moe 20 -c 131072 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • --n-cpu-moe 20:20 层专家权重放 CPU
  • -c 131072:上下文长度 131072
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias ornith-1.5-35b-a3b:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" -ngl 99 --n-cpu-moe 16 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b --reasoning-off
  • -m:模型文件路径
  • -ngl 99:全部层放 GPU
  • --n-cpu-moe 16:16 层专家权重放 CPU
  • -c 98304:上下文长度 98304
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --reasoning-off:关闭思考过程输出
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias ornith-1.5-35b-a3b:接口模型名
1
D:\code\AI\llama.cpp\llama-server.exe -m "D:\code\AI\models\Ornith-1.5-35B-A3B\Ornith-1.5-35B-A3B-AD-Q4_K-IQ4_XS.gguf" --mmproj "D:\code\AI\models\Ornith-1.5-35B-A3B\mmproj-Ornith-1.5-35B-BF16.gguf" -ngl 99 --n-cpu-moe 20 -c 98304 -np 1 -fa on -ctk q8_0 -ctv q8_0 --jinja --temp 0.6 --top-p 0.95 --top-k 20 --image-min-tokens 1024 --host 0.0.0.0 --port 20000 --alias ornith-1.5-35b-a3b
  • -m:模型文件路径
  • --mmproj:多模态投影文件,视觉输入需要
  • -ngl 99:全部层放 GPU
  • --n-cpu-moe 20:20 层专家权重放 CPU
  • -c 98304:上下文长度 98304
  • -np 1:单会话
  • -fa on:开启 Flash Attention
  • -ctk q8_0、-ctv q8_0:KV Cache 的 K、V 量化精度
  • --jinja:使用模型自带 chat template
  • --temp 0.6、--top-p 0.95、--top-k 20:采样参数
  • --image-min-tokens 1024:单张图片最少占 1024 个 token
  • --host 0.0.0.0:局域网内可访问
  • --port 20000:监听端口
  • --alias ornith-1.5-35b-a3b:接口模型名

三、ComfyUI

1
2
3
cd D:\code\AI\ComfyUI
$env:TORCHINDUCTOR_CACHE_DIR="D:\code\AI\ComfyUI\.torchinductor-cache"
.\.venv\Scripts\python.exe .\main.py --listen 127.0.0.1 --port 8188
  • cd D:\code\AI\ComfyUI:切到 ComfyUI 目录
  • TORCHINDUCTOR_CACHE_DIR:TorchInductor 的编译缓存目录
  • .\.venv\Scripts\python.exe:用项目内的虚拟环境解释器
  • --listen 127.0.0.1:仅本机可访问
  • --port 8188:监听端口

四、模型下载

1
$env:HF_ENDPOINT="https://hf-mirror.com"; $env:HF_HUB_DOWNLOAD_TIMEOUT="300"; uvx --from huggingface_hub hf download Qwen/Qwen3-VL-4B-Instruct-GGUF Qwen3VL-4B-Instruct-Q4_K_M.gguf mmproj-Qwen3VL-4B-Instruct-Q8_0.gguf --local-dir "D:\code\AI\models\Qwen3-VL-4B-Instruct"
  • HF_ENDPOINT:改用 hf-mirror 镜像
  • HF_HUB_DOWNLOAD_TIMEOUT:下载超时设为 300 秒
  • uvx --from huggingface_hub:临时环境运行 hf 命令
  • hf download 后面跟仓库名与要下的文件名
  • --local-dir:保存目录
1
$env:HF_ENDPOINT="https://hf-mirror.com"; $env:HF_HUB_DOWNLOAD_TIMEOUT="300"; uvx --from huggingface_hub hf download ISTA-DASLab/Qwen3.8-27B-3Bit-GSQ --local-dir "D:\code\AI\models\Qwen3.8-27B-3Bit-GSQ"
  • HF_ENDPOINT:改用 hf-mirror 镜像
  • HF_HUB_DOWNLOAD_TIMEOUT:下载超时设为 300 秒
  • uvx --from huggingface_hub:临时环境运行 hf 命令
  • hf download 后面跟仓库名,整仓下载
  • --local-dir:保存目录