llama.cpp 参数完整中文翻译

llama.cpp 参数完整中文翻译

注:文后附llama.cpp环境变量编辑器及源码
通用参数 common params

-h, --help, --usage

打印使用帮助并退出程序

--version

输出程序版本与编译构建信息

-cl, --cache-list

列出本地缓存中已下载的模型

--completion-bash

输出可直接导入的 Bash 自动补全脚本

-t, --threads N

文本生成阶段使用的 CPU 线程数(默认:-1)

环境变量:LLAMA_ARG_THREADS

-tb, --threads-batch N

批量处理、提示词预处理阶段使用的线程数(默认与 --threads 一致)

-C, --cpu-mask M

CPU 亲和掩码:任意长度十六进制字符串,与 cpu-range 配合使用(默认空)

-Cr, --cpu-range lo-hi

绑定使用的 CPU 核心区间,与 --cpu-mask 配合使用

--cpu-strict <0|1>

开启严格 CPU 核心绑定(默认:0 关闭)

--prio N

设置进程 / 线程优先级:-1 低、0 普通、1 中等、2 高、3 实时(默认:0)

--poll <0...100>

工作轮询等待等级;0 = 不启用轮询(默认:50)

-Cb, --cpu-mask-batch M

批量任务专用 CPU 亲和掩码,配合 cpu-range-batch(默认同 --cpu-mask

-Crb, --cpu-range-batch lo-hi

批量任务绑定的 CPU 核心区间,配合 --cpu-mask-batch

--cpu-strict-batch <0|1>

批量任务启用严格 CPU 绑定(默认同 --cpu-strict

--prio-batch N

批量任务线程优先级:0 普通、1 中等、2 高、3 实时(默认:0)

--poll-batch <0|1>

批量任务启用工作轮询等待(默认同 --poll

-c, --ctx-size N

上下文窗口大小(默认:0,0 表示从模型配置读取)

环境变量:LLAMA_ARG_CTX_SIZE

-n, --predict, --n-predict N

最大生成 token 数量(默认:-1,-1 代表无限生成)

环境变量:LLAMA_ARG_N_PREDICT

-b, --batch-size N

逻辑最大批量尺寸(默认:2048)

环境变量:LLAMA_ARG_BATCH

-ub, --ubatch-size N

物理最大微批量尺寸(默认:512)

环境变量:LLAMA_ARG_UBATCH

--keep N

保留原始提示词前 N 个 token 不被上下文滑动丢弃(默认:0;-1 = 全部保留)

--swa-full

启用完整尺寸 SWA 缓存(默认:false)

参考文档:https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055

环境变量:LLAMA_ARG_SWA_FULL

-fa, --flash-attn [on|off|auto]

FlashAttention 开关:on 开启 /off 关闭 /auto 自动(默认 auto)

环境变量:LLAMA_ARG_FLASH_ATTN

--perf, --no-perf

开启内置性能计时打点(默认关闭)

环境变量:LLAMA_ARG_PERF

-e, --escape, --no-escape

解析转义字符(\n \r \t ‘ ” \)(默认开启)

--rope-scaling {none,linear,yarn}

RoPE 频率缩放方案;未指定时模型内置配置优先,默认 linear

环境变量:LLAMA_ARG_ROPE_SCALING_TYPE

--rope-scale N

RoPE 上下文缩放系数,上下文窗口扩大 N 倍

环境变量:LLAMA_ARG_ROPE_SCALE

--rope-freq-base N

RoPE 基础频率,用于 NTK 缩放(默认从模型读取)

环境变量:LLAMA_ARG_ROPE_FREQ_BASE

--rope-freq-scale N

RoPE 频率缩放系数,上下文窗口缩小至 1/N

环境变量:LLAMA_ARG_ROPE_FREQ_SCALE

--yarn-orig-ctx N

YaRN 缩放:模型原生训练上下文长度(默认 0,自动读取模型训练窗口)

环境变量:LLAMA_ARG_YARN_ORIG_CTX

--yarn-ext-factor N

YaRN:外推混合系数(默认 – 1.0;0.0 = 纯插值)

环境变量:LLAMA_ARG_YARN_EXT_FACTOR

--yarn-attn-factor N

YaRN:注意力幅值 /sqrt (t) 缩放系数(默认 – 1.0)

环境变量:LLAMA_ARG_YARN_ATTN_FACTOR

--yarn-beta-slow N

YaRN:高维修正系数 alpha(默认 – 1.0)

环境变量:LLAMA_ARG_YARN_BETA_SLOW

--yarn-beta-fast N

YaRN:低维修正系数 beta(默认 – 1.0)

环境变量:LLAMA_ARG_YARN_BETA_FAST

-kvo, --kv-offload / -nkvo, --no-kv-offload

KV 缓存硬件卸载开关(默认开启)

环境变量:LLAMA_ARG_KV_OFFLOAD

--repack / -nr, --no-repack

权重重打包优化开关(默认开启)

环境变量:LLAMA_ARG_REPACK

--no-host

绕过主机内存缓冲区,启用额外设备缓冲区

环境变量:LLAMA_ARG_NO_HOST

-ctk, --cache-type-k TYPE

KV 缓存 K 张量数据类型

可选值:f32、f16、bf16、q8_0、q4_0、q4_1、iq4_nl、q5_0、q5_1(默认 f16)

环境变量:LLAMA_ARG_CACHE_TYPE_K

-ctv, --cache-type-v TYPE

KV 缓存 V 张量数据类型,可选值同上(默认 f16)

环境变量:LLAMA_ARG_CACHE_TYPE_V

-dt, --defrag-thold N

KV 缓存碎片整理阈值(已弃用)

环境变量:LLAMA_ARG_DEFRAG_THOLD

--rpc SERVERS

RPC 分布式节点地址列表,多节点逗号分隔 格式:主机:端口

环境变量:LLAMA_ARG_RPC

--mlock

已弃用,推荐使用 --load-mode;强制系统将模型锁定在内存,禁止交换压缩

环境变量:LLAMA_ARG_MLOCK

--mmap, --no-mmap

已弃用,推荐 --load-mode;是否使用内存映射加载模型;关闭时加载更慢,但不锁定内存可减少页面置换

环境变量:LLAMA_ARG_MMAP

-dio, --direct-io / -ndio, --no-direct-io

已弃用,推荐 --load-mode;可用时启用 DirectIO 直读

环境变量:LLAMA_ARG_DIO

-lm, --load-mode MODE

模型加载模式(默认 mmap)

  • none:无特殊加载策略
  • mmap:内存映射加载
  • mlock:锁定模型至物理内存,禁止交换
  • mmap+mlock:映射 + 内存锁定组合
  • dio:直读 IO 模式(硬件支持时生效)

    环境变量:LLAMA_ARG_LOAD_MODE

--numa TYPE

多 NUMA 节点优化策略

  • distribute:任务均匀分发至所有 NUMA 节点
  • isolate:仅在启动进程的 NUMA 节点创建线程
  • numactl:读取系统 numactl 配置绑定 CPU

    首次使用建议清空系统页缓存

    参考:https://github.com/ggml-org/llama.cpp/issues/1437

    环境变量:LLAMA_ARG_NUMA

-dev, --device <dev1,dev2,..>

用于模型卸载的硬件设备列表,逗号分隔;none = 不卸载

使用 --list-devices 查看可用硬件

环境变量:LLAMA_ARG_DEVICE

--list-devices

打印本机可用加速设备列表并退出

-ot, --override-tensor <张量匹配规则>=<缓存类型>,...

强制指定特定张量使用的缓冲区类型

环境变量:LLAMA_ARG_OVERRIDE_TENSOR

-cmoe, --cpu-moe

所有 MoE 专家层权重保留在 CPU 内存

环境变量:LLAMA_ARG_CPU_MOE

-ncmoe, --n-cpu-moe N

前 N 层 MoE 专家权重保留在 CPU 内存

环境变量:LLAMA_ARG_N_CPU_MOE

-ngl, --gpu-layers, --n-gpu-layers N

加载至显存的模型最大层数;支持数字 /auto/all(默认 auto)

环境变量:LLAMA_ARG_N_GPU_LAYERS

-sm, --split-mode {none,layer,row,tensor}

多 GPU 模型拆分策略

  • none:仅单卡运行
  • layer(默认):层流水线拆分,KV 缓存随层分配
  • row:权重按行并行拆分
  • tensor:完整张量并行拆分(实验性功能)

    环境变量:LLAMA_ARG_SPLIT_MODE

-ts, --tensor-split N0,N1,N2,...

多卡权重分配比例,逗号分隔数字,例 3,1

环境变量:LLAMA_ARG_TENSOR_SPLIT

-mg, --main-gpu INDEX

主 GPU 编号:split-mode=none 时全局主卡;split-mode=row 时存放中间计算与 KV 缓存(默认 0)

环境变量:LLAMA_ARG_MAIN_GPU

-fit, --fit [on|off]

自动调整未指定参数,适配设备显存容量(默认 on)

环境变量:LLAMA_ARG_FIT

-fitt, --fit-target MiB0,MiB1,MiB2,...

自动适配功能为每张设备预留显存余量(单位 MiB);单数值全局生效,默认 1024

环境变量:LLAMA_ARG_FIT_TARGET

-fitc, --fit-ctx N

自动适配功能允许设置的最小上下文窗口大小,默认 4096

环境变量:LLAMA_ARG_FIT_CTX

--check-tensors

校验模型张量是否存在非法异常值(默认关闭)

--override-kv KEY=TYPE:VALUE,...

高级参数:按键覆盖模型元数据,多组逗号分隔

支持类型 int/float/bool/str

示例:--override-kv tokenizer.ggml.add_bos_token=bool:false,tokenizer.ggml.add_eos_token=bool:false

--op-offload, --no-op-offload

主机张量运算卸载至加速设备(默认开启)

--lora FNAME

LoRA 微调适配器文件路径;多适配器逗号分隔加载

--lora-scaled FNAME:SCALE,...

带自定义缩放系数的 LoRA 适配器,格式 文件路径:缩放值,多组逗号分隔

--control-vector FNAME

加载控制向量文件;多文件逗号分隔叠加

--control-vector-scaled FNAME:SCALE,...

带自定义缩放系数的控制向量,格式 文件:系数

--control-vector-layer-range START END

控制向量生效层区间,首尾层均包含

-m, --model FNAME

本地模型文件路径

环境变量:LLAMA_ARG_MODEL

-mu, --model-url MODEL_URL

模型在线下载链接(默认不启用)

环境变量:LLAMA_ARG_MODEL_URL

-dr, --docker-repo [<仓库>/]<模型>[:量化版本]

Docker Hub 模型仓库地址

仓库名可选,默认 ai/;量化标签可选,默认 latest

示例:gemma3

环境变量:LLAMA_ARG_DOCKER_REPO

-hf, -hfr, --hf-repo <用户名>/<模型仓库>[:量化]

HuggingFace 模型仓库地址,量化标签大小写不敏感,默认 Q4_K_M;无该量化则下载仓库首个 GGUF 文件

多模态模型自动下载 mmproj 投影文件,添加--no-mmproj可关闭

示例:ggml-org/GLM-4.7-Flash-GGUF:Q4_K_M

环境变量:LLAMA_ARG_HF_REPO

-hff, --hf-file FILE

指定下载 HF 仓库内特定模型文件,覆盖--hf-repo的量化参数

环境变量:LLAMA_ARG_HF_FILE

-hfv, -hfrv, --hf-repo-v <用户名>/<模型>[:量化]

音频声码器专用 HF 仓库(默认不启用)

环境变量:LLAMA_ARG_HF_REPO_V

-hffv, --hf-file-v FILE

声码器模型指定文件路径

环境变量:LLAMA_ARG_HF_FILE_V

-hft, --hf-token TOKEN

HuggingFace 访问令牌;默认读取环境变量 HF_TOKEN

环境变量:HF_TOKEN

--log-disable

关闭全部日志输出

--log-file FNAME

日志输出至指定文件

环境变量:LLAMA_ARG_LOG_FILE

--log-colors [on|off|auto]

彩色日志开关;auto 仅终端输出启用色彩(默认 auto)

环境变量:LLAMA_ARG_LOG_COLORS

-v, --verbose, --log-verbose

日志等级拉满,输出全部调试信息,排错专用

--offline

离线模式:强制使用本地缓存,阻断网络请求

环境变量:LLAMA_ARG_OFFLINE

-lv, --verbosity, --log-verbosity N

日志输出阈值,高于该等级日志会被过滤

0:普通输出

1:错误

2:警告

3:信息(默认)

4:详细追踪

5:调试

环境变量:LLAMA_ARG_LOG_VERBOSITY

--log-prefix, --no-log-prefix

日志行输出模块前缀标识

--log-timestamps, --no-log-timestamps

日志行附加时间戳

--spec-draft-type-k, -ctkd, --cache-type-k-draft TYPE

推测解码草稿模型 K 张量缓存数据类型,可选值同主模型 KV 缓存(默认 f16)

环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_K

--spec-draft-type-v, -ctvd, --cache-type-v-draft TYPE

推测解码草稿模型 V 张量缓存数据类型(默认 f16)

环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_V


采样参数 sampling params

--samplers SAMPLERS

文本生成采样器执行顺序,分号分隔

默认顺序:penalties;dry;top_n_sigma;top_k;typ_p;top_p;min_p;xtc;temperature

-s, --seed SEED

随机数种子;-1 = 随机种子(默认 – 1)

--sampler-seq, --sampling-seq SEQUENCE

简化采样器序列简写,默认 edskypmxt

--ignore-eos

忽略结束符 EOS,持续生成文本;等效自动开启--logit-bias EOS-inf

--temp, --temperature N

生成温度,控制随机性(默认 0.80)

--top-k N

Top-K 采样;0 = 关闭(默认 40)

环境变量:LLAMA_ARG_TOP_K

--top-p N

Top-P 核采样;1.0 = 关闭(默认 0.95)

--min-p N

Min-P 采样;0.0 = 关闭(默认 0.05)

--top-nsigma, --top-n-sigma N

Top-N-Sigma 采样;-1 = 关闭(默认 – 1.00)

--xtc-probability N

XTC 采样概率阈值;0 = 关闭(默认 0.00)

--xtc-threshold N

XTC 过滤阈值;1.0 = 关闭(默认 0.10)

--typical, --typical-p N

局部典型采样;1.0 = 关闭(默认 1.00)

--repeat-last-n N

重复惩罚统计窗口 token 数量;0 关闭、-1 等于上下文总长度(默认 64)

--repeat-penalty N

重复序列惩罚系数;1.0 关闭惩罚(默认 1.00)

--presence-penalty N

存在惩罚;0 关闭(默认 0.00)

--frequency-penalty N

频率惩罚;0 关闭(默认 0.00)

--dry-multiplier N

DRY 去重复采样倍率;0 关闭(默认 0.00)

--dry-base N

DRY 采样基础系数(默认 1.75)

--dry-allowed-length N

DRY 检测重复序列最小长度(默认 2)

--dry-penalty-last-n N

DRY 惩罚统计窗口;0 关闭、-1 等于上下文长度(默认 – 1)

--dry-sequence-breaker STRING

自定义 DRY 序列分隔符,覆盖默认换行 / 冒号 / 引号 /*;传入 none 禁用分隔符

--adaptive-target N

自适应 P 采样目标概率区间;负数关闭(默认 – 1.00,范围 0~1)

参考:https://github.com/ggml-org/llama.cpp/pull/17927

--adaptive-decay N

自适应 P 衰减系数;数值越低响应越快、越高越稳定(0~0.99,默认 0.90)

--dynatemp-range N

动态温度区间;0 关闭(默认 0.00)

--dynatemp-exp N

动态温度指数系数(默认 1.00)

--mirostat N

Mirostat 采样开关;0 关闭、1=Mirostat v1、2=Mirostat 2.0

启用后自动忽略 TopK、核采样、典型采样(默认 0)

--mirostat-lr N

Mirostat 学习率 eta(默认 0.10)

--mirostat-ent N

Mirostat 目标熵 tau(默认 5.00)

-l, --logit-bias TOKEN_ID(+/-)BIAS

修改指定 token 生成概率

示例:--logit-bias 15043+1 提高 Hello 生成概率;15043-1降低

--grammar GRAMMAR

BNF 格式语法约束,限制模型输出格式;示例文件见 grammars 目录

--grammar-file FNAME

从文件读取语法约束规则

-j, --json-schema SCHEMA

JSON Schema 约束生成 JSON 输出,{}代表任意 JSON 对象

外部 $ref 引用 schema 需改用 grammar + 配套转换脚本

-jf, --json-schema-file FILE

文件加载 JSON 格式约束规则,外部引用同上述限制

-bs, --backend-sampling

后端硬件采样加速(实验性功能,默认关闭)

环境变量:LLAMA_ARG_BACKEND_SAMPLING


推测解码参数 speculative params

--spec-draft-hf, -hfd, -hfrd, --hf-repo-draft <用户>/<模型>[:量化]

草稿模型专用 HF 仓库,参数规则同--hf-repo(默认不启用)

环境变量:LLAMA_ARG_SPEC_DRAFT_HF_REPO

--spec-draft-threads, -td, --threads-draft N

草稿模型生成阶段 CPU 线程数(默认同主模型 –threads)

--spec-draft-threads-batch, -tbd, --threads-batch-draft N

草稿模型批量预处理线程(同草稿主线程)

--spec-draft-cpu-mask, -Cd, --cpu-mask-draft M

草稿模型 CPU 亲和掩码,配合 cpu-range-draft(默认同主模型掩码)

--spec-draft-cpu-range, -Crd, --cpu-range-draft lo-hi

草稿模型绑定 CPU 核心区间

--spec-draft-cpu-strict, --cpu-strict-draft <0|1>

草稿模型启用严格 CPU 绑定(默认同主模型)

--spec-draft-prio, --prio-draft N

草稿进程线程优先级:0 普通 / 1 中等 / 2 高 / 3 实时(默认 0)

--spec-draft-poll, --poll-draft <0|1>

草稿任务启用轮询等待(默认同主模型 poll)

--spec-draft-cpu-mask-batch, -Cbd, --cpu-mask-batch-draft M

草稿批量任务 CPU 掩码(默认同主模型批量掩码)

--spec-draft-cpu-strict-batch, --cpu-strict-batch-draft <0|1>

草稿批量严格 CPU 绑定(默认草稿 cpu-strict)

--spec-draft-prio-batch, --prio-batch-draft N

草稿批量线程优先级(默认 0)

--spec-draft-poll-batch, --poll-batch-draft <0|1>

草稿批量轮询开关(默认同草稿 poll)

-otd, --override-tensor-draft <张量规则>=<缓存类型>

单独强制草稿模型张量缓存类型

-cmoed, --cpu-moe-draft

草稿模型全部 MoE 层权重存放 CPU 内存

环境变量:LLAMA_ARG_SPEC_DRAFT_CPU_MOE

-ncmoed, --n-cpu-moe-draft N

草稿模型前 N 层 MoE 权重保留 CPU 内存

环境变量:LLAMA_ARG_SPEC_DRAFT_N_CPU_MOE

--spec-draft-n-max N

单次推测解码草稿最大 token 数量(默认 3)

环境变量:LLAMA_ARG_SPEC_DRAFT_N_MAX

--spec-draft-n-min N

单次推测最小草稿 token 数(默认 0)

环境变量:LLAMA_ARG_SPEC_DRAFT_N_MIN

--spec-draft-p-split, --draft-p-split P

推测分支拆分概率(默认 0.10)

环境变量:LLAMA_ARG_SPEC_DRAFT_P_SPLIT

--spec-draft-p-min, --draft-p-min P

贪心推测最小概率阈值(默认 0.00)

环境变量:LLAMA_ARG_SPEC_DRAFT_P_MIN

--spec-draft-backend-sampling, --no-spec-draft-backend-sampling

草稿模型采样卸载至硬件后端(默认开启)

环境变量:LLAMA_ARG_SPEC_DRAFT_BACKEND_SAMPLING

-devd, --device-draft <dev1,dev2,..>

草稿模型硬件卸载设备列表;none = 不卸载,用--list-devices查看硬件

-ngld, --gpu-layers-draft N

草稿模型加载至显存最大层数,支持数字 /auto/all(默认 auto)

环境变量:LLAMA_ARG_N_GPU_LAYERS_DRAFT

-md, --model-draft FNAME

推测解码草稿模型本地文件路径(默认不启用)

环境变量:LLAMA_ARG_SPEC_DRAFT_MODEL

--spec-type 类型列表

启用的推测解码算法,逗号分隔,可选:

none /draft-simple/draft-eagle3 /draft-mtp/draft-dflash /draft-dspark/ngram-simple /ngram-map-k/ngram-map-k4v /ngram-mod/ngram-cache

默认 none(关闭推测)

环境变量:LLAMA_ARG_SPEC_TYPE

--spec-ngram-mod-n-min N

Ngram-Mod 推测最小缓存 token 数量(默认 48)

--spec-ngram-mod-n-max N

Ngram-Mod 最大缓存 token(默认 64)

--spec-ngram-mod-n-match N

Ngram-Mod 匹配窗口长度(默认 24)

--spec-ngram-simple-size-n N

Ngram-Simple 查询 n 元组长度(默认 12)

--spec-ngram-simple-size-m N

Ngram-Simple 草稿 m 元组长度(默认 48)

--spec-ngram-simple-min-hits N

Ngram-Simple 最低匹配命中次数(默认 1)

--spec-ngram-map-k-size-n N

Ngram-Map-K 查询元组长度(默认 12)

--spec-ngram-map-k-size-m N

Ngram-Map-K 草稿元组长度(默认 48)

--spec-ngram-map-k-min-hits N

最低匹配次数(默认 1)

--spec-ngram-map-k4v-size-n / size-m / min-hits

四向向量 Ngram 映射参数,默认同上

已废弃参数提示

--draft / --draft-min / --spec-ngram-size-n/m/min-hits

参数已移除,替换为对应 spec-ngram 系列参数


场景专用参数 example-specific params

-lcs, --lookup-cache-static FNAME

静态查找缓存文件,检索解码使用,生成过程不更新缓存

-lcd, --lookup-cache-dynamic FNAME

动态查找缓存,生成时自动更新

-ctxcp, --ctx-checkpoints, --swa-checkpoints N

单个上下文槽位最大快照数量(默认 32)

参考:https://github.com/ggml-org/llama.cpp/pull/15293

环境变量:LLAMA_ARG_CTX_CHECKPOINTS

-cms, --checkpoint-min-step N

上下文快照最小间隔 token 数;0 无限制(默认 8192)

环境变量:LLAMA_ARG_CHECKPOINT_MIN_SPACING_NT

-cram, --cache-ram N

缓存最大占用内存(MiB);-1 无上限、0 关闭缓存(默认 8192)

参考:https://github.com/ggml-org/llama.cpp/pull/16391

环境变量:LLAMA_ARG_CACHE_RAM

-kvu, --kv-unified / --no-kv-unified

全局统一 KV 缓存缓冲区,多会话共享;自动并行槽位时默认开启

环境变量:LLAMA_ARG_KV_UNIFIED

--cache-idle-slots, --no-cache-idle-slots

新任务将空闲会话存入提示缓存,统一 KV 时自动清空;依赖 cache-ram(默认开启)

环境变量:LLAMA_ARG_CACHE_IDLE_SLOTS

--context-shift, --no-context-shift

无限生成启用上下文滑动窗口(默认关闭)

环境变量:LLAMA_ARG_CONTEXT_SHIFT

-r, --reverse-prompt PROMPT

交互式模式,检测到指定字符串即停止生成并交还控制台

-sp, --special

输出特殊 token 标识(默认关闭)

--warmup, --no-warmup

程序启动空跑预热模型计算(默认开启)

--spm-infill

填空任务使用 Suffix/Prefix/Middle 顺序,替代默认 Prefix/Suffix/Middle(默认关闭)

--pooling {none,mean,cls,last,rank}

嵌入向量池化策略;未指定使用模型默认配置

环境变量:LLAMA_ARG_POOLING

-np, --parallel N

服务端并发会话槽位数量;-1 自动适配(默认 – 1)

环境变量:LLAMA_ARG_N_PARALLEL

-cb, --cont-batching / -nocb, --no-cont-batching

连续动态批量调度(默认开启)

环境变量:LLAMA_ARG_CONT_BATCHING

-mm, --mmproj FILE

多模态视觉投影器文件路径;使用-hf拉取模型可自动下载无需手动指定

文档:tools/mtmd/README.md

环境变量:LLAMA_ARG_MMPROJ

-mmu, --mmproj-url URL

在线视觉投影器下载地址

环境变量:LLAMA_ARG_MMPROJ_URL

--mmproj-auto, --no-mmproj-auto

自动加载配套视觉投影文件(HF 模式默认开启)

环境变量:LLAMA_ARG_MMPROJ_AUTO

--mmproj-offload, --no-mmproj-offload

视觉投影器 GPU 硬件卸载(默认开启)

环境变量:LLAMA_ARG_MMPROJ_OFFLOAD

--image-min-tokens N

动态分辨率视觉模型,单张图片最小编码 token(默认读取模型配置)

环境变量:LLAMA_ARG_IMAGE_MIN_TOKENS

--image-max-tokens N

单张图片最大编码 token 上限(默认读取模型)

环境变量:LLAMA_ARG_IMAGE_MAX_TOKENS

--mtmd-batch-max-tokens N

图片编码批量总 token 上限(默认 1024)

环境变量:LLAMA_ARG_MTMD_BATCH_MAX_TOKENS

-a, --alias STRING

模型 API 别名,多别名逗号分隔

环境变量:LLAMA_ARG_ALIAS

--tags STRING

模型标签,仅用于展示不参与路由匹配,逗号分隔

环境变量:LLAMA_ARG_TAGS

--embd-normalize N

嵌入向量归一化方式

-1 = 关闭归一化

0 = 最大绝对值 int16 缩放

1 = 曼哈顿距离归一化

2 = 欧几里得归一化(默认)

2 = 自定义 P 范数

--host HOST

服务监听地址;以.sock 结尾则绑定 UNIX 本地套接字(默认 127.0.0.1)

环境变量:LLAMA_ARG_HOST

--port PORT

服务监听端口(默认 8080)

环境变量:LLAMA_ARG_PORT

--reuse-port

端口复用,允许多套接字绑定同一端口(默认关闭)

环境变量:LLAMA_ARG_REUSE_PORT

--path PATH

静态资源文件托管目录(默认空)

环境变量:LLAMA_ARG_STATIC_PATH

--cors-origins ORIGINS

跨域允许来源,逗号分隔;* 允许全部;设为localhost仅放行本机

环境变量:LLAMA_ARG_CORS_ORIGINS

--cors-methods METHODS

跨域允许 HTTP 请求方法(默认 GET,POST,DELETE,OPTIONS)

环境变量:LLAMA_ARG_CORS_METHODS

--cors-headers HEADERS

跨域允许请求头,放行全部(默认

环境变量:LLAMA_ARG_CORS_HEADERS

--cors-credentials, --no-cors-credentials

允许跨域携带 Cookie 凭证;默认开启,origins 为 * 时会原样回传 Origin 头

环境变量:LLAMA_ARG_CORS_CREDENTIALS

--api-prefix PREFIX

API 接口全局路径前缀,末尾不带斜杠(默认空)

环境变量:LLAMA_ARG_API_PREFIX

--ui-config, --webui-config JSON

WebUI 界面默认配置 JSON 字符串,覆盖内置默认值

环境变量:LLAMA_ARG_UI_CONFIG

--ui-config-file, --webui-config-file PATH

外部 JSON 文件配置 WebUI 参数

环境变量:LLAMA_ARG_UI_CONFIG_FILE

--ui-mcp-proxy, --no-ui-mcp-proxy

MCP 协议跨域代理(实验功能,不可在不可信公网开启,默认关闭)

环境变量:LLAMA_ARG_UI_MCP_PROXY

--tools TOOL1,TOOL2,...

启用内置 AI 工具代理(实验,公网勿开);传入 all 启用全部

可用工具:read_file、file_glob_search、grep_search、exec_shell_command、write_file、edit_file、get_datetime

安全限制:自动限制跨域仅localhost访问

环境变量:LLAMA_ARG_TOOLS

--mcp-servers-config PATH

MCP 服务定义 JSON 文件(Cursor 兼容格式,不可公网部署,默认无)

环境变量:LLAMA_ARG_MCP_SERVERS_CONFIG

--mcp-servers-json JSON

行内 JSON 定义 MCP 服务配置(同上安全限制)

环境变量:LLAMA_ARG_MCP_SERVERS_JSON

-ag, --agent, --no-agent

一键开启 MCP 代理 + 全部内置工具;公网禁用,自动限制跨域localhost(默认关闭)

环境变量:LLAMA_ARG_AGENT

--ui, --webui, --no-ui

开启网页可视化界面(默认开启)

环境变量:LLAMA_ARG_UI

--embedding, --embeddings

仅启用嵌入向量接口,仅搭配专用 Embedding 模型使用(默认关闭)

环境变量:LLAMA_ARG_EMBEDDINGS

--rerank, --reranking

启用重排序 Rerank 接口(默认关闭)

环境变量:LLAMA_ARG_RERANKING

--api-key KEY

接口鉴权密钥,多密钥逗号分隔(默认无密钥)

环境变量:LLAMA_API_KEY

--api-key-file FNAME

密钥文件路径,每行一个密钥;# 开头行为注释(默认无)

环境变量:LLAMA_ARG_API_KEY_FILE

--ssl-key-file FNAME

PEM 格式 SSL 私钥文件路径

环境变量:LLAMA_ARG_SSL_KEY_FILE

--ssl-cert-file FNAME

PEM 格式 SSL 证书文件路径

环境变量:LLAMA_ARG_SSL_CERT_FILE

--chat-template-kwargs STRING

聊天模板解析附加参数,合法 JSON 对象字符串

示例:{"key1":"value1"}

环境变量:LLAMA_ARG_CHAT_TEMPLATE_KWARGS

-to, --timeout N

服务读写超时秒数(默认 3600)

环境变量:LLAMA_ARG_TIMEOUT

--sse-ping-interval N

SSE 流式心跳间隔秒;-1 关闭心跳(默认 30)

环境变量:LLAMA_ARG_SSE_PING_INTERVAL

--threads-http N

HTTP 请求处理线程数;-1 自动分配(默认 – 1)

环境变量:LLAMA_ARG_THREADS_HTTP

--cache-prompt, --no-cache-prompt

启用提示词 KV 缓存复用(默认开启)

环境变量:LLAMA_ARG_CACHE_PROMPT

--cache-reuse N

KV 滑动复用最小块尺寸,依赖 prompt 缓存(默认 0)

环境变量:LLAMA_ARG_CACHE_REUSE

--metrics

开启 Prometheus 监控指标接口(默认关闭)

环境变量:LLAMA_ARG_ENDPOINT_METRICS

--props

开放 POST /props 接口动态修改全局参数(默认关闭)

环境变量:LLAMA_ARG_ENDPOINT_PROPS

--slots, --no-slots

开放会话槽监控接口(默认开启)

环境变量:LLAMA_ARG_ENDPOINT_SLOTS

--slot-save-path PATH

会话 KV 缓存持久化保存目录(默认关闭持久化)

--media-path PATH

本地媒体文件加载目录,支持 file:// 相对路径访问(默认关闭)

--models-dir PATH

路由服务模型存放目录(默认关闭)

环境变量:LLAMA_ARG_MODELS_DIR

--models-preset PATH

路由模型预设 INI 配置文件(默认关闭)

环境变量:LLAMA_ARG_MODELS_PRESET

--models-max N

路由服务同时加载模型上限;0 无限制(默认 4)

环境变量:LLAMA_ARG_MODELS_MAX

--models-autoload, --no-models-autoload

路由服务自动加载目录内模型(默认开启)

环境变量:LLAMA_ARG_MODELS_AUTOLOAD

--jinja, --no-jinja

使用 Jinja2 引擎解析聊天模板(默认开启)

环境变量:LLAMA_ARG_JINJA

--reasoning-format FORMAT

思考推理标签解析格式

  • none:思考内容保留在 message.content 不拆分
  • deepseek:思考内容存入独立 message.reasoning_content 字段
  • deepseek-legacy:保留标签同时拆分 reasoning_content

    默认 auto 自动识别模板

    环境变量:LLAMA_ARG_THINK

-rea, --reasoning [on|off|auto]

推理思考模式开关;auto 自动读取模板配置(默认 auto)

环境变量:LLAMA_ARG_REASONING

--reasoning-budget N

思考阶段 token 预算;-1 无上限、0 直接结束思考、正数限制思考长度(默认 – 1)

环境变量:LLAMA_ARG_THINK_BUDGET

--reasoning-budget-message MESSAGE

思考 token 耗尽时插入的提示文本(默认空)

环境变量:LLAMA_ARG_THINK_BUDGET_MESSAGE

--reasoning-preserve, --no-reasoning-preserve

完整对话历史永久保存推理内容,不只保存在最后一轮助手回复;遵循模型模板能力标识

环境变量:LLAMA_ARG_REASONING_PRESERVE

--chat-template JINJA_TEMPLATE

内置 Jinja 聊天模板名称,覆盖模型自带模板;指定前缀 / 后缀会禁用模板

内置模板列表:bailing、bailing-think、bailing2、chatglm3、chatglm4、chatml、command-r、deepseek、deepseek-ocr、deepseek2、deepseek3、exaone-moe、exaone3、exaone4、falcon3、gemma、gigachat、glmedge、gpt-oss、granite、granite-4.0、granite-4.1、grok-2、hunyuan-dense、hunyuan-moe、hunyuan-vl、kimi-k2、llama2、llama2-sys、llama2-sys-bos、llama2-sys-strip、llama3、llama4、megrez、minicpm、mistral-v1、mistral-v3、mistral-v3-tekken、mistral-v7、mistral-v7-tekken、monarch、openchat、orion、pangu-embedded、phi3、phi4、rwkv-world、seed_oss、smolvlm、solar-open、vicuna、vicuna-orca、yandex、zephyr

环境变量:LLAMA_ARG_CHAT_TEMPLATE

--chat-template-file JINJA_TEMPLATE_FILE

外部文件自定义 Jinja 聊天模板,规则同上内置模板

环境变量:LLAMA_ARG_CHAT_TEMPLATE_FILE

--skip-chat-parsing, --no-skip-chat-parsing

强制纯文本解析,忽略 Jinja 模板;所有输出(推理、工具调用)全部放入 content 字段(默认关闭)

环境变量:LLAMA_ARG_SKIP_CHAT_PARSING

--prefill-assistant, --no-prefill-assistant

最后一条消息为助手回复时自动续写;关闭则视为完整消息不再预填充(默认开启)

环境变量:LLAMA_ARG_PREFILL_ASSISTANT

-sps, --slot-prompt-similarity SIMILARITY

会话复用提示词相似度阈值;0 关闭复用(默认 0.10)

--lora-init-without-apply

加载 LoRA 适配器但不立即生效,可通过 POST /lora-adapters 接口动态切换(默认关闭)

--sleep-idle-seconds SECONDS

空闲超时休眠秒数;-1 禁用休眠(默认 – 1)

--log-prompts-dir PATH

提示词日志保存目录(自动创建,仅调试用,默认关闭)

-mv, --model-vocoder FNAME

音频 TTS 声码器模型文件(默认不启用)

--tts-use-guide-tokens

TTS 语音生成启用引导 token 提升词语还原度

内置专用模型快捷参数(一键加载)

--embd-gemma-default

自动下载 Gemma 嵌入模型权重

--fim-qwen-1.5b-default

Qwen2.5-Coder 1.5B 代码补全模型

--fim-qwen-3b-default Qwen2.5-Coder 3B

--fim-qwen-7b-default Qwen2.5-Coder 7B

--fim-qwen-7b-spec Qwen7B 主模型 + 0.5B 草稿推测解码

--fim-qwen-14b-spec Qwen14B+0.5B 草稿

--fim-qwen-30b-default Qwen3 Coder 30B A3B 指令模型

--gpt-oss-20b-default / --gpt-oss-120b-default

自动下载对应 GPT-OSS 开源模型权重

--vision-gemma-4b-default / --vision-gemma-12b-default

Gemma3 4B/12B 视觉 QAT 量化模型

--spec-default

启用默认推测解码配置
附:

llamaenveditor 程序及源代码