正在连接 GzWeb2
正在等待主站发送登录状态…
Llama Server 启动面板
GPU 状态(V100 32GB)
—
显存占用
—
GPU 利用率
—
温度
llama-server 程序路径
加载模型
正在读取 models 目录…
复制名字
视觉模型 (mmproj)
正在读取 models 目录…
复制名字
自动读取项目 models 目录中的 GGUF 文件;以 mmproj 开头的文件会列入此处。
Slot 数量(并发槽位,-c 会均分到每个 slot)
总上下文大小 tokens(手动输入任意值)
KV Cache 类型
FP16(精度最高,最耗显存)
Q8_0(推荐,显存/精度平衡)
Q4_0(最省显存,可能损失质量)
KV 显存预估
—
API Key(留空则不启用鉴权)
监听地址
端口
GPU 层数 (-ngl)
修复版 Chat 模板文件路径(留空 = 用模型内置模板)
填这个 froggeric/Qwen-Fixed-Chat-Templates 的 chat_template.jinja 路径,可修复默认 xhigh 烧 token、关思考崩溃、空思考块占上下文等问题。
推理深度(启用修复模板时生效)
medium(默认,零额外 token,推荐)
xhigh(深度推理,慢且耗 token)
low(简洁推理,快)
推测解码 / MTP(加速生成,用显存换速度)
关闭(默认)
draft-mtp(模型自带 nextn 头加速)
MTP 草稿 token 数(启用 draft-mtp 时生效)
值越大单步预测越多 token,可能加速更多,但额外显存占用也越大。
开机自启大模型(面板启动后自动用以上参数拉起 llama-server)
启动服务
停止服务
未运行
仅保存参数
重启面板
清空日志
本轮参考:不同精度 KV cache 对显存的影响(32GB 实测)
KV 精度
每 1K tokens
1 slot 最大上下文
2 slot(每槽减半)
FP16
~66.6 MB
约 244K(开不到 262K)
每槽 122K
Q8_0
~39.8 MB
262K ✅
每槽 131K
Q4_0
~23.4 MB
262K ✅
每槽 131K
运行日志