正在连接 GzWeb2

正在等待主站发送登录状态…

Llama Server 启动面板

显存占用
GPU 利用率
温度
自动读取项目 models 目录中的 GGUF 文件;以 mmproj 开头的文件会列入此处。
填这个 froggeric/Qwen-Fixed-Chat-Templates 的 chat_template.jinja 路径,可修复默认 xhigh 烧 token、关思考崩溃、空思考块占上下文等问题。
值越大单步预测越多 token,可能加速更多,但额外显存占用也越大。
开机自启大模型(面板启动后自动用以上参数拉起 llama-server)
未运行
KV 精度每 1K tokens1 slot 最大上下文2 slot(每槽减半)
FP16~66.6 MB约 244K(开不到 262K)每槽 122K
Q8_0~39.8 MB262K ✅每槽 131K
Q4_0~23.4 MB262K ✅每槽 131K