明廷盛 嘻嘻😁

W4A16 三条启动脚本:模型 / 头 / 思考模板 / 下载

三条脚本的思考模板相同:--chat-template $MODEL/chat_template_safe_v2.jinja + --reasoning-parser qwen3

该 jinja 来自量化仓(不要用仓内默认 chat_template.jinja)。默认 enable_thinking=truereasoning_effort 默认 xhigh;另认 high / medium / low / none(SGLang off 会映射成 none)。

脚本 Target(本地) 投机头 Draft(本地) 算法 思考模板 HF 仓 下载命令
launch_sglang_w4a16_mtp_200k.sh ~/models/Qwen3.8-27B-GPTQ-W4A16 仓内 MTP:model-mtp-bf16.safetensors(~811 MiB,mtp_num_hidden_layers=1);vision 仍加载 model-visual-bf16.safetensors 无外挂 NEXTN,--enable-linear-replayssm-spec,steps=2 / topk=1 / draft_tokens=3 $MODEL/chat_template_safe_v2.jinja pearsonkyle/Qwen3.8-27B-GPTQ-W4A16 huggingface-cli download pearsonkyle/Qwen3.8-27B-GPTQ-W4A16 --local-dir ~/models/Qwen3.8-27B-GPTQ-W4A16
launch_sglang_w4a16_dflash.sh ~/models/Qwen3.8-27B-GPTQ-W4A16-nomtp(同仓 symlink,去掉 MTP shard,mtp_num_hidden_layers=0 外挂 DFlash2:5 层 sliding attn,block=8,selector_rank=256 / topk=16,读 target 层 5/19/33/47/61;vision 仍在 ~/models/Qwen3.8-27B-DFlash2(~3.6G BF16) DFLASH,draft_tokens=8,window=2048 同上(模板在 nomtp 目录里,内容同仓) Target 同上;Draft incoai/Qwen3.8-27B-DFlash2(镜像 z-lab/Qwen3.8-27B-DFlash2 Target 用上面那条;huggingface-cli download incoai/Qwen3.8-27B-DFlash2 --local-dir ~/models/Qwen3.8-27B-DFlash2
launch_sglang_w4a16_dspark.sh 同上 nomtp 外挂 DSpark:5 层 full attn GQA 32/8,VanillaMarkov rank=256 + confidence head,block=7,同样读 5/19/33/47/61;vision 仍在 ~/models/Qwen3.8-27B-DSpark(~3.5G BF16,1.86B) DSPARK,block=7,steps=1,eagle_topk=1 同上 Target 同上;Draft RadixArk/Qwen3.8-27B-DSpark huggingface-cli download RadixArk/Qwen3.8-27B-DSpark --local-dir ~/models/Qwen3.8-27B-DSpark

直链(resolve/main

国内可把 host 换成 https://hf-mirror.com/...,或走 huggingface-cli

nomtp 不是独立 HF 仓:从 W4A16 拷/链过去,删掉 model-mtp-bf16.safetensors,把 config.jsonmtp_num_hidden_layers 改成 0

  • Title:
  • Author: 明廷盛
  • Created at : 2026-08-31 16:35:16
  • Updated at : 2026-08-31 16:35:16
  • Link: https://blog.20040424.xyz/2026/08/31/⏸️VibeCoding/image/download_model/
  • License: All Rights Reserved © 明廷盛