Skip to content

原文链接:本地跑一个 Qwen 3.8,你将拥有一个 Opus 4.6

作者: cxuan | 来源: cxuanAI

版权声明: 本文为 cxuanAI 原创内容,转载需获得授权。


本地跑一个 Qwen 3.8,你将拥有一个 Opus 4.6

封面:Qwen3.8本地部署

各位小伙伴们大家好,我是 cxuan。

就在上周 DeepSeek-V4-pro、Grok 4.6、DeepSeek Harness、GLM 5.3 相继炸场的时候,Qwen 3.8 迎来了开放权重的时刻。

就在大家相继追捧 DeepSeek、GLM 的时候,Qwen 也迎来了属于它的时刻。

Qwen 3.8 的反响,出乎预料的好。已经在 Hugging Face 上可以看到 Qwen-3.8-2.4TQwen-3.8-27B 了。

Unsloth 也给出了本地部署的方法。这次还真不是理论上可以本地跑,而是真的能跑。

Qwen3.8 HuggingFace页面

17GB就能跑?先说清楚

根据 Unsloth 的 Qwen3.8 本地部署文档显示,Qwen 3.8-27B 的 4-bit 量化版本,17~19GB 总内存就能启动。RTX 4090、RTX 5080,或者 24GB 统一内存的 Mac,都可以跑。

换句话说,这次的本地,真的是普通人电脑上的本地。

但 17GB 这个说法还是得加一句说明:Unsloth 推荐的 UD-Q4_K_XL 文件本身就有 17.9GB,视觉投影文件 mmproj 还要大约 0.93GB。模型加载之后,系统、上下文和 KV Cache 也得继续吃内存。

所以 17GB 是能跑的底线,24GB 才是比较靠谱的起点。

这次 Qwen 3.8 开放了两个体量完全不同的模型:

  • Qwen3.8-27B:27B Dense 模型,原生支持图片和视频,默认开启思考,原生上下文 262,144 tokens,还能通过 YaRN 扩到约 1M。大多数人应该下载这个版本。
  • Qwen3.8-2.4T-A95B:2.4T 总参数,每次激活 95B。纯文本、强制思考的模型,离普通电脑还有亿点点距离。

Qwen3.8-27B 到底强在哪

Qwen3.8-27B 的参数量没有变得特别夸张,提升主要出现在 Coding、Agent 和电脑操作上。

编码能力全面超越

  • Terminal Bench 2.1:从 Qwen3.6-27B 的 63.4 涨到了 73.0
  • SWE-bench Pro:从 53.5 涨到 61.7,超过 Qwen3.7-Plus 的 57.6,也超过 Opus4.6 Max 的 53.4
  • DeepSWE 1.1:从 13.3 涨到了 42.2
  • QwenSWEBench:从 49.3 涨到了 79.0

长任务能力提升

  • CoWorkBench:70.7(Qwen3.7-Plus 65.1,Opus4.6 Max 68.2)
  • LiveCodeBench v6:90.3(高于 Qwen3.7-Plus 的 89.6 和 Opus4.6 Max 的 88.8)

当然,纯推理任务还有差距:Terminal Bench 2.1 的 73.0 低于 Opus4.6 Max 的 78.2,GPQA Diamond 的 89.2 也低于 Opus4.6 Max 的 91.3,HLE 是 30.8,距离 Opus4.6 Max 的 40.0 还有差距。

多模态是最大亮点

  • OSWorld-Verified:从 63.9 涨到 84.3
  • WebArena-Verified:从 48.8 涨到 64.8
  • AndroidWorld81.9
  • Vision2Web62.9
  • SWE-MM38.6

这些测试看的已经不只是识图问答了。它要看屏幕、操作电脑、使用浏览器,再把一个软件任务做完。

Qwen3.8基准测试对比

可以说,你本地跑了一个 Qwen 3.8-27B,你将拥有一个 Opus 4.6。

量化版本怎么选

本地部署最容易忽略的就是这一步。大家看到 27B 能压到 9GB,第一反应都是这么小,那我是不是随便跑了。

Unsloth 这次使用 Dynamic V3.0 GGUF,目前还是 Preview。公布的 top-1 和 KLD 分析里,9GB 的 IQ2_XXS 比 54.7GB 的 BF16 小了 83.5%,能力保留为 82.5%。这个数字能用,但损失也是显而易见的——复杂代码、长 Agent 和工具调用,不建议把 2-bit 当主力模型。

各版本对比

量化版本文件大小建议总内存适合场景
IQ2_XXS约 9.0GB11~13GB能跑,质量损失更明显
UD-Q3_K_XL约 13.4GB13~16GB16GB 机器从这里开始
UD-Q4_K_XL约 17.9GB17~19GB24GB 机器优先选它
NVFP4约 23.4GB24GB+Blackwell GPU(RTX 5090/B200)
UD-Q8_K_XL约 31.5GB31GB48GB 以上更合适
BF16约 54.7GB56GB原始精度,工作站路线

配置建议

  • 16GB 机器:选 UD-Q3_K_XL,文件大约 13.4GB
  • 24GB 机器:选 UD-Q4_K_XL,文件大约 17.9GB
  • 32GB 机器:还是建议先跑 Q4,把空间留给系统和上下文
  • 48GB~64GB 机器:可以考虑 UD-Q8_K_XL

上下文窗口有个坑

256K 是模型支持的上限,不是第一次启动就必须拉满。上下文越长,KV Cache 越大,第一次读完提示词的时间也越长。第一次统一从 32K 开始,模型、速度和内存都正常了,再往 64K、128K 加。

内存配置建议表

省事儿的做法:Unsloth Desktop / Studio

如果不想碰编译参数,可以直接下载 Unsloth Desktop。它支持 macOS、Windows 和 Linux。

打开 Model hub,搜索 Qwen3.8-27B,再按自己的内存选量化版本即可。Unsloth 会自动处理大部分推理参数,也会识别多张 GPU。显存放不下时,它还能把一部分权重增加到系统内存中。

Thinking、Preserved Thinking、Web Search、Code Execution 和工具调用也都加进去了。这对本地 Agent 挺重要,省得模型跑起来了,工具又接不上。

Unsloth Desktop界面

喜欢浏览器界面的,也可以手动装 Unsloth Studio

Mac、Linux 和 WSL:

bash
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -p 8888

Windows 用 PowerShell:

powershell
irm https://unsloth.ai/install.ps1 | iex
unsloth studio -p 8888

然后在浏览器打开 http://127.0.0.1:8888。第一次启动会让你创建密码。进入 Model hub,搜索 Qwen3.8-27B-GGUF,24GB 机器选 Q4,16GB 机器先选 Q3。

⚠️ 如果只在自己电脑上用,启动命令里不要加 -H 0.0.0.0。这个参数会把服务开放给同一网络里的其他设备,公网千万别这么干。

如果想接自己的工具,就用 llama.cpp

已经在用 llama.cpp 的小伙伴,先把版本更新到最新,再从 Hugging Face 下载 Unsloth 的 GGUF。

24GB 机器直接下 4-bit:

bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \
  --local-dir unsloth/Qwen3.8-27B-GGUF \
  --include "*UD-Q4_K_XL*"

然后启动:

bash
./llama.cpp/llama-cli \
  --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
  --ctx-size 32768 \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.0

16GB 机器把下载规则和模型名里的 UD-Q4_K_XL 换成 UD-Q3_K_XL

Mac 编译 llama.cpp 时关闭 CUDA 就行,Metal 默认开启。NVIDIA 走 CUDA,AMD 可以走 HIP 或 Vulkan。

如果要把它接给 OpenCode、Open WebUI 或自己的程序,把 llama-cli 换成 llama-server,再让客户端访问本机的 OpenAI 兼容接口。

推荐参数

Qwen3.8 默认开启思考。复杂代码和 Agent 任务用官方推荐参数:

temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
context = 32768 起步

普通聊天不想等它想半天,可以关闭思考:

--chat-template-kwargs '{"enable_thinking":false}'

非思考模式的推荐参数是 temperature=0.7top_p=0.80top_k=20presence_penalty=1.5

如果要看图,记得再下载同一个 GGUF 仓库里的 mmproj-F16.gguf,启动时加上 --mmproj mmproj-F16.gguf。只下语言模型文件,没有图片能力。

Ollama 和 LM Studio,更适合不想折腾命令的人

Ollama 已经上架了官方 Qwen3.8 模型。默认就是 27B,模型大约 18GB,标注支持 256K 上下文、图片、工具调用和思考模式。

安装好 Ollama 之后,一行命令:

bash
ollama run qwen3.8

Apple Silicon 还可以试 MLX 版本:

bash
ollama run qwen3.8:27b-mlx

LM Studio 的做法也很简单。进入 Discover,把 Unsloth 的 GGUF 仓库地址贴进去,再选 Q3、Q4 或 Q8。它适合想自己调显存卸载比例、上下文和采样参数的人。需要本地 API 时,在 Developer 页面启动 Server,就能给其他工具使用。

这两条路线的区别很简单:Ollama 适合一条命令跑起来,LM Studio 适合一边看界面一边调参数。

Ollama和LM Studio

给团队使用的话,用 vLLM 和 SGLang

一个人用的话,llama.cpp 足够了。如果设计几个人同时调用,vLLM 和 SGLang 更合适。

Qwen 官方已经给出了 vLLM recipe 和 SGLang cookbook。它们支持连续批处理、Prefix Cache、多 GPU 和 OpenAI 兼容 API,主要解决并发和吞吐。

如果你有 Blackwell GPU(RTX 5090/DGX Spark/B200/B300)

可以用 Unsloth 的 NVFP4 权重。文件大约 23.4GB,Unsloth 给出的速度比 BF16 快约 1.5 倍。当前文档要求 vLLM >= 0.25.0。

vLLM:

bash
vllm serve unsloth/Qwen3.8-27B-NVFP4

需要 MTP 推测解码,再加:

bash
vllm serve unsloth/Qwen3.8-27B-NVFP4 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":2}'

SGLang:

bash
python -m sglang.launch_server \
  --model-path unsloth/Qwen3.8-27B-NVFP4 \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4

老款 NVIDIA 显卡别下 NVFP4。RTX 4090、3090 这类 24GB 卡,继续用 GGUF + llama.cpp 更省事。官方 FP8 权重约 30.9GB,更适合 48GB 显卡或多卡服务器。

工具调用还要开对应的 parser。vLLM 的 Qwen3.8 recipe 使用 --enable-auto-tool-choice --tool-call-parser qwen3_coder

至于 2.4T,自己玩就别考虑了

Unsloth 也把 Qwen3.8-2.4T-A95B 做成了 GGUF。官方 BF16 权重要 4.9TB,Q8 约 2.6TB。Unsloth 新做的 Dynamic 1-bit 版本压到了 397GB,已经缩小了 91%。

但最小的 397GB 版本,仍然建议准备至少 450GB RAM。纯 CPU 可以启动,速度就别想太多了。生产部署更夸张,TokenSpeed 的参考配置已经是 16 张 GPU、两个 8 卡节点。

所以 2.4T 的开放,主要方便量化团队、推理框架和有服务器的企业。普通用户直接跑 27B,反而还有视觉和非思考模式,体验更完整。

总结

本地跑 Qwen3.8 这件事确实能行。

  • 16GB 可以尝鲜
  • 24GB 已经能认真用
  • 32GB 压力更小

我上次写 DeepSeek-V4-Flash 本地部署的时候还得从 110GB 起步;这次 Qwen3.8-27B 的 4-bit 只有 17.9GB。像我这种 32G 丐版内存的 Mac,这回终于不用再等等了。

今天多多少少得说一句,阿里牛逼了。


参考资料: