Skip to content

原文链接: 3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑作者: lavarong(文喜AI) 版权声明: 本文为博主原创文章,转载请附上原文出处链接和本声明。


3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑

最近本地大模型圈又出了个狠角色:PrismML 的 Bonsai 27B。它干了一件听起来像魔术的事——把 27B 级别的大模型压到 1-bit 权重,体积只剩 3.9GB,第一次让这种级别的能力能塞进手机和普通笔记本。我手上是张早该退役的 RTX 2070(8G 显存),本来连它同基座的 Qwen3.6-27B 稠密版(4-bit 也要 18G+)都跑不动。结果这个 3.8GB 的"小东西",实测下来比之前 Qwythos-9B-Claude-Mythos 本地实测还强上不少。下面是我在 LM Studio 上的真实测试。

封面图

它到底是什么

Bonsai 27B 由一支源自 Caltech 的团队 PrismML 于 2026-07-14 发布,基座是 Qwen3.6-27B,采用 Apache 2.0 许可,可商用。它的核心卖点就一句话:把 27B 级模型压到 1-bit 权重,体积只剩 3.9GB(实测下载的 Q1_0 量化正好 3.8GB),第一次让 27B 级能力能跑在手机和 8G 老显卡上。

  1. 极致压缩:1-bit 权重仅 3.8GB,体积比一个全精度 2B 模型还小。
  2. 能力不残缺:推理、工具调用、多模态、agentic 工作流全部保留,不是阉割版。
  3. 手机可部署:1-bit 版刚好塞进 iPhone 的内存预算,27B 级首次上手机。

一句话总结:同基座的 Qwen3.6-27B 稠密模型 4-bit 也要 18GB+ 显存,8G 老卡跑不了;Bonsai 3.8GB 直接开跑——这就是压缩的价值。

技术原理:小而不傻

它凭什么这么小还不傻?关键在端到端低比特。传统量化往往只压主干、留点高精度"逃生舱",Bonsai 是从 embedding、attention、MLP 到 LM head 全部跑在 1-bit 权重上,没有任何例外——这是它能守住智能的核心。

  1. 1-bit / ternary 量化:权重只有 {-1, +1} 两值(ternary 加个 0),配 FP16 组级缩放,真实仅 1.125 bit/weight;质量更高的 ternary 版是 1.71 bit/weight。
  2. 混合注意力:沿用 Qwen3.6-27B 的 64 层结构,约 75% 线性注意力 + 25% 全注意力,所以 262K 长上下文显存也压得住。
  3. 视觉塔:约 0.46B 参数,以紧凑 4-bit 形式随附,看图时不额外吃文本推理的显存。
  4. 智能密度:PrismML 提出的新指标 = 错误率负对数 ÷ 模型体积。1-bit Bonsai 达 0.53/GB,是全精度基线的 10 倍以上。

效果有数据背书:15 项基准(thinking 模式)下,1-bit 版保留了约 90% 的全精度能力,其中数学、编码几乎无损;质量更高的 ternary 版保留约 95%。

部署有多简单

📋 测试环境说明

本次测试在 LM Studio 下完成,硬件为 RTX 2070 8GB,使用 Bonsai-27B-Q1_0.gguf(3.8GB)+ mmproj-BF16.gguf(900MB 视觉塔)。详见模型主页→

官方推荐用他们 fork 的 llama.cpp,因为原生版本跑不了 Q1_0_g128 这个混合注意力内核。但直接上 LM Studio——左侧搜索 prism-ml/Bonsai-27B-gguf,下载,加载即用,零配置。

一句话总结:对普通玩家来说,LM Studio 搜一下就能跑,门槛低到离谱。

逻辑推理实测

先上经典密码推理题,考考它的多步推演:

3 1 8:1 个号码正确且位置正确
3 7 9:1 个号码正确但位置不正确
8 6 3:2 个号码正确位置都不正确
4 2 1:号码都不正确

开 thinking 模式,它思考了约 3 分钟,速度 22 tok/s,总 tokens 约 5000,最终输出答案 698——完全正确。思考过程分 5 步逐步推导:先排除不可能数字、再逐条比对线索、最后还附了一张验证表格,结构相当清晰。多次测试下来,开 think 基本都能稳定解出。

关掉 thinking 模式会怎样?复杂问题明显不稳定,多次把上下文耗尽也拿不到答案。但有个亮点:它不会胡编错误答案,而是会自己验算、发现矛盾后如实说"解不出"。这点比很多动不动就瞎猜的模型体面多了。

一句话总结:想让它稳,thinking 模式必须开;好在它不胡说,失败也失败得诚实。

视觉能力实测

自带视觉塔,按难度递进测了四类:

  1. 简单验证码(彩色手写字母 2WKC):秒回,约 29.66 tok/s、0.58 秒,识别准确。
  2. 难看的手写体(morning overlooks):同样秒回,约 27.96 tok/s、0.69 秒,毫无压力。
  3. 图形验证码(选含人行横道的图):这种需要开 thinking 才准,关了容易错。
  4. 初中几何题(正方形+梯形求面积):思考约 2 分 41 秒,答对了 S=25.2cm²,但推导逻辑不够清晰、绕了弯路;同题之下 Qwythos-9B 完全错误。

作者头像

一句话总结:日常看图、识验证码、读文档,它又快又准;硬核推理题能答对,只是过程不够优雅。

横向对比:智商排第几

同硬件(RTX 2070 8GB)、结合之前的测试,主观"智商"排名:

Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B > Qwen3.5-9B

作为 27B 级模型的 1-bit 压缩版,Bonsai 排第三——比两个 9B 级强,但不如参数量更大的两个 MoE。可关键是它的代价最小:只要 3.8GB,生成速度还比 Qwen3.6-35B-A3B 快一倍(22 对 11 tok/s),加载速度也快上很多,而同基座稠密版在 8G 卡上根本起不来。

模型大小优点缺点
Bonsai-27B3.8GB / 27B 级 1-bit部署极简、速度不错、诚实不胡编必须开 think、几何逻辑绕
Qwythos-9B6.5GB / 9B 稠密速度最快 30 tok/s、多模态死循环 bug、不能关 think
Gemma-4-26B-A4B~6.5GB / 26B MoE智商最高、token 效率最优需 26B 总参、显存更高

总结

优点:部署极简(LM Studio 即下即用)、体积惊人(3.8GB 跑 27B 级)、速度不错、视觉全面、诚实不胡编、无死循环、Apache 2.0 可商用。

缺点 / 注意事项:必须开 thinking 才稳;总体智商排在两个 MoE 之后;几何等复杂数学逻辑不够清晰;视觉塔需额外下载 900MB。

它不是来替代前沿大模型的,而是把"27B 级能力"第一次真正搬到了每个人的老显卡和手机上——这步,比参数更值得记。


本文基于原文 3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑 整理发布,版权归原作者所有。