原文链接: 3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑作者: lavarong(文喜AI) 版权声明: 本文为博主原创文章,转载请附上原文出处链接和本声明。
3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑
最近本地大模型圈又出了个狠角色:PrismML 的 Bonsai 27B。它干了一件听起来像魔术的事——把 27B 级别的大模型压到 1-bit 权重,体积只剩 3.9GB,第一次让这种级别的能力能塞进手机和普通笔记本。我手上是张早该退役的 RTX 2070(8G 显存),本来连它同基座的 Qwen3.6-27B 稠密版(4-bit 也要 18G+)都跑不动。结果这个 3.8GB 的"小东西",实测下来比之前 Qwythos-9B-Claude-Mythos 本地实测还强上不少。下面是我在 LM Studio 上的真实测试。

它到底是什么
Bonsai 27B 由一支源自 Caltech 的团队 PrismML 于 2026-07-14 发布,基座是 Qwen3.6-27B,采用 Apache 2.0 许可,可商用。它的核心卖点就一句话:把 27B 级模型压到 1-bit 权重,体积只剩 3.9GB(实测下载的 Q1_0 量化正好 3.8GB),第一次让 27B 级能力能跑在手机和 8G 老显卡上。
- 极致压缩:1-bit 权重仅 3.8GB,体积比一个全精度 2B 模型还小。
- 能力不残缺:推理、工具调用、多模态、agentic 工作流全部保留,不是阉割版。
- 手机可部署:1-bit 版刚好塞进 iPhone 的内存预算,27B 级首次上手机。
一句话总结:同基座的 Qwen3.6-27B 稠密模型 4-bit 也要 18GB+ 显存,8G 老卡跑不了;Bonsai 3.8GB 直接开跑——这就是压缩的价值。
技术原理:小而不傻
它凭什么这么小还不傻?关键在端到端低比特。传统量化往往只压主干、留点高精度"逃生舱",Bonsai 是从 embedding、attention、MLP 到 LM head 全部跑在 1-bit 权重上,没有任何例外——这是它能守住智能的核心。
- 1-bit / ternary 量化:权重只有 {-1, +1} 两值(ternary 加个 0),配 FP16 组级缩放,真实仅 1.125 bit/weight;质量更高的 ternary 版是 1.71 bit/weight。
- 混合注意力:沿用 Qwen3.6-27B 的 64 层结构,约 75% 线性注意力 + 25% 全注意力,所以 262K 长上下文显存也压得住。
- 视觉塔:约 0.46B 参数,以紧凑 4-bit 形式随附,看图时不额外吃文本推理的显存。
- 智能密度:PrismML 提出的新指标 = 错误率负对数 ÷ 模型体积。1-bit Bonsai 达 0.53/GB,是全精度基线的 10 倍以上。
效果有数据背书:15 项基准(thinking 模式)下,1-bit 版保留了约 90% 的全精度能力,其中数学、编码几乎无损;质量更高的 ternary 版保留约 95%。
部署有多简单
📋 测试环境说明
本次测试在 LM Studio 下完成,硬件为 RTX 2070 8GB,使用 Bonsai-27B-Q1_0.gguf(3.8GB)+ mmproj-BF16.gguf(900MB 视觉塔)。详见模型主页→
官方推荐用他们 fork 的 llama.cpp,因为原生版本跑不了 Q1_0_g128 这个混合注意力内核。但直接上 LM Studio——左侧搜索 prism-ml/Bonsai-27B-gguf,下载,加载即用,零配置。
一句话总结:对普通玩家来说,LM Studio 搜一下就能跑,门槛低到离谱。
逻辑推理实测
先上经典密码推理题,考考它的多步推演:
3 1 8:1 个号码正确且位置正确
3 7 9:1 个号码正确但位置不正确
8 6 3:2 个号码正确位置都不正确
4 2 1:号码都不正确开 thinking 模式,它思考了约 3 分钟,速度 22 tok/s,总 tokens 约 5000,最终输出答案 698——完全正确。思考过程分 5 步逐步推导:先排除不可能数字、再逐条比对线索、最后还附了一张验证表格,结构相当清晰。多次测试下来,开 think 基本都能稳定解出。
关掉 thinking 模式会怎样?复杂问题明显不稳定,多次把上下文耗尽也拿不到答案。但有个亮点:它不会胡编错误答案,而是会自己验算、发现矛盾后如实说"解不出"。这点比很多动不动就瞎猜的模型体面多了。
一句话总结:想让它稳,thinking 模式必须开;好在它不胡说,失败也失败得诚实。
视觉能力实测
自带视觉塔,按难度递进测了四类:
- 简单验证码(彩色手写字母 2WKC):秒回,约 29.66 tok/s、0.58 秒,识别准确。
- 难看的手写体(morning overlooks):同样秒回,约 27.96 tok/s、0.69 秒,毫无压力。
- 图形验证码(选含人行横道的图):这种需要开 thinking 才准,关了容易错。
- 初中几何题(正方形+梯形求面积):思考约 2 分 41 秒,答对了 S=25.2cm²,但推导逻辑不够清晰、绕了弯路;同题之下 Qwythos-9B 完全错误。

一句话总结:日常看图、识验证码、读文档,它又快又准;硬核推理题能答对,只是过程不够优雅。
横向对比:智商排第几
同硬件(RTX 2070 8GB)、结合之前的测试,主观"智商"排名:
Gemma-4-26B-A4B > Qwen3.6-35B-A3B > Bonsai-27B > Qwythos-9B > Qwen3.5-9B
作为 27B 级模型的 1-bit 压缩版,Bonsai 排第三——比两个 9B 级强,但不如参数量更大的两个 MoE。可关键是它的代价最小:只要 3.8GB,生成速度还比 Qwen3.6-35B-A3B 快一倍(22 对 11 tok/s),加载速度也快上很多,而同基座稠密版在 8G 卡上根本起不来。
| 模型 | 大小 | 优点 | 缺点 |
|---|---|---|---|
| Bonsai-27B | 3.8GB / 27B 级 1-bit | 部署极简、速度不错、诚实不胡编 | 必须开 think、几何逻辑绕 |
| Qwythos-9B | 6.5GB / 9B 稠密 | 速度最快 30 tok/s、多模态 | 死循环 bug、不能关 think |
| Gemma-4-26B-A4B | ~6.5GB / 26B MoE | 智商最高、token 效率最优 | 需 26B 总参、显存更高 |
总结
✅ 优点:部署极简(LM Studio 即下即用)、体积惊人(3.8GB 跑 27B 级)、速度不错、视觉全面、诚实不胡编、无死循环、Apache 2.0 可商用。
❌ 缺点 / 注意事项:必须开 thinking 才稳;总体智商排在两个 MoE 之后;几何等复杂数学逻辑不够清晰;视觉塔需额外下载 900MB。
它不是来替代前沿大模型的,而是把"27B 级能力"第一次真正搬到了每个人的老显卡和手机上——这步,比参数更值得记。
本文基于原文 3.8GB 塞下 27B 级大模型?Bonsai 27B 本地实测,8G 老显卡也能跑 整理发布,版权归原作者所有。