Skip to content

原文来自 黑虾

版权声明:本文为博主原创文章,转载请附上原文出处链接

Bonsai-27B:27B模型压到7.2GB,保留95%智商

Bonsai-27B 三值量化模型

首个能在手机上跑的27B模型,PrismML 发布了 Bonsai-27,把 Qwen3.6-27B 模型压缩到了 3.9GB,直接能在手机上部署了,且保留 Qwen3.6-27B 模型 90% 的智商。对比 Qwen3.6-27B 原版大小,完整版 FP16 要 54GB,Q4 量化版也要 18GB 左右,而这个优化的模型大小只要不到完整版的十分之一。

不过,更值得关注的是同时发布的电脑部署版本——Ternary-Bonsai-27B,压缩后仅 7.2GB,保留 Qwen3.6-27B 模型 95% 智商,大大降低了 27B 模型的硬件门槛。

怎么被压到这么小的?是不是脑残量化?

一般来讲,Q4 量化以下基本就是脑残量化了,高智商模型也会被压缩量化成脑残。不过这个新的量化技术有点东西。

这个量化压缩方式叫:三值量化(或三元量化)。

先说传统量化的逻辑:一个权重本来用 16 位浮点数(FP16)表示,量化就是把它压缩成更少的位数,4-bit、2-bit 都是这么来的。但传统方法越往低位压,模型就越"失忆",尤其是需要连续推理的任务,比如数学证明、写代码,掉分掉得特别狠。

三值量化换了一个思路:每个权重只取三个值——-1、0、+1,然后每 128 个权重共用一个 FP16 的缩放系数。算下来平均每个权重只占 1.71 个比特,比传统"2-bit"量化还要小,但多出来的那个"0"值,让模型比纯粹的二值(只有 -1 和 +1)能力强不少。

官方跑了 15 项测试(数学、代码、知识推理、指令遵循、工具调用、视觉),结果如下:

Ternary Bonsai 用不到传统"2-bit"版三分之二的体积,跑分反而高出 7 分多。传统低比特量化掉分是有选择性的——数学、代码这类需要"想得久"的任务掉得最狠。

Ternary Bonsai 做得还不错:

  • 数学:93.40 分(离满血只差不到 2 分)
  • 代码:85.96 分
  • 工具调用:74.01 分

总结:比传统 Q2 量化聪明一截,但还是会有智商损耗,不如传统的 Q4 量化,好在损耗不多,算不上脑残,而且确实降低了硬件门槛。

需要什么配置?

显卡方案

实际部署包是 7.2GB(不是理论值 5.9GB),加上推理时的上下文缓存,12GB 显存就能舒服跑

推荐配置:

显卡价格说明
RTX 3060 12G二手约 1400,复产新卡约 2300性价比之选
RTX 4070 12G老卡直接用
RTX 5060 Ti 16G约 420016G 显存上下文更长

统一内存方案

苹果 Mac 16GB 即可运行。苹果的统一内存 CPU、GPU 共用,装下 7.2GB 的模型主体,16GB 内存就能跑。

如何部署?

模型运行工具:llama.cpp(推荐,官方原生支持)

因为 llama.cpp 在苹果和 Windows 电脑下的部署代码不同,且每个人的 llama.cpp 文件位置不同,所以这里不贴详细教程。感兴趣的可以去官方模型卡探索,有具体教程,不懂问豆包就行,难度不大。

官方模型卡网址:https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

其他说明

  • 电脑版装不进手机:7.2GB 超过了 iOS 单个 App 约 6GB 的内存上限。手机部署得用专门的 1-bit 手机版,用 MLX Swift 跑,官方测试装进了 iPhone 17 Pro Max,输出 11 tok/s。(手机版可以用电脑部署)
  • 实际占用比理论值大:理论上 1.71 比特能做到 5.9GB,但目前 llama.cpp 的量化槽位是按 2-bit 打包存的,实际部署包变成 7.2GB,多出来的 1.3GB 是给量化槽位留的余量。等专门的三值原生内核出来,才能真正压到 5.9GB。
  • 智能体编程还不太行:官方自己在限制说明里承认,长链路、多文件、边写边测边改这种"重度写代码"的 agentic coding 场景,这个版本还不够稳。
  • 指令遵循也有一定损耗:从 78.47 掉到 71.77,复杂多条件的指令偶尔可能漏掉细节。

总结

这次"三值量化"这个压缩技术,把单卡 27B 模型的硬件门槛给打下来了,从"顶级显卡"压到了"主流显卡"。随着技术快速发展,等有了原生内核,门槛还会降一点。手机跑 27B 满血能力的模型指日可待,目前虽然也能跑,但只有 9 层功力。


如果想了解更多 AI 大模型本地部署,欢迎关注原作者 黑虾