Bonsai 27B:可在手机上运行的270亿参数模型
Bonsai 27B 正式发布:基于Qwen3.6 27B打造的多模态旗舰模型,首款可在手机运行的同量级模型
此前我们发布的模型已证明,采用1比特与三进制权重的模型可产出具备商用价值的语言模型。而Bonsai 27B将这一技术边界推向了全新能力层级:支持多步骤推理、结构化工具调用、视觉任务,以及能在多步骤中保持逻辑连贯的计算机代理循环。此前,这类模型的本地部署一直难以实现,核心原因在于:27B参数模型以16比特精度运行时约占54GB内存,即便是优化后的4比特版本也需18GB,远超手机及多数笔记本电脑的承载能力。
Bonsai 27B打破了这一限制,推出两个版本:
三进制Bonsai 27B 采用{-1, 0, +1}三进制权重搭配FP16分组缩放,每权重有效比特数达1.71。该版本以性能为导向,仅需5.9GB内存,可在普通笔记本电脑上运行,完整支持推理、工具调用及代理功能。
1比特Bonsai 27B 采用{-1, +1}二进制权重搭配相同分组缩放,每权重有效比特数为1.125。该版本以轻量化为导向,仅占3.9GB内存,可适配iPhone 17 Pro的内存预算,首次将27B量级模型带入手机端。
与所有Bonsai系列模型一致,低比特表示贯穿整个语言网络、嵌入层、注意力机制、多层感知器(MLP)及语言模型头部,全程无高精度逃逸机制。两个版本均为多模态模型,视觉塔以紧凑的4比特形式交付,支持设备端处理截图、文档、摄像头输入等视觉内容,而非仅能处理文本。Bonsai 27B支持262K-token的完整上下文窗口,并配备投机解码技术,通过无损草稿-验证机制进一步提升运行速度。所有资源现已开放,遵循Apache 2.0许可协议。
智能性能近乎无损
我们在涵盖知识、推理、数学、编码、指令遵循、工具调用及视觉领域的15项基准测试中(采用思维模式评估,充分调动模型完整推理能力),三进制Bonsai 27B保留了全精度基线模型95%的性能,1比特版本则保留90%。
图一:Bonsai 27B(思维模式)与全精度基线模型的基准测试得分对比。各测试项详细结果见白皮书。
按能力维度拆解表格数据,会发现比平均数值更亮眼的表现:数学与编码能力几乎未受损失,工具调用性能与全精度模型仅相差数个百分点——而这些正是代理类任务最核心的能力。对比而言,同基础模型的极致压缩版传统低比特模型,不仅性能显著低于1比特Bonsai 27B,内存占用更是后者的2.5倍。
这延续了我们此前在语言及图像模型中实现的帕累托优化,如今将其拓展至27B量级:以低于全精度2B模型的内存占用,实现27B量级的模型能力。按照我们在1比特Bonsai 8B中提出的智能密度指标计算,1比特Bonsai 27B每GB可提供0.53的智能密度,是全精度基线模型的10倍以上,约为现有最优低比特替代方案的2.7倍。

范式转变的重要意义
当前,最具价值的AI工作负载正从单次响应转向持续任务:例如能操作实体工具的助手、可无人值守运行直至返回结果的工作流、能整合数十份文档的研究工具。这一转变重塑了工作负载形态——代理并非仅调用一次模型,而是要完成数百次调用,每一次都需携带上下文、生成结构化输出,并为下一次调用提供输入。
云API仍是众多产品的合理选择,但对于代理类任务,纯云端执行存在结构性局限:每一步操作都需远程请求,逐token成本随迭代不断累积,且所有规划、工具调用及中间结果(包括用户的私人文件、屏幕内容与数据)都需通过网络传输。
本地运行则彻底改变了这一格局。当具备持续代理能力的模型可在设备端部署时,代理就能嵌入产品内部:百步骤循环的边际成本为零,用户数据全程无需离开设备。这将催生出全新应用品类:常驻设备端的代理、可离线工作的助手、能处理本地私密数据的推理助手。此前缺失的,正是一款既足够小巧可本地部署、又具备可靠工作能力的模型——Bonsai 27B填补了这一空白。
它还解锁了全新系统架构:混合部署模式。将非前沿任务及隐私敏感任务交由本地高性能模型处理,仅将最复杂的步骤交给云端前沿模型,从而大幅降低代理系统的单任务成本。
Bonsai 27B的运行速度表现如下:在NVIDIA GeForce RTX 5090上,1比特版本可达163 tok/s,三进制版本可达134 tok/s;在M5 Max芯片上,1比特版本可达87 tok/s,三进制版本可达58 tok/s。
适配手机的难度远高于单纯的存储数值。手机不会向应用开放全部内存——例如12GB内存的iPhone,仅能为模型提供约6GB的设备端可用空间,且模型需与KV缓存及激活数据共享这一预算。传统27B模型的任何版本都无法满足这一要求,而约4GB的1比特Bonsai 27B不仅成功适配,还预留了运行空间。
正是基于这一限制,我们针对性推出两个版本:三进制版本面向追求高性能的笔记本电脑,1比特版本面向追求轻量化的手机端。
技术边界持续拓展
每一代Bonsai模型都在推动每GB内存智能密度的边界,而Bonsai 27B则将其推过了一个关键实用阈值:集思维推理、多模态理解、视觉处理、可靠工具调用于一体的现代模型完整能力,如今可在人们日常使用的设备上运行。
我们认为,智能密度将成为下一阶段AI发展的核心指标之一。原始能力决定模型能做什么,而密度决定模型可以在哪里做。技术边界的每一次突破,都会拓展先进AI可运行的设备、产品与场景,并改变从手机到单GPU服务器等所有部署场景的成本结构。Bonsai背后的方法论不依赖特定模型架构,技术边界仍将持续推进:更大规模的模型与全新架构已在研发中。
早期计算机占据整间屋子,如今却能装进我们的口袋。AI智能正经历同样的演进历程,而Bonsai 27B是这一进程中迄今为止最大的一步。
平台支持
Bonsai 27B可通过为其混合注意力架构定制的低比特内核,在苹果设备(Mac、iPhone、iPad)上基于MLX原生运行,在NVIDIA GPU上基于CUDA原生运行。模型权重现已开放,遵循Apache 2.0许可协议。本次发布同时提供限时免费的开发者预览API,方便开发者快速体验模型能力。
关于模型压缩、评估及基准测试的完整技术细节,可查阅我们的白皮书。
加入我们
PrismML源自加州理工学院研究团队,在Khosla Ventures、Cerberus及Google的支持下创立,且持续获得Samsung的支持。多年来,我们一直致力于攻克AI领域最具挑战性的难题之一:在不牺牲推理能力的前提下压缩神经网络。
若你有志于打造下一代顶尖AI技术,欢迎与我们联系。请访问我们的招聘页面。