群里有个朋友昨天问我,手机内存到底买多大才够。我还没回,另一条消息就顶上来了:一个270亿参数的大模型,被人硬塞进了iPhone。
我第一反应是不信。这种量级的模型,平时得躺在数据中心的服务器里,怎么可能跑在一台手机上。
但消息是真的。7月14日,一家叫PrismML的加州理工衍生公司发布了Bonsai 27B,用原生1-bit压缩,把一个原本54GB的大模型压到了不足4GB。更炸的是,苹果CEO采访里被亲口证实,正在认真评估这项技术。
这事值得好好聊聊。

54GB到3.9GB,它不是裁剪,是把每个像素只留黑白两色
先说PrismML是谁。它脱胎于加州理工的研究团队,核心专利由校方独家授权,2026年3月拿到1625万美元种子轮,Khosla Ventures领投,Cerberus、谷歌、三星也在名单里。Khosla是当年OpenAI的首轮投资方,这份履历不算差。
它的底座,说出来挺有意思,是阿里巴巴开源的通义千问Qwen3.6,27.8B参数。一个中国开源模型,被压缩后跑进了iPhone,这个组合我觉得比技术本身还耐人寻味。
传统大模型有多贪。27.8B参数在FP16全精度下,每个参数占2字节,加起来约54GB。这远超任何一台iPhone的物理极限。就算用激进的4-bit压缩,也还有约18GB,手机照样装不下。
PrismML的打法很极端,原生1-bit量化。
打个比方你就懂。以前一张照片,每个像素保留16级灰度,从纯黑到纯白。现在只留两种,非黑即白。单看每个像素,信息几乎全丢了。可你退后一步,那张脸还认得出来。因为脸从来就不藏在单个像素里,而在整体的分布里。
具体到模型上,PrismML把每个权重从复杂的浮点数,压成只用{-1,+1}两个值表示,配合分组缩放因子,每128个权重保留一个16位的缩放因子来锚定输出质量。这套方法在整个模型上全量执行,没给传统量化里那种”高精度逃生通道”留后门。
效果确实夸张。体积缩到全精度的约1/14,内存占用暴降超90%,官方宣称推理速度最高提升8倍,能耗降低75%到80%。
它出了两个版本。1-bit Bonsai 27B,3.9GB,保留约90%的基准得分。三值版Bonsai 27B,5.9GB,保留约95%。
一个27B级的”大脑”,就这么被塞进了一台手机。

90%的智商换93%的瘦身,那10%的缺口会不会让人抓狂
别光看参数爽。压缩即失真这条铁律,谁也绕不过。
CEO巴巴克·哈西比在CNBC采访里说得很坦白,量化后的模型在事实记忆、数学和编程上明显变弱。官方15项基准显示,基线综合分85.0,三值版80.5,1-bit版76.1。换算下来,1-bit保留约90%,三值约95%。
但真正扎心的不是平均分,是它砍得不均匀。
数学能力只掉了3.8%,工具调用却从80.0直接砸到66.0,降幅17.5%,是数学的4.6倍。而工具调用,恰恰是AI代理帮你自动开App、订餐厅、填表格这类活儿的命门。我算过一笔账,一个跑10步的Agent流程,每步95%成功率,最后只剩60%;每步92%,就只剩43%。几个百分点的差距,在多步场景里会被指数放大成灾难。
社区测试也印证了这点。有人反馈三值版相比常规的Q4量化仍有幻觉、Agent循环打转的问题,唯一的强项是体积小,基本做到用5.9GB媲美17.9GB的效果。还有开发者在安卓demo上直接跑出了一串乱码。
发热也是个坎。据Logicity和Notebookcheck的报道,持续推理五分钟多一点,芯片就开始降频。短问短答没事,真要让它常驻后台跑代理任务,电量和温度都扛不住。而且这些数据大多来自厂商自己,第三方独立复现目前还很少。
顺带纠正个常见误读。笔记本版的实际下载大小在7.2到8.5GB之间,这个差异不是因为运行时长,而是封装格式不同,llama。cpp约7.2GB,MLX约8.49GB。目前也没有面向普通用户的现成App,能玩的还是开发者和技术爱好者。

苹果为什么心动,隐私、离线、省钱这三笔账
苹果对端侧AI的执念,人尽皆知。痛点也很现实。
现在的Siri和Apple智能,要么靠小模型凑合,要么得连它的私有云。苹果自家最能打的端侧模型,是WWDC 2026上亮相的AFM 3 Core Advanced,约200亿参数,但用的是稀疏激活,单次只调用10到40亿参数,而且最强的本地模型得配12GB内存才跑得动。
要是把一个27B级的稠密大模型整个塞进手机本地,意味着什么。
第一笔是隐私账。数据不出设备,敏感推理全在芯片里转。分析师举的例子是健康和用药数据,这类信息用户最不想交给服务器。你在设备上能做的越多越好。
第二笔是离线账。地铁、飞机、没网的地方,AI摘要、编程辅助、事实推理照跑不误。
第三笔是成本账。少养点云端算力,这钱苹果算得精。更小的模型能让它在不加内存的前提下,塞进更强的AI。
哈西比在采访里画了张更大的饼:大约三年后,人们需要的智能里约95%能在手机、笔记本、家电本地完成,只剩5%进云端。这话听着漂亮,能不能兑现是另一回事。
这里得给国内朋友泼盆冷水。iOS 27公测版7月13日起已经推送,iPhone 11及以后机型都能升,正式版9月随新机走。但苹果官方明确说了,为配合国内监管,Apple智能和全新Siri AI在中国大陆暂不提供。也就是说,国行用户升上去,主打的AI新特性目前还用不了,能享受的是底层性能优化和调休闹钟这类本地功能。这场端侧AI的热闹,国行暂时只能隔岸看。

收购还是合作,现在谁都说不准
不过,事情没那么一边倒。
彭博社的马克·古尔曼7月15日发推唱衰,认为苹果大概率不会收购PrismML,所谓”正在评估”也可能没下文。他的原话大意是,这家公司CEO或许接触过苹果,但双方应该没有实质进展。
科技媒体Wccftech的解读更狠:PrismML主动公开”苹果正评估”,反而降低了苹果采用的可能。按苹果一贯的性子,产品落地前通常极其低调,最烦这种讨论提前跑到公众视野里。
但也有另一派声音。The Information早在7月9日就报道过苹果对PrismML的兴趣,谈判范围据说涵盖授权,甚至不排除直接收购。到底怎么走,哈西比自己都只敢说”非常早期””进展顺利”。
我个人偏向谨慎。技术是真突破,但从谈判桌到你手机里的功能,中间隔着一条又深又长的沟。

未来的手机AI战争,可能从拼云端转向拼压缩
抛开收购悬念,技术本身的突破是实打实的。
现在旗舰手机吹的端侧AI,实际搭载的模型基本都在7B或更小,绝大多数生成能力还得靠云端。PrismML证明了一件事:端侧大模型不再被内存死死绑在云上。
它用”智能密度”来衡量成果,每GB能装多少智能。1-bit版Bonsai 27B的智能密度约为全精度基线的10倍。当iPhone这种存量机型都能跑27B模型,未来的手机AI战争,重心可能要从”拼云端算力”挪到”拼压缩算法”。
那普通人到底什么时候能用上。乐观估计,如果苹果评估通过并决定采用,最快也得等下一代iOS的大版本,更现实的时间线可能是2027年甚至更晚。技术有了,产品化还得慢慢磨。至于你手上的机器能不能跑,1-bit版实际需要12GB内存的iPhone,目前只有iPhone Air、iPhone 17 Pro和17 Pro Max达标,iPhone 15 Pro是8GB,理论上跑不了完整版。PrismML说这技术能让iPhone 15及以后机型运行27B模型,具体怎么实现,我持保留态度,还得等验证。
好在这条路,已经有人蹚出第一步了。Bonsai 27B现在就在Hugging Face上开源,Apache 2.0许可,开发者和技术爱好者能直接下来试。剩下的,交给时间。
最后留个问题给你。如果有一天,AI真住进了你的手机,不再需要时刻联网,你的使用习惯会变成什么样。哪些隐私你会更放心地交给手机来处理。评论区聊聊。

微信扫一扫
支付宝扫一扫
