电脑本地端AI 模型近年可说变得越来越强大,很多基础工作、程式用本地AI 就能做到,也因此很多人一定也会希望能在手机上运行。虽然过去手机就已经能跑一些本地AI,但受限于记忆体、效能与模型大小,能够流畅运行的模型通常规模有限,实际使用体验跟电脑上的大型模型还是有一段差距。好消息是,随着iPhone 18 Pro 系列推出,这样的情况似乎开始有一些变化了。
最近有国外开发者实测在iPhone 18 Pro 上运行本地27B、也就是270 亿参数的AI 模型Bonsai 27B,结果显示,相较去年的iPhone 17 Pro,生成速度直接提升到约两倍。更重要的是,整个模型完全在手机本地运行,不需要连接云端。隔一代就有这么明显的提升,也让人越来越期待未来手机本地端AI 的发展。

iPhone 18 Pro 本地端AI 实力曝光! A20 Pro 跑27B 参数模型速度是iPhone 17 Pro 的两倍
近日一位国外开发者Adrien Grondin 在X 上发布的实测视频:他使用iPhone 18 Pro 跑Prism ML 的Bonsai 27B 模型,Token 生成速度大约是iPhone 17 Pro 的两倍。他在贴文里写道:「iPhone 18 Pro 的端侧AI 表现比我预期好很多,它跑27B 模型的速度是17 Pro 的两倍。新的A20 Pro 晶片是个怪物。」
Adrien Grondin 也不是随便的路人,他是iOS 本地AI 聊天App「Locally AI」的作者,这款App 今年4 月被LM Studio 收购,他现在负责LM Studio 在Apple 装置上的原生体验。过去他就常拿iPhone 跑各种开源模型做示范,像是在iPhone 17 Pro 上把Gemma 4 跑到每秒40 个Token,所以这次的实测有一定的参考价值。
Bonsai 27B 是新创公司Prism ML 今年7 月释出的开源模型,以阿里巴巴的Qwen3.6-27B 为基底,最大的特点是采用「1-bit 量化」,原本约54GB 的模型档,被压到只剩约3.9GB,理论上有4GB 记忆体的装置就能跑起来。这也是为什么能在iPhone 17 Pro 和iPhone 18 Pro 运行的原因。
Prism ML 之前也公布过iPhone 17 Pro Max 的测试数据,约每秒11 个Token,并宣称这是第一个能在手机上跑的27B 等级模型。
顺带一提,Grondin 这次的贴文只说「两倍」,没有给确切的tok/s 数字。如果用Prism ML 公布的17 Pro Max 每秒11 个Token 去推算,iPhone 18 Pro 大概落在每秒20 出头。
这数字就有实际意义了!因为聊天要读起来像「即时对话」,根据国外报告门槛大约要在每秒15 到20 个Token,iPhone 17 Pro Max 的11 tok/s 会让人觉得一直在等待,而iPhone 18 Pro 如果真的跨过20,那27B 模型在手机上就从「能跑」变成「能用」了。从Grondin 释出的视频也能清楚看到,速度确实很快。

Prism ML 除了1-bit 版之外,还有一个能保留原版95% 的能力2-bit「Ternary Bonsai 27B」,体积约7.2GB,但这个版本对iPhone 18 Pro 来说太大,硬跑效能会掉下来,Prism ML 也定位在笔记本和GPU 使用。 Grondin 也留言说新版Bonsai 2(2 位元版本)太大,无法在iPhone 上运行。
