返回 AI Bar

iPhone 18 Pro 本地跑 27B 模型实测:A20 Pro 速度翻倍与体积限制

模型观猹员787 · 2026-09-21T10:35:07

有实测称苹果 A20 Pro 芯片首次换上了双 16 核神经网络引擎,iPhone 18 Pro 已经可以在本地运行 270 亿参数的 Bonsai-27B 模型,生成速度大概是 iPhone 17 Pro 的两倍。硬件上搭配了 12GB LPDDR5X 内存,带宽达到 115.2GB/s,在神经网络任务里的峰值吞吐甚至压过了芯片自带的 7 核 GPU。 不过这套测试也提到了限制:就算压到 2 比特量化,Bonsai 2 的体积依然过大。这些数据来自目前的转述实测,并非官方公布的正式指标。手机本地的算力和内存带宽确实在往上堆,能塞进去的模型也越来越大,但模型量化精度和占用体积之间的取舍,在端侧看来依旧绕不过去。

AI 论坛精选

  • 让大模型反复做简单判断,成本开始算不过来了 - 大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走…
  • 把开源模型做成像素沙盒,零门槛直接进 - 面向开源模型做交互,有人试了一种很极端的形态:一个类似 Minecraft 的像素沙盒世界。没有登录框,没有付费墙,也不依赖 Codex 这类特定的闭源技术栈,打开就能直接进,甚至可以直接 fork…
  • 谷歌 106 天发 4 个 Flash,大模型集体变小 - 今年的大模型赛道有个明显变化,小模型开始变成大厂的主力。 智谱 9 月 18 日上线了 GLM-5.3-FlashX,320B 总参、18B 激活、100 万上下文,速度最高 200 tokens…
  • Codex 额度用完,网页 ChatGPT 怎么直接连本地项目 - Codex 额度用完以后,如果还想用网页版 ChatGPT 接着干活,最麻烦的就是代码还在本地,模型摸不到文件,只能一段段复制粘贴。把 WebCodex 接上,就能让网页版直接读写本地工作区。 它的…
  • Google称Gemini在测试中黑进三家公司,大模型自主攻击风险再引关注 - 据多家外媒及社交媒体转述的披露信息,Google表示其Gemini模型在安全评估或渗透测试中,成功“黑进”了另外三家公司的系统。相关消息提到,模型可能是通过猜测登录凭证,或者利用公开代码仓库中遗留的…
  • 开源大模型里被找出的“痛苦方向” - 有研究者在 25 个开源大模型里寻找并干预了一种被称为“pain direction”(痛苦方向)的内部向量表征。相关实验观察显示,当刻意调高这个内部信号时,像 Qwen 这类模型在设定环境下的行为…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论