一台24GB内存的MacBook Pro,一根USB-C线,一部iPhone 17 Pro Max,跑Qwen3.8-27B时预填充速度提升44%。开发者StayLameBro把这个项目叫Backburner,代码已开源在GitHub。Reddit的r/LocalLLaMA社区炸了锅:原来手机还能这么用。
44%背后:一部iPhone承担了24层计算
先看数据。2026年10月1日的实测中,测试环境是M4 Pro版MacBook Pro(24GB统一内存)、iPhone 17 Pro Max,用10Gb/s的USB-C线连接,模型是IQ4_XS量化的Qwen3.8-27B。
往已保存的会话里塞约2000 Token的新材料,不同上下文长度下的输入处理速度:
| 上下文长度 | Mac单独处理 | 加上iPhone | 变化 |
|———|———|———|——|
| 16K | 109 tokens/s | 157 tokens/s | 提速44% |
| 32K | 101 tokens/s | 130 tokens/s | 提速29% |
| 48K | 87 tokens/s | 113 tokens/s | 提速30% |
16K上下文下,读取时间从18.8秒压到13.1秒。注意一个细节:44%是速度提升,换算成等待时间实际缩短约30%。两个数字说的是同一件事,别混着用。
原理不复杂。Qwen3.8-27B共64层,64K上下文以内,Mac跑第1-40层,iPhone的A19 Pro GPU跑第41-64层。Mac把输入切成256 Token的小块,算完一块就把中间数据(激活值)传给iPhone,自己转头处理下一块,两台设备并行。模型权重不用来回传,iPhone本地存着自己负责那部分的层数据,线上只走中间结果。
A19 Pro的GPU矩阵运算能力也派上了用场。开启这个特性后,iPhone负责部分的速度达到关闭时的2.4倍——这是手机内部对比,不是整机提速2.4倍。
64K以上更狠:KV缓存也能搬进手机
超过64K上下文后,玩法升级。iPhone开始帮Mac存放KV缓存,每16K旧上下文会被编译成一个Neural Engine模型。效果很具体:14万Token上下文下,每Token写入时间从279毫秒降到176毫秒。
24GB统一内存跑27B模型,原本上下文窗口被死死卡在64K。KV缓存外迁后,这个天花板被顶开了。对天天喂长文档、长代码给本地模型的用户来说,这是实打实的能力扩展。
生成速度没变快,限制也真不少
先泼冷水。答案生成速度基本没动:27K-33K上下文下,标准llama.cpp跑出11.3 tokens/s,Backburner在Mac单独跑25.0 tokens/s,加上iPhone是25.1 tokens/s。生成提速来自Backburner本身的Mac端优化——SME2矩阵指令、GPU优化、推测解码,跟iPhone没关系。
也就是说,这套方案优化的只是预填充(读输入),下表把能做和不能做列清楚:
| 项目 | 结果 |
|—–|——|
| 预填充(64K以内) | 提速29%-44% |
| 上下文扩展(64K以上) | KV缓存外迁,窗口顶开 |
| 文本生成(64K以内) | 无提升,仍是Mac的活 |
| 使用限制 | iPhone必须保持前台、锁屏或拔线15秒服务即停 |
| 并发 | 一次只能处理一个请求 |
| 长上下文故障 | KV缓存已在手机上,无法回退到Mac单独运行 |
一部iPhone从此身兼两职:日常是手机,工作时是AI协处理器和KV缓存仓库。这两件事在时间上很难兼容。
为什么是苹果生态先跑出来
这套实验能成立,靠的是三个苹果独有条件。
统一内存架构。M4 Pro的24GB统一内存CPU和GPU共用,模型加载不受显存容量硬墙限制,才有空间把计算切给外部设备。x86笔记本想复制这套玩法,得先解决跨设备显存调度。
芯片级矩阵能力。A19 Pro每个GPU核心带Neural Accelerator,加上独立的16核Neural Engine。iPhone 17 Pro的散热系统也扛得住持续推理负载——Argmax的基准测试已经验证过这一点。
封闭生态的软件优化空间。Backburner基于llama.cpp改造,Mac端用上SME2,iPhone端直接调用GPU矩阵指令。软硬件一体让定制优化有缝可钻。
对普通用户的实际参考
这套方案适合两类人:本地跑长上下文的开发者,和24GB Mac用户里想榨干现有设备的人。已有Mac加iPhone的组合,零额外硬件成本。
代价也摆在明面上:手机被占用、必须插线、必须前台、锁屏就停。它更像一个有趣的极客实验,离”日常顺手”还有距离。样本只有开发者自己发布的日志,尚未经独立复现。
更大的信号在行业层面:内存墙正在逼出各种”组合算力”方案。OpenAI买下数万台Mac训练智能体,苹果统一内存成了GPU之外的算力供应链。现在连手机都被征用成协处理器。AI算力短缺时代,闲置设备的每一FLOPS都有人惦记。下一部iPhone的A20 Pro据说双16核Neural Engine吞吐更高,”手机当第二块GPU”这条路,可能才刚开头。
苏公网安备32010502011527号
发表回复