端侧推理今年最大的变化不是算力,而是内存带宽。当模型能被塞进 NPU 的 SRAM 时,速度会突然上一个台阶;一旦掉到 DRAM,再强的算力也救不回来。
我们测了什么
六款主流移动芯片,同一个 7B 模型,三档量化(INT8 / INT4 / 混合精度),记录首 token 延迟、稳定生成速度和整机功耗。
结果
- INT4 让模型体积减半,但长文本任务上出现了明显的逻辑断裂;
- 混合精度是目前最实用的折中,速度损失 8%,质量几乎无损;
- 有两款芯片标称算力很高,但受限于带宽,实际生成速度只有第一梯队的一半。
该期待什么
短期别指望手机跑 70B。真正的拐点在内存:当端侧内存带宽再翻一倍,端侧 agent 才有机会真正可用。