“一张卡跑 70B”这句话的成立条件比想象中苛刻。我把三种量化方案在两张常见的消费级显卡上跑了一遍,把真实数字摆出来。

显存账

70B 模型 FP16 需要 140GB,这直接宣告单卡出局。量化之后:

  • INT8 约 70GB —— 仍然装不进单张 48GB 卡,需要双卡或卸载到内存;
  • INT4 约 35GB —— 单张 48GB 卡可以,但要留足 KV Cache 空间;
  • 混合精度(关键层 FP16)约 46GB —— 紧巴巴,长上下文容易 OOM。

速度代价

显存省下来了,速度也要付账。卸载到内存的那套方案在长上下文下速度掉到每秒 2 token,基本不可用。

实用建议

如果你的卡是 24GB,别硬上 70B,30B 档位的体验好得多。本地部署真正的价值在于隐私和可控,而不是跟云端比速度。