千问3.6 27B本地推理速度优化:从20到184 Token/秒

Source: (unknown)

Summary

系统测试Qwen3.6 27B在4090显卡上的多种推理优化方案,通过量化(GGUF Q4KM / AWQ)、MTP投机解码和DFlash扩散解码实现最高10倍速度提升。基线FP8精度仅20 token/秒,开启AWQ量化达48,叠加MTP n=5达108;DFlash峰值可至184 token/秒。重点讨论了多Agent编排(Claude Code Agent Teams等高并发coding场景)对本地高并发推理的刚需,以及TurboCrown将KV Cache压缩4倍使24G显存跑200K上下文的可行性。结论:量化+MTP是当前生产环境最稳定的提速路径,DFlash尚不成熟但潜力极大。

Key Points

  • FP8基线4090单卡仅20 token/秒,量化到Q4KM后Llama.cpp达45,vLLM AWQ达48
  • MTP(Multi-Token Prediction)投机解码:n=5时AWQ达108 token/秒(+124%),FP8达72(+260%)
  • DFlash扩散式投机解码:峰值184 token/秒,但尚不支持多并发且工具调用不稳定
  • DD Tree(Diffusion Draft Tree):22条备选路径并行探索,LooseBox在3090上实测207 token/秒
  • TurboCrown将KV Cache从FP16压缩至3-4bit,精度几乎无损,24G显存可跑200K上下文
  • 推测解码加速效果与任务类型强相关:数学题>写代码>创意写作;多Agent coding是最适合的场景
  • 双卡主要优势在上下文容量和高并发吞吐,单并发速度提升有限(4090无P2P通信)
  • 作者当前生产环境用FP8+vLLM+MTP,10并发约500+ token/秒

Transcript

transcript