用 sgLang + DFlash2 在 4 张 RTX 3090 上跑通 Qwen3.8-27B FP8:部署记录与踩坑
背景与目标
手头几台实验室服务器都是消费级显卡(RTX 3090 24G×4 / ×8),之前用 vLLM 部署 Qwen3.8-27B 时体验很一般:BF16 权重 52G,tp=8 摊到每张卡上解码速度也就几十 tok/s,长上下文 prefill 更是慢。目标是又快又准、上下文尽量大,并且不碰机器上已有的任何服务和数据(共享机器,上面有 gluster、AIGC 服务、一堆 docker 容器)。
这篇文章记录从 0 到上线的完整过程,包括驱动升级、镜像选择、参数调优、DFlash2 投机解码接入,以及后续的 sgLang-router 缓存感知负载均衡。所有内网 IP、主机名等敏感信息均已隐去,用 node1 / node2 代称。