用 sgLang + DFlash2 在 4 张 RTX 3090 上跑通 Qwen3.8-27B FP8:部署记录与踩坑

背景与目标

手头几台实验室服务器都是消费级显卡(RTX 3090 24G×4 / ×8),之前用 vLLM 部署 Qwen3.8-27B 时体验很一般:BF16 权重 52G,tp=8 摊到每张卡上解码速度也就几十 tok/s,长上下文 prefill 更是慢。目标是又快又准、上下文尽量大,并且不碰机器上已有的任何服务和数据(共享机器,上面有 gluster、AIGC 服务、一堆 docker 容器)。

这篇文章记录从 0 到上线的完整过程,包括驱动升级、镜像选择、参数调优、DFlash2 投机解码接入,以及后续的 sgLang-router 缓存感知负载均衡。所有内网 IP、主机名等敏感信息均已隐去,用 node1 / node2 代称。

阅读更多

个人项目[my-jev]:复刻 JEV 的毫秒级文本判断服务,从立项到 API 上线的全过程

背景:我想复刻的东西是什么

最近看到一个叫 JEV 的产品(TypeSafe 出品),它做的事很有意思:给定一段共享上下文(state)和一组问题,一次性返回所有问题的判别结果——不是生成式地一个一个写答案,而是"判断"。官方宣称比传统 LLM 工作流快 193.6×、便宜 444.6×。

它的几个可观察行为很吸引我:

  • 没有首 token 等待:判别类任务不需要等自回归解码出第一个 token,单次前向就能出结果;
  • 零非法选项:输出只可能是你声明的候选之一,不会"幻觉"出一个没提供的选项;
  • 多问共享 state:同一上下文下的一堆问题摊薄 prefill 成本,问得越多越划算。

但 TypeSafe 没公开它的架构、参数量、训练数据,那套 RLCD 也摸不到。所以我的目标定得很实际:复刻它的可观察能力和工程效果,不复刻它没公开的内部实现。本文记录这条路的完整过程——立项、调研、基线、一路踩坑、对比 benchmark、蒸馏、写 API、上线,所有数字都可复现。

内网主机名/IP 等敏感信息一律隐去(下文用"GPU 验收机"指代),仓库代码见文末。

阅读更多
Your browser is out-of-date!

Update your browser to view this website correctly.&npsb;Update my browser now

×