个人项目[my-jev]:复刻 JEV 的毫秒级文本判断服务,从立项到 API 上线的全过程
背景:我想复刻的东西是什么
最近看到一个叫 JEV 的产品(TypeSafe 出品),它做的事很有意思:给定一段共享上下文(state)和一组问题,一次性返回所有问题的判别结果——不是生成式地一个一个写答案,而是"判断"。官方宣称比传统 LLM 工作流快 193.6×、便宜 444.6×。
它的几个可观察行为很吸引我:
- 没有首 token 等待:判别类任务不需要等自回归解码出第一个 token,单次前向就能出结果;
- 零非法选项:输出只可能是你声明的候选之一,不会"幻觉"出一个没提供的选项;
- 多问共享 state:同一上下文下的一堆问题摊薄 prefill 成本,问得越多越划算。
但 TypeSafe 没公开它的架构、参数量、训练数据,那套 RLCD 也摸不到。所以我的目标定得很实际:复刻它的可观察能力和工程效果,不复刻它没公开的内部实现。本文记录这条路的完整过程——立项、调研、基线、一路踩坑、对比 benchmark、蒸馏、写 API、上线,所有数字都可复现。
内网主机名/IP 等敏感信息一律隐去(下文用"GPU 验收机"指代),仓库代码见文末。