个人项目[my-jev]:复刻 JEV 的毫秒级文本判断服务,从立项到 API 上线的全过程

背景:我想复刻的东西是什么

最近看到一个叫 JEV 的产品(TypeSafe 出品),它做的事很有意思:给定一段共享上下文(state)和一组问题,一次性返回所有问题的判别结果——不是生成式地一个一个写答案,而是"判断"。官方宣称比传统 LLM 工作流快 193.6×、便宜 444.6×。

它的几个可观察行为很吸引我:

  • 没有首 token 等待:判别类任务不需要等自回归解码出第一个 token,单次前向就能出结果;
  • 零非法选项:输出只可能是你声明的候选之一,不会"幻觉"出一个没提供的选项;
  • 多问共享 state:同一上下文下的一堆问题摊薄 prefill 成本,问得越多越划算。

但 TypeSafe 没公开它的架构、参数量、训练数据,那套 RLCD 也摸不到。所以我的目标定得很实际:复刻它的可观察能力和工程效果,不复刻它没公开的内部实现。本文记录这条路的完整过程——立项、调研、基线、一路踩坑、对比 benchmark、蒸馏、写 API、上线,所有数字都可复现。

内网主机名/IP 等敏感信息一律隐去(下文用"GPU 验收机"指代),仓库代码见文末。

阅读更多
Your browser is out-of-date!

Update your browser to view this website correctly.&npsb;Update my browser now

×