全部文章

Jev 不写字,只做判断

约 7 分钟
·更新于
2020 字
目录· 8 个章节

这两天时间线被 Jev 刷了一遍。 前 OpenAI 的人出了个模型,海报上写 200 倍快、400 倍便宜、零幻觉。 还有人拿它打 Doom、打杀戮尖塔,画面都没看清,操作已经出去了。

先把结论定住:

  • Jev 不是下一代 ChatGPT。
  • 它不聊天,不写代码,不解释自己。
  • 它吃一段 state,加一组你事先定好的问题,吐回带概率的判断。
  • 快是真的。神不是。

翻成人话:以前你让大模型既想清楚、又写成一段话给你看。 Jev 把「写成一段话」砍掉了,只留判断。 判断快、便宜、格式不会跑飞。 文章、理由、方案,它没有。

谁做的

公司叫 TypeSafe AI,旧金山。 2026 年 9 月 15 日结束两年 stealth,顺手公布了 4000 万美元种子轮,DCVC 领投。

创始人 Diogo Almeida,InstructGPT / RLHF 那拨人里的。 ChatGPT 能听人话,有他一份。 这回他反过来做了个「不说话」的模型。 名字取自 Jevons paradox。他们自己起的品类叫 System One Model,借的是卡尼曼那套:快的、直觉的 System 1。

品类名是他们起的,不是学界已经认下来的分类。 先当产品名看。

一次请求长什么样

输入两样东西:

  1. state。可以是工单、日志、JSON、Agent 跑到一半的痕迹,甚至游戏里整理过的状态。
  2. 问题。不是开放提问,是你先把答案空间锁死。

问题只有三种:

  • Choice:从你给的选项里选一个
  • Score:按你定的量表打分
  • Noul:这句话为真的概率,0 到 1

一次请求可以混着问。 问题之间互相不看,都对着同一份 state。 多问几个,延迟几乎不涨。

客服工单可以一次问完:

  • 意图:退款 / 物流 / 技术 / 投诉 / 垃圾
  • 紧急度:1 到 5
  • 要不要转人
  • 像不像在闹情绪

回来的不是一段客服话术。 回来的是选项、分数、概率。 分支写在你自己的代码里。

定价现在是输入 $0.042 / 百万 token,输出免费。 官方延迟 70–500ms。 Early access,要排队拿 key。

跟现在的大模型差在哪

| | 现在的前沿 LLM | Jev | |---|---|---| | 输出 | 文本,还要解析 | 类型化决策,代码直接吃 | | 采样 | 一个 token 一个 token 往外吐 | 一次前向,问题并行 | | 训练 | RLHF / RLVR | RLCD,冲着校准概率去 | | 延迟 | 秒到几十秒 | 70–500ms | | 输入价 | 常见 $0.20–$10 / MTok | $0.042 / MTok | | 输出价 | 通常更贵 | 免费 | | 能做的事 | 写、聊、解释、开放推理 | 在你给定的答案里选、打分、判真假 |

说白了,大模型是思考和叙述绑在一起。 Jev 只做思考里那一小截:下一步走哪条路。

架构大概率也不是全新物理。 有人拿大约一万次 API 探针看,更像预训练过的 causal transformer,state 只 prefill 一次,每个问题单独开一条 branch,最后直接读出概率。 新的是接口和推理形态,不是另一种大脑。 权重和论文都没公开。这块我不确定。

快和便宜,哪些数能信

官方海报最高写过 193.6 倍快、444.6 倍便宜。 对照的是完整生成流程的前沿模型,题是他们自己的工作流写的,参考答案还是 GPT-6 Astra 和 Claude Fable 5.1 的平均。 这套评测偏向自己选的题型。把上限当均值,别。

能看的数在这:

  • 自家四组工作流,Jev 均准 67.8%,单次大约 $0.0004、0.4 秒
  • GPT-5.6 Terra 67.9%,大约 $0.0304、10.1 秒
  • Claude Opus 5 73.1%,大约 $0.1761、37.8 秒
  • 发票那组 Jev 只有 61.8%,对家最高到 79% 附近
  • 客服那组最好,76.0%

Every 自己测过:37 篇文档、每篇 21 问,777 次判断,不到 0.7 秒,大约四分之一美分。 另一组写作缺陷对照,Jev 中位 0.35 秒,Fable 5.1 高力度 8.83 秒,大约 25 倍,不是 200 倍。 7 个埋雷 Jev 找出 6 个,Fable 全找到。

方向对。倍率被海报拉满了。 价格会不会长期补贴,官方自己都说证明不了。

「不能幻觉」锁的是格式

官网爱写 0% hallucination。 精确含义:不会吐 schema 外的值。 不能拼错字段,不能发明第四个部门,不能回你一篇散文。

判断错,照样会。 创始人在 HN 认过:仍然可以自信地选错。

这和现在大模型的 Structured Outputs 是同一类保证。 形状合法,不等于内容对。 选项里没有「以上都不是」,概率还得砸在某个选项上。

置信度也不是许可证。 他们用 RLCD 训练,群体上看,高置信和更高准确率是往一块靠的。 单条仍可能 0.97 且错。 阈值要写在你的代码里,用你的样本标定。 没有标注就上线,那是把营销页当评测。

最适合嵌进哪一层

不是「某个行业的模型」。 是一种任务形状。

四条都满足,才值得接:

  • 答案空间事先锁死
  • 同一判断要重复成上万上万次
  • 延迟和成本比再准 5 个点更重要
  • 低置信可以转人,或转更贵的大模型

最贴的是 AI 系统内部那一层:

  • 这题简单还是难,该给哪个模型
  • Agent 下一步用哪个工具、要不要停、要不要问人
  • 这条 bash / 写文件 / 退款,先过不过
  • 召回的段落相关不相关、像不像注入

发布两天,GitHub 上已经有人拿它做 Codex 路由、Skill 选择、工具调用闸门。 有人替换原来的 LLM 分类器,单次大约 0.65 秒、不到 3 美分的百分之一。 这比拿它打游戏更像正事。

第二档是客服分流、内容审核、类目和评论打标。 量够大,错了可以进队列,不必一次定生死。

招聘筛简历、线索打分、理赔初分,官方 use-case map 都列了。 独立准确率几乎没有。 没有自己的标注集,先别接生产。

不该让它干的活

  • 写回复、写代码、写审计意见。它不会写。
  • 长链推理、开放规划、看图看视频。现在只吃文本和 JSON,上下文大约 32k。
  • 发票自动过账。官方这组准度缺口最大。
  • 安全告警自动封禁。可以分级,不能闭环处置。
  • 已经能用规则和 SQL 写死的判断。别为了用模型而用模型。
  • 错一次不可逆、又没有 fallback 的事。有人拿它炒股。那叫把没标定过的概率当成下单许可。

Doom、Wikiracing、Mario 证明的是延迟够进控制环。 不是「最适合做游戏」。 演示不等于领域。

怎么接到自己的系统里

别问该进哪个行业。 问系统里哪一句 if 现在又贵又慢。

拆法就三步:

  1. 把大判断拆成原子题。意图、紧急、要不要人、要不要升级模型,分开问。
  2. 代码里设三档。高置信自动执行,中间带复核,低置信转大模型或人。
  3. 用自己的线上样本画一条校准线。官方 67.8% 不能当你家的数。

Jev 是决策层,不是业务系统。 大模型还在,负责写和解释,也负责吃掉那些 Jev 自己没把握的案子。

选项上限 255。超出要两阶段,会变慢。 问题要问得窄。官方自己也说了:一个人几秒钟能做的判断,才适合丢给它。多因素揉在一道题里,准度会掉。组合逻辑写在代码里,别写在 prompt 里。

这篇文章是转述。 我还没把它接到自己的产品里跑过一轮。 数字来自官方评测、Every 的当日实测,以及发布后两天的公开探针。 要不要用,看你系统里那句 if 是不是真的又贵又慢。不是看海报上的 200 倍。

相关文章