Skip to content

Jev:拒绝写字的前沿模型

Published: at 10:00 AM
一台维多利亚时代的印刷机吐出长长的空白纸张,旁边是一叠勾选过的选票卡

TL;DR

  • Jev 是一个从不生成文本的前沿模型。你把选项递给它,它一次性并行打完分。
  • 演示是这样的:LLM 花 8.5 秒写出一个结论,Jev 花 0.1 秒——毕竟它读的东西少多了。
  • 交换条件开头就讲明白:不写句子,不给解释,不写代码,没有思维链。
  • 它的落点:模型路由和工具调用护栏——那层一直被锁在闭源编码 harness 里的分类器。
  • 对 CIO 来说,这是一个成本架构的故事,不是能力的故事。

45 秒,讲得比发布会还明白

Jev 由 TypeSafe AI 发布,其 CEO 把这件事定位成对缩放共识的一次挑衅:“为什么超人类聊天模型没有带来 AGI?” 他的答案是:生成本身就是瓶颈。他们用一种叫 RLCD 的方法(reinforcement learning for calibrated decisions,面向校准决策的强化学习)训练了它,宣称分类任务上推理快 20–200 倍、成本低 40–400 倍。

发布视频,不瞒你说,很有力地抵抗了所有被看懂的努力。于是 Matija Sosic 用 45 秒重讲了一遍——这种公共服务在本行业实属罕见:

去 X 上看:@MatijaSosic — a 45-second TL;DR on Jev

他自己解释为什么做这条视频:“我觉得核心想法漂亮得不能再简单,但那个视频真的让人看不懂。“

实际发生了什么

演示跑的是同一个问题——“这张发票是不是欺诈?“——用两种架构各过一遍。

LLM 开始写。计时器在走。一个 token 一个 token 地,它写出:“根据明细项和供应商历史,这张发票似乎是合法的。” 八秒半,就为说这么一句话。

Jev 干的事在结构上完全不同。你的应用提供选项集——FRAUD / CLEAN / REVIEW——Jev 给每一项打分:FRAUD 0.07 · CLEAN 0.88 · REVIEW 0.05。没有 token。一次前向传播,所有选项同时打完。0.1 秒。

然后你读概率、做选择。模型从头到尾没写一个字。它只是指向你的选项之一——像那种选择题全对、但死活不肯动笔写作文的考生,而且理由还很讲原则。

API 的形状由此而来:你发一个 state(上下文)加若干关于它的 questions。问题分三种——choice(从一组里挑)、score(按有序等级打分)、yes/no(某句话为真的概率)。对同一个 state 一次问五个问题,因为它们是并行求值的,多加问题几乎不影响延迟,成本只多出那几个 token。

这笔交易,人家明说了

视频里最有用的画面,是它承认你放弃了什么。

它能它不能
选一个动作写一个句子
分类解释自己
打分 / 排序写代码
路由一步步推理

快 100 倍。

“它放弃了写作,换来了速度。全部的交易就是这一句。”

这份坦白值得领情——虽然这份坦白也给跑分帮了不少忙。

它落在智能体 harness 的哪一层

有两个模式值得在意,而且都在模型周围那一层,不在模型本身。

模型路由。 任务开跑之前先分类,挑最便宜的、能干完的模型。直接查询和小修改交给快而小的模型;架构设计和高风险决策交给前沿模型。这个决策在每次运行开始时做一次,概率留在智能体状态里备查。这活儿毫无光彩可言——而你的推理账单,大头恰恰花在这里。

工具调用护栏。 智能体至今不可信。一句坏指令,或者一个动机足够充分的攻击者,就能把它们推进破坏性的操作。所有严肃的编码 harness 都已经在执行之前对危险操作做分类——人们慢慢学会信任它们,原因正在于此。但那层分类器一直住在 harness 的闭源部分。一个便宜、快速的决策模型让这个模式变得可移植:检查工具调用,给风险打分,在工具运行之前拦下来。

这才是战略上有意思的地方。分类器从来不是难做的科学——它只是过去没人卖给你的那部分。

CIO 视角

把跑分宣言放在一边,这个东西的形状你很熟悉:有人向你兜售一种方法,让你不必再为”决策形状的工作”支付”生成形状的价钱”。

企业里大部分生产级 AI 流量并不需要创造力。它是路由、分诊、分类和把关。让这些流量过自回归引擎,是一个范畴错误:你付一段文字的钱,买回一个标签,还继承了没人会去读的那段文字的延迟。这有点像专门委托人写一份四千字的备忘录,只为确认办公室的灯关没关。

所以诚实的结论比 AGI 叙事更窄,也更站得住。100 倍那个数字最上口,也最弱——一个什么都不输出的模型当然快,因为活儿被拿掉了,不是被干快了。说得客气点:靠拒绝干活省下来的时间,算不算省时间,大可以商量。真正的主张是:你的流量里有很大一块,从来就不需要生成。这一条,是成立的。

动手之前记住两条。第一,任何理由都取不回来——没有推理痕迹,因为压根没有推理。碰到监管、审计或用户信任的决策,这一条单独就足以出局;至于一次路由跳转或一局游戏的 tick,反正从来也没人打算读那个解释。第二,盯校准,别盯准确率。 0.88 对 0.05 是送分题。有意思的数字是 0.51 对 0.49——这些系统在你技术栈里的位置,就是在那种时刻挣来或丢掉的。

从”答错很便宜、答慢很昂贵”的地方开始。然后一点点挣到把靠近重大决策的资格。


Next Post
稠密模型 vs. 混合专家模型——决定推理经济性的架构抉择