KAKA WEB3News
Jev到底有没有门槛?OpenJEV已经分成4派:不吐字容易,概率靠谱很难
律动 BlockBeats·Sep 20, 2026 13:34 GMT+8
动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从
动察 Beating AI 快讯,Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。 它们都想做同一件事:省掉逐 token 生成,直接给出选项和概率。但具体怎么做,已经分成了几条完全不同的路线。 1. SemIf 最简单,连模型都不用重新训练。它直接拿现成的 Qwen,在模型准备回答 A、B、C 时截住,不让它继续往下写,直接读取每个选项的分数,再换成概率。 2. Simple Jev 也用现成大模型,但进一步省掉重复计算。同一段材料只读一次,后面的多个问题共用这部分结果,再分别判断答案。作者也明确说,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。 3. Laya 干脆不用会生成文字的大模型,换成更像传统分类器的编码模型。好处是小而快,短板也很明显。一次从 77 个选项里做选择时,Laya 准确率只有 42.5%,Jev 是 87.0%。 4. Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向直接完成 Choice、Noul 和 Score,更像一个能读自然语言的新一代分类器。 5. Verdict 更小,只有约 1.5 亿参数。作者重点处理了两个问题:答错了还报很高的置信度,以及把选项顺序换一下,结果就跟着变。它更在意如何让概率和判断都稳定下来。 6. Kev 选择保留大模型。它拿 Qwen 做底座,再加专门的决策结构,让同一份输入只读一次,多个问题各自算概率。第三方此前逆向 Jev 时,也推测它可能用了类似设计。 Kev 自测中,拿训练时没见过的新题测试,8B 版准确率约 78%,Jev 约 86%。更明显的差距在置信度,Kev 还有一些答错的题会给出 90% 以上把握。 7. Nimble 重点放在训练上。它用 Qwen3.5-9B,再准备一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个没参与训练的测试样本里,Nimble 有 90.1% 选中了参考答案,Jev 是 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。 8. OpenJev 走得最远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约 94ms。 几天下来,OpenJEV 已经分成四路:直接读取现成模型的答案分数、训练专用决策模型、把大模型改造成决策模型,以及用扩散模型直接填答案。 Jev 这条路线看起来很好抄。真正拉开差距的还是准确率、泛化和概率校准。模型敢报 90%,这个 90% 到底有多可信,才是最难的部分。
Public content from Kaka Web3. Market and digital-asset information is not investment advice.