在 Claude Code 里写长代码,最糟心的时刻不是报错,是上下文快满的那一瞬间。
屏幕一暗,光标转圈,系统开始写总结小作文。10 秒。你什么都做不了,只能等它把这堆对话揉成一团,然后祈祷精华别被揉碎。
我经历过太多次了。几千行终端日志、几十个文件内容堆在上下文里,Agent 记不住核心状态,越写越傻,账单越滚越大。
直到昨天,我在 X 上刷到一条帖子,直接看愣住了。
发帖的是开发者 tamara。标题很直白,找到了 JEV 的完美用法。
她用 JEV 给 Claude Code 做了一次瘦身手术。几千行废话毫秒级打分,没用的直接丢,核心代码和状态 100% 原样保留。卡 10 秒的总结,变成几十毫秒的无感清理。
这条帖子炸了。323 万浏览,1 万赞,609 次转发。我写这篇文章的时候,数字还在涨。
更炸的是评论区。TypeSafe AI 的创始人 Diogo Almeida 本人下场,就回了一句话,YES。
free coding agents from designing around the KV cache。让编码 Agent 摆脱围绕 KV 缓存设计的日子。
这条回复自己都拿了 11 万浏览、551 个赞。
就在三天前,这个 Diogo 发了一条官宣,把自己推到风暴中心。
他的原话是,在共同发明 ChatGPT 之后,我一直在问自己,为什么超人般的聊天模型没有通往 AGI?
是的,ChatGPT 的共同发明人之一。RLHF 这项让模型学会听话的技术,他是核心贡献者之一。他花了两年时间,做了个新东西,今天发布。
这个模型叫 JEV。
它不做别的,就是发选择、打分、给判断。它是 System One 模型的第一个成员。每条回复只有三种形态,一个选项 Choice,一个概率 Score,一个都不是 Noul。
官宣带了一段 2 分 56 秒的视频。现在的数字是 3613 万浏览,7.1 万赞,7646 次转发。
我盯着这个数据愣了很久。3613 万浏览什么概念,一个模型的发布,热度比很多明星绯闻还高。
它快。端到端延迟 70 到 500 毫秒,官方口径比前沿大模型快 20 到 200 倍,最高一档测算到了 193.6 倍。
它便宜。输入每百万 token 0.042 美元,输出免费。按官方口径,成本是前沿模型的四十分之一到四百分之一。
一句话总结,它不写文章,不解释推理。你把数据丢给它,它回你一个能直接写进 if 语句的判断。就是一个哑巴,但判断从不含糊。
| 维度 | JEV | 传统前沿大模型 |
|---|---|---|
| 回复内容 | 选项 / 概率 / 评分 | 长篇文字 |
| 端到端延迟 | 70-500 毫秒 | 数秒级 |
| 输入价格 | $0.042 每百万 token | 常用 $3-15 |
| 输出价格 | 免费 | 按量计费 |
| 代表作 | 判断、分类、路由 | 写作、长推理 |
光看参数没意思,我翻了 X 上最近三天关于 JEV 的所有热门帖子,挑出五个值得抄作业的用法。
第一个就是 tamara 的插件 fast-jev-compaction。把 Claude Code 每一步的 tool_use 和 tool_result 都交给 JEV 打分,无用的直接扔。
几个字就能让上下文瘦一圈。GitHub 上 3637 颗星,上线才两天。
第二个来自 Venice。这周早些时候,它官宣把 JEV 接进自家 API,beta 试用。原话是,它会回答,不会写作。
你送它应用状态和结构化问题,它回你一个能分支的概率、选项或评分。不用再从聊天模型里挤 JSON 了。
第三个是 Doom。TypeSafe 的 Allie 在 Discord 的 town-hall 里现场演示 JEV 打 Doom,每秒大约 10 次决策,每次决策就是一个选择。
官方说没剪进发布视频的料还有很多。
第四个来自评测界。Every 的 Mike Taylor 拿 37 篇文档做了 777 次判断,总耗时不到 0.7 秒。这是开发圈转发最多的一张图。
第五个是定价战的姿势。有投资人问联合创始人 Erik,会不会涨价?Erik 回,我们现在这个价格就是盈利的,还会让它更便宜。
Diogo 转发时补了一句,如果你是想建议涨价的投资人,你会非常难过。
TechCrunch 也下场了,标题是,JEV,一种新型 AI 模型,正在给开发者展示一条更便宜、更快的软件智能路径。官方认领这条转发时,拿了 4.1 万浏览。
但别把全部家当押上去。我翻完了官方的坦白帖,越看越冷静。
联合创始人 Sasha 自己说,JEV 还不够好,太慢、太贵、太笨。他们需要社区帮忙找毛病。这条就挂在官方主页上,没人删。
JEV 的边界非常清楚。它不写文章,不解释推理,一次最多给你 255 个选项,上下文只有 32K,不支持图像。你没法拿它当 ChatGPT 用,它也不干这个。
更刺耳的是质疑声。研究者 Niels Rogge 发推嘲讽,一个 JSON 分类器竟然有 1200 万浏览?是啊,我们正处在泡沫里。
这话对不对,我说不好。但有一点是确定的,JEV 的 20 到 200 倍提速,不是靠优化聊天模型挤出来的,是换了一条赛道。
它不赌文采,赌的是判断的可验证性。选择是对的,概率是真的,代码就能直接调用它。
这可能就是它自称的 System One。直给,不内耗。
围绕这三天 X 上的讨论,我整理了三句判断标准。
第一,任务的结果是不是一个选择?打分、分类、路由、判断真伪,交给 JEV。要写长文、要推理、要解释,别找它。
第二,Agent 是不是被上下文卡住了?先用 fast-jev-compaction 这类插件瘦身,让 JEV 把关哪些 token 值得留下,别急着加钱买更大的上下文。
第三,你愿不愿意为每次判断花大钱?场景每天跑几百万次小判断的话,换 JEV,账单可能直接少两个数量级。
上手也很简单。模型在 typesafe.ai 官网就能申请,插件在 GitHub 开源,API 从 Venice 也能接。从一次瘦身、一次打分开始,你会慢慢适应它的节奏。
回到开头那个卡 10 秒的瞬间。
其实真正的问题从来不是上下文不够大,而是我们还在用写总结的方式治理上下文,用聊天的思路养干活的模型。JEV 给的答案是,判断不需要解释,只需要正确。
教 ChatGPT 说话的人,转头去做了个哑巴模型。也许 AI 的下一场革命,就是从闭嘴开始的。
你被 AI 编程工具的上下文卡过吗?你的 Agent 失忆过几次?评论区聊聊,我想听听你的故事。
觉得有用的话,转发给正在被上下文折磨的朋友,说不定能救他一次。
想看更多 AI 热点与判断,关注专业网站 犀牛伯爵 rhinocount.cn