拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Jev 上线24小时,13%付费团队切换:决策模型为什么先火在付费团队

Jev 上线24小时,13%付费团队切换:决策模型为什么先火在付费团队

Jev 上线24小时,13%付费团队切换:决策模型为什么先火在付费团队

Jev 出隐身模式两周了。X 上吵翻了天,掘金热榜上连着三天有它的位置,Redis 之父下场泼冷水,DHH 顺势宣布「放下笔」——但我觉得这一周里最有信息量的信号,不是哪位大佬说了什么,而是一个安静的数字:

Vercel AI Gateway 上线后 24 小时内,近 13% 的付费团队用上了 Jev。按官方口径,这个渗透速度是 Gateway 历史上任何一次模型发布的两倍以上。

来源:Tao Media,2026-09-19。

推特的论战免费,付费团队的切换要真金白银。前者表达情绪,后者表达判断。这篇文章想把这一周的吵闹拆开,看看「决策模型」到底击中了什么,又漏掉了什么。

一、13% 背后的账单

先说清楚 13% 的含金量。Vercel AI Gateway 是按调用量计费的商业通道,能在 24 小时内让近 13% 付费客户切换,意味着这些团队不是「试了试」,而是把生产流量切了过去。同周期内 Vercel 工程师还给了个内部数据:把原来的 GPT-5.6 Luna 分类器换成 Jev 后,系统提速 5–18 倍,准确率还有提升。

再看几笔公开的账单,都是开发者自己晒的:

场景谁在做结果
1018 篇论文分类Together AI 开发者关系负责人中位延迟 256ms,总成本0.08 美元
700 条高意向线索打分Gojiberry AI 联创40 秒跑完,总成本0.09 美元
浏览器订机票(苏黎世→伦敦)Browser Use 团队全程 7.1 秒,0.0039 美元
我的世界通关社区开发者(GPT-6 指挥 + Jev 执行)8 分 43 秒击杀末影龙,模型调用不到 1 美元

这些数字的共同点不是「快」,是便宜到可以忽略不计。用大模型跑这四件事,成本至少高两个数量级,延迟高一到两个数量级——而这两样东西,恰好是生产环境最敏感的两根神经。

二、为什么先火在付费团队:决策密度

我的解释是一个很朴素的账本问题:付费团队的工作流里,判断的次数远多于推理的次数。

一个典型的 Agent 工作流长这样:大模型负责一次复杂推理,然后是几十上百次小判断——这个请求该路由给哪个 Agent?这个工具要不要调用?这个输出需要再验一遍吗?该重试还是该转人工?过去这些判断每一次都要请动大模型,延迟、成本、不确定性层层叠加。

Jev 的命名本身就是野心宣言——来自 Jevons 悖论:效率提升不会减少消耗,反而会增加消耗。TypeSafe 的赌注是:当「判断」变得又快又便宜,开发者会把它塞进所有过去舍不得用 AI 的地方。两周过去,这个悖论正在被付费团队亲手验证——不是把大模型的活干得更好,而是把大模型不该干的活接走了。

免费用户在玩 Doom 演示(结构化游戏状态输入,不是看屏幕),付费团队在算账单。这个分化很诚实。

来源:Jev by TypeSafe AI · Architecture。

三、论战三方:都对了,但说的不是同一层

一周内社区形成了三个立场,我先把它们摆齐:

质疑派:antirez(Redis 之父 Salvatore Sanfilippo),9 月 21 日公开发文:「Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰好说明了 AI 泡沫中的大多数人分不清什么重要、什么不重要。」他的核心判断是:Jev 没有抬高 AI 的能力上限,只是把「判断」这件小事做得快了一点、便宜了一点,多数开发者根本不需要它。

**辩护派:Sebastian Raschka(大模型研究工程师)**提醒别低估它:传统分类器训练完标签就固定了,场景一变就要重训;Jev 能在运行时接收自然语言标签、结合上下文对动态选项做判断,泛化能力完全不同。另一个佐证是风向:9 月 20 日谷歌 Gemma 官方账号发了「DiffusionGemma as Jev」,把自家扩散模型适配成 Jev 式决策接口——风向的变化比争吵更说明问题。

中间的实证:中文社区的实测给两边都泼了点冷水。虎嗅和品玩的评测发现它的判断力没有碾压同级模型,中文客服场景准确率不算强;官方文档也写明它只支持文本输入、候选上限 255 个选项、评测基于自有业务流而非公开基准。还有个更冷静的国内案例常被引用:有团队让 Agent 托管写代码,AI 贡献率干到了 90%,需求交付却只快了 10%——生成层的效率红利,被判断层的低效吃掉了大半。这反过来恰恰是 Jev 这类模型的市场:它治的不是「写得慢」,是「判得贵」。

三方的分歧在于「重要的定义」:antirez 说的是能力上限不重要,Raschka 说的是工程泛化重要,实测派说的是生产账单重要。三层都对,只是不在同一层。

四、同一周的另一端:DHH 放下了笔

如果说 Jev 代表「AI 分工到判断层」,那同一周的另一场演讲代表「AI 分工到生成层」的全押。

9 月 23 日 Rails World 主题演讲,DHH(Ruby on Rails 之父)宣布 37signals 全面「pencils down」——不再以手写代码为默认方式,手写降级为「AI 出错时的例外状态」。他摆的数字很具体:过去 21 年(2004–2024)他一共写了 64.7 万行代码,年均 3.1 万行;用上 Agent 后的 20 个月写了 32.1 万行;今年 8 月单月 15.1 万行,约等于他以前任何一整年的五倍。Ruby 在他工作里的占比从 55% 掉到 3%。演讲最后他给自己盖了个章:「退休程序员,2001–2026」。

有意思的是民意的错位。演讲视频传回国内,V2EX 上「OpenAI 重置周期」的帖子盖到 165 楼,而「AI 时代还有多少人坚持手写内容」只有 26 条回复——楼盖得最热的是围观,真正表态「我还在手写」的声音很稀薄。DHH 在现场做了个调查:「还有多少人每周手写大量代码?」全场一千多人,他数出来大约五只手。

一边是付费团队 24 小时切换决策模型,一边是 Rails 之父宣布手写代码「不再经济」。两端一起看,结论其实一致:争论「该不该用 AI」的阶段结束了,新的问题是「用在哪一层」。

五、灰犀牛:当判断的门槛被打到地上

这一周还有个插曲,跟 Jev 无关,但和「AI 分工」的大势同源,值得每个开发者记住。

9 月 15 日,PS5 Linux 项目主理人 Andy Nguyen(TheFloW,十一年前 PS Vita 第一个内核 exploit 的作者)宣布退出整个 PS5 场景。原因是:他用几个月挖出并刻意保留的最后一个 hypervisor 漏洞——PS5 Pro 支持(原计划 2027 年发布)的唯一入口——被用 LLM 武装的后来者(他称之为「slop kiddies」)用 AI 在更短时间内挖到了同一个洞,尽管口头答应等 GTA 6 发售后再上报,结果不到一天就把漏洞报给了 Sony 的赏金计划换钱。Sony 打补丁,项目归零。他的原话很刺:「这个社区以前是一群高水准研究者,现在只是一群用 LLM 写自己都看不懂的 hack 的新手。」

这不是孤例:cURL 因为「AI 垃圾报告泛滥」在今年 1 月终止了漏洞赏金计划,RPCS3 模拟器团队明确限制 AI 生成的贡献。**AI 把参与门槛打到地上的同时,也把社区规范、隐性契约和「理解你手里的东西」的责任一起冲走了。**工具越强,约束工具的社会协议就越显得脆弱——这可能是这一周所有热闹里,最值得慢下来想的一条。

六、收尾:治理层两天三连,和我的三条判断

就在写这篇的两天里(9/27–9/28),治理层连出三个动作:NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform,给 Agent 决策加安全层;Cloudflare 提出 ADL(智能体开发生命周期),要接替 SDLC 的位置;GitHub 上多 Agent harness 项目 openrig 新上榜,hindsight 连续两天单日 +4500 星。基础设施在给「判断无处不在」的未来打地基。

落到开发者身上,我的三条判断:

  1. **给判断层单独立预算线。**如果你在跑 Agent 工作流,把「高频小判断」从大模型调用里拆出来单独记账——大概率你会发现这部分的账单和延迟都被严重低估了。
  2. **生成层学 DHH,先修护栏再踩油门。**37signals 早期也翻过车——AI 生成的架构「像瑞士奶酪一样全是洞」,团队一度回退手写。DHH 后来认为错不在 AI,在缺架构护栏。护栏没立起来之前,别学他 all in。
  3. **别用错层。**Jev 是一句「语义 if 语句」,不是更强的 LLM。它不取代推理,它取代的是那些本就不该请大模型出场的判断。判断它值不值,别看跑分,看你自己工作流里「判断 ÷ 推理」的比例。

两周前我写 Jev 时说,它可能先替我们把「AI 判断」写进生产环境。现在我补一句:这件事已经发生了,证据不是评测榜,是那 13%。


数据说明:Vercel 13% 渗透率与 5–18 倍提速为 Vercel 官方及工程师口径;账单数据来自开发者公开分享(Together AI / Gojiberry / Browser Use);antirez、DHH、Andy Nguyen 引文均为公开发言或社交帖;Jev 准确率相关结论含厂商自建评测成分,独立第三方复测仍有限。

返回列表