Laya vs Jev:33ms 跑完决策,成本为零,开源模型正在改写 AI 路由
大多数 AI 模型是用来聊天的。你给它提示词,它一个 token 一个 token 往外蹦,然后你再从一堆文本里解析结果。写文章、写代码、聊天,这样没问题。但如果你只是想让模型回答“这封邮件该转给哪个部门”,这就太浪费了。
Laya 换了个思路。它由 Convai Innovations 开发,2026 年 9 月 18 日以 Apache 2.0 协议开源。Laya 不是自回归生成模型,而是非自回归决策模型。你给它一段非结构化文本,再加一个带类型的问题,它直接返回结构化答案和校准过的概率。没有生成,没有幻觉,不用解析 JSON。
下面说说它在实际生产里到底怎么用,和 TypeSafe AI 的 Jev 比怎么样,以及它适合放在什么位置。
Laya 到底做什么
- 输入:工单、邮件、交易记录、提示词等。输出:带类型的答案,一次前向传播完成。
- 支持三种决策原语:choice(从固定标签里选一个)、score(按序数打分,比如 0 到 3)、noul(返回校准后的 P(true),0.0 到 1.0)。
- 输出空间是固定数字和概率,所以它不会吐出坏 JSON,不会编造不存在的类别,也不会写一段废话让你再删。
- 英文 checkpoint 基于 ModernBERT-large,421M 参数。多语言 checkpoint 基于 mmBERT-base,322M 参数,覆盖 100 多种语言。
- 它能跑在 CPU 上。Acurast 的去中心化手机网络里,Laya 只用 Android CPU 和 TEE 硬件安全,就能做到 0.2 到 1 秒完成决策。
Laya 解决什么痛点
如果你用过 8B 或 70B 的大模型来判断“这张工单该给谁”,你大概已经受够了。
- 等 500 到 2000 毫秒,模型在生成你根本不需要的 token。
- 为输出 token 付推理费,然后把这些 token 全扔掉。
- 写正则或 JSON parser,只为了从自由文本里抠出一个干净标签。
- 模型说“confidence: 0.95”,但这个数字只是预测的 token 字符串,不是数学上校准过的概率,跟实际正确率没多大关系。
Laya 的开发者 Nandakishor Mukkunnoth 说得很直接:“不是每个 AI 问题都需要一个自回归聊天机器人。”
Laya 和 Jev 的对比
Jev 是 TypeSafe AI 做的,创始人 Diogo Almeida 是前 OpenAI 研究员。Jev 把“System One 决策”变成了一个品类,拿了 4000 万美元种子轮,据说正在谈 100 亿美元估值的 10 亿美元融资。它是一个托管 API,零样本性能很强。
这两个模型真正的差别在这几个地方。
速度
- Laya 在 Tesla T4 上 p50 每个路由问题 32.8ms。Jev 公布的中位数是 236 到 276ms。大约快 7.8 倍。
- 在 Apple Silicon 上用 MLX,独立 benchmark 测到 Laya 每个决策 7.6ms,Jev 通过网络要 588ms。
- 一个微调过的 browser-agent checkpoint 在 RTX 3080 上每个决策 27ms,比托管版 Jev API 在同样任务上快 31 倍。
校准
- 温度缩放之后,Laya 的 Expected Calibration Error 是 0.081,Jev 是 0.246。这个数字越低越好,当你用置信度阈值来卡自动化流程时,差距很关键。
准确率
- 零样本原始准确率,Jev 赢。JevBench v1.3.0 综合分,Jev 74.4,排第一。Laya 54.4,排第 33。Banking77 上,Jev 0.870,Laya 0.425。
- 但这个对比有点误导。第一,Laya 的零样本底座本来就是给你微调用的。在 typed-decisions checkpoint 上,微调后的 Laya 得分 0.766,Jev 是 0.727。
- 第二,级联架构会完全改变经济账。一个中文客服工单分类的独立测试发现,把 55% 流量交给本地 Laya(7.6ms),剩下升级给 Jev(588ms),整体准确率能追平 Jev,整体速度还快 1.8 倍。
成本
- Jev 每百万输入 token 收 0.042 美元,输出免费。
- Laya 是 Apache 2.0。自托管每百万 token 成本 0.00 美元。没有限流,没有计量,没有 API key。可以完全离线跑在你自己的硬件上。
- 对于批量任务,比如给大型 RAG 候选列表分类,或者处理几千张入站工单,成本差距不是一点点,是结构性的。
数据主权
- Jev 是托管 API,数据要离开你的网络。
- Laya 本地跑。页面内容、工单文本、客户消息、交易数据都不出你的基础设施。对金融、医疗、政府这些受监管行业来说,这不是功能,是合规底线。
真实用例
客服路由
一条支持消息进来:“我们三月份被扣了两次款,请今天把重复付款退回来。” Laya 把它分类为 billing,置信度 96.1%,紧急度评为 2 级,标记人工复核。整个调用 33ms。没有 LLM 写一段解释它为什么觉得这是账单问题。
浏览器自动化
一个为浏览器代理微调的 Laya checkpoint,在 8 个 benchmark 里的 6 个上打败了官方浏览器微调 checkpoint。在 60 个元素的页面上,稳态决策延迟在 10 到 30ms。吞吐大约每秒 100 个决策。
发票和文档匹配
有开发者用 Laya 解析和匹配发票,没有把整个 LLM 扔上去。主题分类 5/5。客服工单意图路由 5/5。模型回答“这是退款请求吗?”给出 86% 置信度,结果是对的。
内容审核和钓鱼检测
Laya 对“这封邮件是钓鱼吗?”或者“这个提示词是在尝试越狱吗?”这类二值问题返回校准后的 P(true)。因为概率是校准的,你可以设阈值,把不确定的案例交给人工复核,并且知道错误率大概是多少。
边缘部署
Acurast 把 Laya 部署到 175 个国家超过 28 万台 Android 手机上。模型在 CPU 上跑,带硬件 TEE 安全,给游戏、导航、安全检查提供实时决策,完全不依赖云。
目标用户与目标市场:谁该用 Laya,谁该用 Jev
Laya 适合这些情况:
- 数据不能出你的网络。金融、医疗、法律、政府团队需要离线推理。
- 你有清晰稳定的标签,也能微调。Laya 底座零样本弱,微调后的 checkpoint 有竞争力。模型卡说得很明白:“Laya 是一个用来做特化的快速底座。”
- 决策类别数量中等。Laya 超过大约 20 个选项后开始退化。77 路分类,Jev 还是更好。3 到 10 个路由类别,Laya 绰绰有余。
- 你处理高吞吐。每百万 token 成本 0,成本曲线是平的。Jev 按 token 收费,会随流量线性增长。
- 你需要 CPU 推理。Laya 不需要 GPU。可以部署在现有基础设施、边缘设备,甚至手机上。
Jev 更适合这些情况:
- 你需要立刻拿到零样本准确率。没有标注数据,没有微调团队,没有时间训练。Jev 的零样本性能是目前最强的。
- 你处理长上下文。Jev 支持单请求最多 64k token。测试的 Laya checkpoint 每个问题处理 512 token,有些变体到 1024。
- 你不想运维任何基础设施。Jev 是托管 API,调用就能用。
- 你的分类体系很宽。77 路银行分类、复杂多标签路由、大选项集,仍然更偏向 Jev。
战略图景
决策模型这个品类不是赢家通吃。Jev 证明了这个市场存在。Laya 证明了它可以开源、免费,而且快到能跑在手机上。
更有意思的是级联模式。用本地 Laya 处理 50% 到 60% 清晰、置信度高的决策。剩下 40% 到 50% 升级给 Jev。你得到 Jev 级别的准确率,大约一半的延迟,成本只是零头。
这不是妥协。生产系统本来就该这么架构:常见情况用便宜、快、本地的推理,难的情况交给云。
Laya 不是要取代 Jev。它是要让你大多数决策根本不需要调用 Jev。
快速开始
- 模型权重:Hugging Face (convaiinnovations/laya)
- 代码:GitHub (NandhaKishorM/laya)
- 许可证:Apache 2.0
- 安装:
pip install laya
如果你在评估决策模型,实用建议很简单:在你的真实数据上把两个都 benchmark 一遍,测置信度阈值扫描,试级联。架构决策不是 Laya 还是 Jev,而是这条线画在哪里。
总结
Laya 的价值不在参数规模,而在它把“决策”从“生成”里拆了出来。大多数 AI 工作流里,真正需要创造力的只占一小部分,剩下的都是路由、分类、打分、判断。这些事不该让一个 70B 模型一边写小作文一边做。
Laya 的目标市场也不是要吃掉 Jev 的零样本高精度场景,而是那些对成本、延迟、数据主权敏感的边缘和私有化场景。它的发展潜力在于生态:如果社区能围绕它产出大量微调 checkpoint,覆盖客服、风控、内容审核、浏览器代理这些垂直场景,它会变成决策层的 Linux。不是最亮眼的,但可能是最常用的。
Jev 会继续守住高端零样本和长上下文市场。Laya 会从下面往上吃。最后大概率是级联共存,而不是谁替代谁。
如果你正在做 AI 路由、工单分类、内容审核或者浏览器代理,建议花一个下午把 Laya 跑起来,拿你自己的数据试 100 条。33ms 和 588ms 的差别,体感比任何 benchmark 都真实。