拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Jev 用于 RAG:重排序、段落过滤与引用检查

Jev 用于 RAG:重排序、段落过滤与引用检查 Jev 用于 RAG重排序、段落过滤与引用检查Jev 能够对检索到的段落进行打分过滤提示注入与相互矛盾的内容对候选段落重新排序并检验某一来源是否支撑所生成的论断。核心要点●当语义判断能够改善候选集时Jev 应放在廉价检索之后。●相关性、矛盾、提示注入应当作为独立的提问。●引用验证必须将一条主张与其对应的引用来源上下文进行比对。●第一方 cookbook 的结果是供复现的示例而不是普适基准。RAG检索增强生成系统可以检索到看似合理的段落却仍然给回答模型提供错误的上下文。候选可能与主题相关但与精确查询无关、被另一段落所矛盾或者携带了针对模型的指令。Jev 可以在检索与生成之间加入有明确边界的判断bounded decisions。它也可以检查最终主张是否被所引用的上下文所支撑。01Jev 在 RAG 流水线中的位置一个实用的流水线分为几个阶段1.用词汇搜索、向量、元数据过滤器或其组合检索宽泛的候选集。2.对每个候选提出范围收窄的语义问题。3.在代码中对段落进行保留、标记或重排序。4.基于选定的上下文生成答案。5.将重要主张与对应引用的段落进行比对。6.将不确定或相矛盾的主张路由到修正或审查。第一阶段保持廉价且宽泛。Jev 将语义评估用在更小的集合上以便影响答案质量。02按相关性重排序候选TypeSafe 的重排序 cookbook 以 BM25 候选为起点应用 Jev 的相关性打分。其发布的示例报告了在其法律查询数据集上的改进。应将这些数字视为该 cookbook 的结果而不是对其他语料的保证。检索质量取决于分块chunking、候选生成、查询形态、领域语言和相关性评分细则relevance rubric。一个 Score 提问可以使用有序标准例如●不相关unrelated●提及了主题但未回答查询●部分有用●直接回答了查询应用可以按预期分数排序但应保留分数的分布信息。某一段落若在“不相关”和“直接有用”之间分裂可能需要检查而不是给出一个自信的居中解释。03用独立提问过滤段落相关性只是一种属性。TypeSafe 的 RAG 段落分类 cookbook 把会导致不同动作的检查分开。对每个段落提出如下问题●该段落与查询的相关性如何●它是否与查询中的某个前提相矛盾或与另一个选定来源相矛盾●它是否包含指向回答模型的指令●它是否包含不应进入提示词的敏感信息代码随后可以决定●丢弃不相关的段落●保留并标记一个有用的矛盾●隔离疑似提示注入●遮蔽或阻断敏感上下文把这些检查压缩成一个质量分数会丢失决策的原因。一段矛盾的文本可能是关键证据而一段注入的指令即使看起来相关也可能不安全。04逐条验证引用引用检查只有在应用同时提供主张和来源上下文时才有效。Jev 不会自己去浏览寻找证据。TypeSafe 的引用检查 cookbook 使用封闭分类closed classification例如被支撑supported、未被支撑unsupported、相矛盾contradicted、捏造fabricated。具体标签应与产品的修正流程相匹配。一个有用的状态state包含代码{“claim”: “The policy allows refunds within 30 days.”,“citation”: “Customers may request a refund within fourteen days of purchase.”,“document_title”: “Refund policy”}提问应询问被引用文本是否支撑这条精确的主张而不应询问该主张是否在一般情况下听起来合理。对于长篇回答验证前应将复合陈述拆开。一句话中可能同时包含一个被支撑的日期、一个未被支撑的理由以及一个来源中不存在的结论。05用置信度决定哪些内容呈现给用户低置信度的相关性结果有可能保留在候选集中如果其他段落已经覆盖了答案。但对后果重大的主张的低置信度引用检查应当阻止发布或触发审查。这是“单一阈值不够用”的又一个案例。应按阶段和后果设定策略候选重排序低置信度时的可能响应将该候选置于列表靠后位置或检索更多候选提示注入筛查低置信度时的可能响应隔离并检查普通文本的引用检查低置信度时的可能响应重新生成或移除该主张法律、健康或金融内容的引用检查低置信度时的可能响应要求由具备资质的人员审查置信度不能替代来源权威性。对不可靠来源做出的高置信度判断留下的仍是不可靠的来源。06保持检索状态的聚焦Jev 的已知局限性提醒充满无关细节的大规模状态会损害性能。发送查询、候选段落以及该问题所需的元数据即可。当流水线已经知道被引用的片段时不要发送整个文档。如果周边上下文会改变含义应包含足够的邻近文本以保持该含义。对于非常大的候选集在 API 和速率限制允许的情况下可以批量处理独立的提问。TypeSafe 的并行提问 cookbook 报告了在某一文档工作流上第一方实测的大幅速度与成本改进。用真实系统的请求规模和延迟预算来复现该测试。07用检索指标与回答结果来评估好的评估应区分阶段●第一阶段检索器的召回率recall●经过 Jev 之后的排序质量●有用段落被错误丢弃的比例●提示注入检测错误●引用支撑准确率●最终答案的正确性与引用覆盖率●审查量与延迟重排序器无法挽回检索从未找到的相关文档。引用检查器无法修复没有来源的主张。分阶段指标能显示流水线哪里需要改进。关于覆盖整个 agent 的路由与防护guardrails可阅读《Jev for AI agents》https://www.refix.ai/news/jev-for-ai-agents/关于原语的选择参见 Choice、Score 和 Noulhttps://docs.typesafe.ai/primitives/choicehttps://docs.typesafe.ai/primitives/scorehttps://docs.typesafe.ai/primitives/noul08参考来源Sources●Re-ranking重排序https://docs.typesafe.ai/cookbooks/rerank_typesafe●Classifying RAG passagesRAG 段落分类https://docs.typesafe.ai/cookbooks/classifying_rag_passages●Double-checking citations双重检查引用https://docs.typesafe.ai/cookbooks/citation_check●Parallel questions并行提问https://docs.typesafe.ai/cookbooks/parallel_questions●Jev 1.13 jaggednessJev 1.13 锯齿性https://docs.typesafe.ai/model-jaggedness/jev-1.1309FAQJev 能对 RAG 结果重排序吗可以。TypeSafe 文档记录了一种重排序模式在更便宜的第一阶段检索之后对查询与段落的相关性进行打分。Jev 能验证引用吗Jev 可以分类所提供的来源上下文是支撑、矛盾还是未能支撑某条主张。它无法验证应用未提供的来源。Jev 会取代 RAG 中的 embedding 吗它可以在某些工作负载中补充或替代检索的部分环节但一种常见设计是先做快速的词汇或向量检索再用 Jev 做语义过滤或重排序。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表