
这项由北京人工智能研究院BAAI、北京热力集团有限责任公司BDHG与北京邮电大学BUPT联合开展的研究于2026年8月发表在arXiv预印本平台编号为arXiv:2608.01862v1。感兴趣的读者可以通过该编号查阅完整论文。**研究背景当通用AI遇上企业内部的秘密档案室**每家企业都有一座秘密档案室——里面装满了内部操作规程、技术标准、管理政策以及各类专有知识文件。这些内容从未出现在公开的互联网上因此那些用海量公开数据训练出来的通用AI助手对这些内容一无所知。当员工向AI提问我们公司供热系统的紧急停机操作规程是什么时再聪明的通用AI也只能摇头说不知道。这个问题并不小众。几乎所有拥有内部知识体系的企业都面临同样的困境如何让AI真正掌握企业的私房知识同时又不变成一个只懂本行业、其他什么都不会的偏科选手北京人工智能研究院的研究团队为此开发了一套名为Wnuan暖暖的系统并设计了一套分三步走的训练方案。这套方案在707道企业知识问答题上进行了测试结果显示模型给出可接受答案的比率从训练前的52.76%一路攀升到91.51%超过了所有被纳入对比的市面顶级商业AI接口。**一、什么叫可接受答案率为什么它是衡量标准**在正式介绍这三步方案之前有必要先解释一个贯穿全文的核心指标——可接受答案率AAR。企业知识问答的答案往往很复杂不像考数学题那样非对即错。一道关于操作规程的题目AI可能答出了80%的要点却遗漏了一个关键条件也可能答出的内容完全正确但不够完整。为了处理这种半对不对的情况研究团队将模型的回答划分为三类完全正确、部分正确、完全错误。可接受答案率把前两类合并计算统计模型给出至少部分正确答案的比例。这个指标之所以重要是因为在实际企业应用中一个能给出正确方向、需要人工补充细节的答案远比一个完全答错或拒绝回答要有价值得多。整个研究都以这个指标为核心评判依据。**二、第一步把企业文件变成可学习的练习题**炼金的第一步是把那座秘密档案室里的文件变成AI能从中学习的素材。原始企业文件大多是Word文档或PDF里面全是大段大段的说明文字就像教科书一样枯燥。AI如果直接去读这些文件效果往往不好——就像你让一个人死背整本教材却从不做练习题考试时往往发挥失常。研究团队采取的策略是把文件转化为一问一答的练习题。具体来说系统会先把文件切分成一段段有意义的片段然后针对每个片段自动生成问题。这些问题被设计成六种类型涵盖事实提取、机制解释、设计原理、条件约束、局限性分析和对比分析覆盖了企业实际提问的主要场景。生成的问题必须满足几个硬性条件问题本身要能独立成立不能含有如上所述这样依赖上下文的表达问题必须有明确可查的答案问题的表述必须清晰、可理解。经过一系列质量筛查之后系统最终得到了221,294组问答对。但研究团队没有就此停步。他们还做了一个额外的精细化处理用目标模型Qwen3-32B重新改写答案使答案的表达风格更贴近模型自身的生成习惯。这个步骤叫做目标对齐答案重写。在221,294组数据中有164,744组的答案经过了这道重写工序其余56,550组则保留了原始答案。筛选标准是改写后的答案与原始答案在语义上的相似度必须达到0.8以上否则就放弃改写、保留原版。这道工序有点像请一位擅长演讲的人把专业报告改写成适合现场宣讲的版本——内容不变但表达方式更符合听众也就是模型本身的接受习惯。实验结果显示这道工序本身并没有直接提升企业问答的准确率但它有效恢复了通用能力的表现让模型在学会企业知识的同时不至于在通用场景下变得结巴。这一阶段的对比实验显示与直接用固定窗口切片来训练的方式相比采用文档转问答题的方式可接受答案率提升了31.12个百分点同时只多消耗了约27.8%的计算量。**三、第二步在学习企业知识的同时不忘保持通才**进入第二步研究团队面临一个经典的AI训练难题用一句话来说就是学了新东西忘了旧知识。把所有221,294组企业问答题喂给模型它确实会变成企业知识的专家。但代价是它可能开始忘记怎么写通顺的句子、怎么按照指令格式回答问题。这种现象在AI训练领域有个术语叫灾难性遗忘听起来有点夸张但现实中确实会发生。为了对抗这种遗忘研究团队在企业问答训练数据里混入了一定比例的通用知识练习题。这就像一个正在专攻医学的学生每周仍然抽时间读一读文学、做一做数学题以防自己变成一个除了医学什么都不懂的书呆子。研究团队系统地测试了五种混合比例完全不混0%、混入5%、25%、50%、100%的通用数据。评判标准是综合三项通用能力测试MMLU、IFEval、C-Eval的平均得分。结果显示混入约48.3%通用数据的方案表现最佳在保持企业问答能力的同时通用能力也保持得最好。与完全不混通用数据相比这个方案损失了不到2个百分点的企业问答准确率却换来了通用能力平均提升2.49个百分点。这个经过SFT监督微调训练的版本被称为暖暖-Inst是后续强化学习阶段的起点。**四、第三步专门对付剩余错误的强化学习**走完前两步暖暖-Inst已经能回答约80%的企业问题了。但剩下那20%的错误用普通继续训练的方式效果有限——因为那些容易学会的题目模型早就学会了继续在全部数据上兜圈子收益越来越低。这时候研究团队祭出了第三步专门针对剩余错误进行强化学习。具体做法是先用暖暖-Inst去回答训练集里的所有230,183道题然后用评判模型筛出那些它依然答错的题目共筛出56,147道。这个错误题目池就成了第三阶段的专属训练集。这种策略的思路就像一个备考的学生把所有做错的题目单独整理成错题本然后在考前集中复习错题而不是把所有题目不分好坏地再过一遍。强化学习采用的算法叫GRPO一种效率较高的策略优化方法。对于每道题模型会生成5个不同的候选回答然后系统给每个回答打分。打分规则包括四个维度答案的事实准确性占60%的权重、逻辑合理性、专业表达质量、简洁性三者合计占30%以及格式规范性占10%。模型通过不断比较这些候选回答的得分差异逐渐学会生成更好的答案。为了验证专攻错题这一策略是否真的优于其他方案研究团队设计了一个严格对照实验三组模型都从同一个起点暖暖-Inst出发都只训练100步使用完全相同的算法和参数。唯一的区别是训练数据的来源第一组只用56,147道错题第二组从完整的230,183道题中随机抽取第三组使用全部230,183道题。实验结果显示错题组达到了89.39%的可接受答案率而完整池随机组和全量组分别只有86.42%和86.28%。差距看起来不大但经过严格的统计检验这3个百分点左右的差距是可靠的不是随机噪声。研究团队还通过按文件来源重新采样的方式进行了额外的稳健性检验结果同样支持错题策略的优势。在主力的完整训练轮次中暖暖-RL的可接受答案率最终达到91.51%比暖暖-Inst又提升了11.45个百分点。从问题层面来看这11.45个百分点意味着原先答错的题目中有101道被修复了原先答对的题目中有20道出现了退步净减少了81个错误。**五、用707道真实企业问题来考试的成绩单**为了让整个评估体系可信研究团队专门构建了一个名为WnuanBench的测试集里面包含707道真实企业知识问题。这707道题覆盖了8个业务领域按内容类型分为三大类160道通用企业知识题370道实际操作场景题以及177道标准规范题。所有题目都由企业内部人员独立筛选和审核完全没有参与模型的训练过程确保考试的公正性。为了让评分本身也可信研究团队使用了三个大型语言模型组成的评审团两个主审gpt-oss-120b和MiniMax-M2.5独立打分如果两者意见不一致就请第三个模型DeepSeek-V3.2来打破僵局最终取三者的中间分数。研究团队还做了一个重要的校准实验请一位真正懂行的企业领域专家对147道题的模型回答进行人工评分。对比结果显示自动评审团与专家的判断吻合率高达90.5%统计上的一致性系数Cohens κ为0.796属于相当高的水平。这意味着这套自动评分体系是可靠的不是在自欺欺人。在最终的成绩单上暖暖-RL以91.51%的可接受答案率排名第一。而所有被纳入对比的商业AI接口包括GPT-5.4、MiMo-V2-Pro、DeepSeek-V4-Pro等顶级系统得分均在42.86%到67.75%之间。同一套问题上差距非常显著。**六、不止准确率其他质量维度的变化轨迹**可接受答案率只是最核心的指标研究团队还追踪了几个辅助指标它们共同描绘了模型从暖暖-Base到暖暖-Inst再到暖暖-RL的完整进化轨迹。答案完整性是否覆盖了所有关键要点从36%提升到66.76%。答案忠实性是否有据可查不瞎编从30.20%提升到72.14%。幻觉率模型编造不存在内容的比例从65.91%大幅下降到15.70%。这意味着训练前的模型有超过六成的答案含有编造成分训练后降到了不到两成。有一个细节值得关注在各项指标的改善中SFT阶段第二步贡献了大部分的准确性提升而RL阶段第三步的最大贡献是对幻觉率的压制。RL阶段在非幻觉率上额外贡献了17.96个百分点显示出强化学习对让模型说话有依据这件事特别有效。**七、代价与边界通用能力的损失**没有什么是免费的。研究团队在强调成果的同时也非常坦诚地报告了代价。在通用能力测试上暖暖-Base的三项通用测试平均分是88.61%经过SFT之后降到84.64%经过RL之后进一步降到83.44%全程共下滑了5.17个百分点。但这个损失并不均匀MMLU知识广度测试和C-Eval中文知识测试的降幅较小甚至略有回升而IFEval指令遵循测试的降幅最大从88.76%一路跌到了80.00%。这意味着模型变得更擅长回答企业知识题但在严格按照给定格式回答问题这件事上有所退步。研究团队也尝试了继续用第三步强化学习来弥补这一损失专门设计了一个RL-2扩展实验。结果显示继续训练下去不仅没有找回指令遵循能力反而让幻觉率从15.70%反弹到了20.93%IFEval继续从80.00%跌至76.00%可接受答案率几乎没有变化。这个实验虽然以失败告终但它传递了一个重要信息在当前的方案框架下企业知识能力和通用指令遵循能力之间存在一定的内在张力不能简单地两头都要。**八、检索辅助有时候反而帮倒忙**论文还专门测试了一个额外问题如果给模型配上检索功能RAG即在回答问题时先从文件库中检索出相关片段再一并送给模型参考会有帮助吗结果出乎意料地微妙。对于没有经过任何训练的基础模型暖暖-Base检索辅助确实很有帮助可接受答案率从52.76%提升到72.98%。但对于经过完整训练的暖暖-RL检索辅助反而造成了下降从91.51%跌到81.75%。研究团队对这个现象做了进一步的拆解分析。他们发现当检索到的片段确实与问题相关时检索对基础模型和中间模型还是有帮助的但当检索到的内容与问题关联度不高时所有模型的表现都会变差而且训练越充分的模型受干扰越大。这说明检索辅助不是一个可以无脑叠加的加成而是需要根据检索质量来决定是否使用的条件性工具。**九、还有一条671B巨模型的路线**研究团队还顺带测试了一条不同的路线基于参数量更大的DeepSeek-V3.1-Terminus671B参数远大于主力方案的32B进行轻量级微调LoRA-SFT但没有进行强化学习阶段。这条路线被称为暖暖-Plus。结果显示暖暖-Plus-Inst达到了81.19%的可接受答案率略高于同等SFT训练后的32B版本80.06%但明显低于经过强化学习的32B版本91.51%。这个对比说明在同等训练阶段的条件下更大的模型有一定优势但精心设计的三阶段训练策略可以让较小的模型超越仅做简单微调的更大模型。**说到底这套方案告诉了我们什么**归根结底这项研究做了一件很实在的事它系统性地回答了如何让一个通用AI掌握企业私有知识这个问题并且用严格的实验数据说话。研究给出的答案是一套组合拳先把文件转化为可学习的问答题再在学专业知识的同时保留通用能力最后用强化学习专门攻克剩余的难题。每一步都有清晰的作用分工而不是依赖某一个单一技术的神奇效果。这套方案也有明确的局限性。它只在一家企业的知识体系上得到了验证无法保证在其他企业或其他行业同样有效。它改善了企业知识的准确性但牺牲了一部分指令遵循能力。而且由于涉及企业内部文件完整的训练数据和测试集无法对外公开。对于那些正在考虑将AI引入企业内部知识管理的实践者来说这项研究提供了一个经过验证的参考框架而不是一个可以直接复制粘贴的解决方案。每家企业的知识体系不同直接照搬结果的风险还是存在的。有兴趣深入了解技术细节的读者可以通过arXiv编号2608.01862查阅完整论文里面包含了大量训练配置参数、评分标准定义和统计检验结果是一份相当详尽的技术报告。---**QA**Q1Wnuan暖暖模型是如何把企业文件转化为AI可以学习的训练数据的A暖暖系统会先把企业文件切分成有意义的文本片段然后针对每个片段自动生成六种类型的问题包括事实提取、机制解释、条件约束等再经过一系列质量筛查最终得到大约22万组问答对。此外系统还会用目标模型对答案进行改写使表达风格更贴近模型自身的生成习惯。Q2暖暖训练后通用能力下降了多少具体哪方面受影响最大A经过完整三阶段训练后暖暖模型的三项通用能力测试平均分从88.61%下降到83.44%总共下滑约5.17个百分点。损失最集中的是指令遵循能力IFEval从88.76%跌至80.00%而知识广度测试MMLU和中文知识测试C-Eval的降幅相对较小。Q3为什么给暖暖-RL模型加上检索功能反而会让成绩变差A检索功能会把检索到的文档片段一起送给模型参考但检索到的内容不一定与问题高度相关。经过完整训练的模型已经内化了大量企业知识反而容易被不相关的检索内容干扰。当检索内容与问题真正相关时帮助还是存在的但检索质量不稳定时训练越充分的模型受干扰反而越大。