
文章核心总结与翻译一、主要内容本文提出了一种可解释的混合框架,用于大规模文本语料库的叙事分析,核心是将词袋模型(BoW)的主题建模与基于大型语言模型(LLM)的问答(QA)叙事模型相结合,共享再生核希尔伯特空间(RKHS)的潜在表示。核心流程主题筛选:通过BoW主题模型对语料库进行无监督主题学习,由LLM筛选出与用户兴趣相关的主题及对应文档;问答生成:LLM设计分类问题并对筛选后的文档作答,将文档转化为结构化的QA向量;叙事建模:基于QA数据构建双softmax叙事模型,每个叙事对应一组问答概率分布(PMF),可解释为对语料的连贯视角;高效推断与外推:通过函数梯度下降实现模型学习,借鉴Transformer架构设计上下文问答外推机制,无需重复查询LLM即可预测未标注文档的问答结果;多场景验证:在联合国大会演讲(2002-2007)、NeurIPS会议论文(1987-2019)等数据集上验证,支持跨语言分析(中英双语)。关键优势可解释性:从问题设计、叙事结构到证据溯源均透明可审计;高效性:减少LLM重复调用成本,支持大规模语料扩展;灵活性:适配多语言、多领域(地