十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

XOR-AttriQA:面向跨语言问答归因任务的多语言评测数据集使用指南

XOR-AttriQA:面向跨语言问答归因任务的多语言评测数据集使用指南 XOR-AttriQA面向跨语言问答归因任务的多语言评测数据集使用指南【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research导读XOR-AttriQA 是 EMNLP 2023 长文《Evaluating and Modeling Attribution for Cross-Lingual Question Answering》配套发布的评测数据集核心用途是训练与评估归因attribution能力——即给定一条查询、一段支撑段落与一个模型预测答案判断该段落是否确实证明了该答案对该查询是正确的。本文档基于仓库内 xor_attriqa/README.md 完整梳理数据集的背景来源、15 个数据字段语义、三种任务用法语内、跨语、论文复现混合设置以及各语言划分规模帮助研究者快速上手并正确复现论文实验设置。数据集背景与归因任务定义XOR-AttriQA 于 EMNLP 2023 以长文形式发表数据集构建基于两个既有工作XOR-TyDiQA提供了多语言问答XOR-QA中的查询与标准答案CoRA 系统提供了模型对查询的预测答案及其检索到的支撑段落。在归因任务中模型面对三元组一条query、一条passage段落与一个answer模型预测需要判定该段落是否确实支持该答案对该问题成立输出 True 或 False。这一任务直接关系到检索增强问答系统的可信度——模型可以检索到相关文档但其生成答案是否真正扎根于所依据的段落正是归因评测要回答的问题。值得注意的是XOR-AttriQA 同时提供了语内in-language与英语in-English两种标注设置使其既可用于单语归因评测也可用于跨语言归因研究。数据字段详解数据集每条样本包含 15 个字段完整说明如下字段含义query来自 XOR-QA 的查询query_language查询的语言answersXOR-QA 提供的查询答案predictionCoRA 系统的预测prediction_correct预测是否被判定与答案匹配query_translated_en翻译成英语的查询answers_translated_en翻译成英语的答案prediction_translated_en翻译成英语的预测passage_in_language原语言段落是否翻译需结合passage_retrieved_language判断passage_en英语段落是否翻译需结合passage_retrieved_language判断passage_retrieved_language检索段落的语言intrepetability_vote标注者对能否理解该预测投票的比例字段名沿用原 README 拼写ais_vote标注者对预测是否可归因于段落与查询投票的比例interpretability标注者能否理解预测的 True/False 判定ais预测是否可归因于段落与查询的 True/False 判定其中aisattribution is satisfied字段是任务的金标准标签gold labelinterpretability字段则记录预测答案的可理解性两个_vote字段保留了投票比例的细粒度信息便于研究者分析标注分歧或按置信度筛选样本。数据获取与目录组织数据通过官方发布链接下载详见原 xor_attriqa/README.md 中的 Data 小节https://storage.googleapis.com/gresearch/xor_attriqa/xor_attriqa.zip。压缩包内包含两个目录in-language目录语内设置的数据标注论文结果对比须使用此目录数据in-english目录英语设置的数据标注论文中仅用于对比两种设置的标注者间一致性inter-annotator agreement仅作参考。因此若目标是复现论文结果请以in-language设置为准。任务用法语内归因与跨语言归因数据集同时支持语内归因与跨语言归因两种用法1. 语内归因In-Language Attribution使用query、prediction、passage_in_language三个字段预测 True 或 False金标准标签为ais字段。此设置要求模型直接使用原语言如孟加拉语、芬兰语等的段落进行判断。2. 跨语言归因Cross-Language Attribution使用query、prediction、passage_en三个字段预测 True 或 False金标准标签同样为ais字段。此设置考验模型在段落被翻译为英语后能否正确完成归因是评估跨语言迁移能力的核心场景。3. 复现论文设置的混合用法论文中的实验采用语内与跨语言归因的混合设置具体使用哪段段落取决于 CoRA 系统实际检索到的段落语言。复现方式为根据passage_retrieved_language字段判断——若检索段落为原语言则选取passage_in_language否则选取passage_en。各划分的数据规模统计语内设置In-Language Setting按语言及训练/验证集统计划分样本数bn孟加拉语1407fi芬兰语659ja日语954ru俄语634te泰卢固语1066train训练集250validation验证集500英语设置In-English Setting按语言统计划分样本数bn567fi812ja1262ru790te443此外官方还提供了一套特殊的训练/验证资源验证集由每种语言各 100 条样本组成5 种语言合计 500 条训练集则精选 50 条高置信度样本所有标注者对ais标签意见一致。这一设计使研究者可以在标注量很小的情况下快速微调或评估归因模型。引用方式若在研究中使用了 XOR-AttriQA请按以下 BibTeX 引用article{muller2023evaluating, title{Evaluating and Modeling Attribution for Cross-Lingual Question Answering}, author{Muller, Benjamin and Wieting, John and Clark, Jonathan H and Kwiatkowski, Tom and Ruder, Sebastian and Soares, Livio Baldini and Aharoni, Roee and Herzig, Jonathan and Wang, Xinyi}, journal{arXiv preprint arXiv:2305.14332}, year{2023} }小结XOR-AttriQA 的价值在于将归因评测从单语场景扩展到多语言与跨语言场景通过passage_in_language/passage_en与passage_retrieved_language的组合研究者可以灵活构建语内、跨语言以及贴近真实检索流程的混合归因任务。配合ais金标准标签、interpretability可理解性标签和按语言/置信度划分的数据结构该数据集既适合作为基准评测也适合作为低资源场景下归因模型训练与研究的起点。【免费下载链接】google-researchGoogle Research项目地址: https://gitcode.com/gh_mirrors/go/google-research创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表