
NLP知识库文档【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址https://gitcode.com/gh_mirrors/nl/NLP-progress点击查看免费下载本文基于 NLP-progress 仓库中 persian/summarization.md 的内容系统梳理波斯语文本摘要Persian Text Summarization的任务定义、自动评估指标的固有局限以及pn_summary、Pasokh两个代表性数据集与其上的抽取式/生成式 SOTA 结果。读完本文你将掌握波斯语摘要研究的主要资源分布、各模型在 ROUGE-1/ROUGE-2/ROUGE-L 上的实测对比以及如何正确解读与使用这些榜单数据。摘要任务的定义与本仓库的定位文本摘要Summarization的任务是生成一个或多个原始文档的更短版本同时尽可能保留输入的大部分含义。它通常被划分为**抽取式Extractive与生成式Abstractive**两大类——前者从原文中挑选关键句子拼接成摘要后者用语言模型重新生成表达相同内容的短语。NLP-progress 项目README.md的目标正是追踪 NLP 各常见任务与数据集上的研究进展为读者提供基准数据集与当前 SOTA 的快速概览。在仓库的目录结构中波斯语板块persian/目录与英语、法语、俄语、土耳其语、德语等板块并列其中 persian/summarization.md 就是波斯语摘要任务的专属追踪页英文对应页 english/summarization.md 则覆盖了 CNN/Daily Mail、Gigaword、X-Sum 等主流英语基准。评估指标的警告ROUGE 与 METEOR 的三大局限波斯语摘要页在罗列任何结果之前首先给出了一条重要警告对于摘要任务ROUGE、METEOR 等自动指标存在严重局限具体有三点只评估内容选择不覆盖质量这些指标不衡量流畅度fluency、语法正确性grammaticality、连贯性coherence等其他质量维度。一个语法错误频出但内容命中率高的摘要仍可能获得高分。过度依赖词面重叠在评估内容选择时指标主要依赖词面lexical重叠但一篇抽象式摘要完全可以在与参考摘要没有任何词面重叠的情况下表达相同内容此时 ROUGE 分数会严重低估其真实质量。单一参考摘要问题鉴于摘要任务的主观性以及标注者之间较低的一致性这些指标在设计时假定每个输入对应多个参考摘要然而pn_summary等较新数据集每条输入只提供单一参考摘要进一步削弱了指标的可靠性。因此仅凭这些自动指标来追踪进展、声称 SOTA 是值得商榷的。多数论文会额外进行人工对比实验来佐证但这类人工实验难以跨论文横向比较——原文档也呼吁社区若有更好的比较方案可直接贡献。值得注意的细节是这条警告与 english/summarization.md 中的版本结构一致只是把仅提供单一参考摘要的例子从 CNN/DailyMail、Gigaword 替换为pn_summary说明仓库内各语言页共享同一套方法论警示并针对各自的数据集做了本地化——从这一对比可以推断该警告模板是整个仓库追踪摘要任务时的统一共识。波斯语摘要资源概览稀缺但正在补全原文档明确指出波斯语的生成式/抽取式摘要任务资源相对匮乏部分数据集没有在线公开版本或缺少维护者curators。例如在翻阅学术论文时可能看到Pasokh等数据集但实际可获取性存疑。幸而得益于部分研究者在该领域的投入一个名为Persian News Summarization简称pn_summary的数据集同时面向波斯语摘要的两类任务准备完毕并已开放在线获取。pn_summary波斯语新闻摘要数据集pn_summary 是一个结构良好的波斯语摘要数据集其关键规格如下规模由 200,000 篇爬取新闻中筛选出的93,207 篇在线新闻文章来源来自6 家不同的新闻机构类别覆盖涵盖18 个新闻类别范围从经济到旅游标注形式每篇文档文章同时包含长原始文本与一段人工生成的摘要评估协议模型使用全长度full-lengthF1 分数的 ROUGE-1、ROUGE-2、ROUGE-L 评估METEOR 为可选指标。从仓库的 structured/export.py 源码结构看这类 Markdown 中的 SOTA 表格可以通过导出脚本被解析为结构化 JSON具体用法见 structured/README.md也就是说pn_summary的模型成绩可以被机器读取与二次利用便于做跨论文的榜单对比。生成式模型与混合模型ModelROUGE-1ROUGE-2ROUGE-LMETEORPaper / SourceCodeBERT2BERT (ParsBERT) mT5Farahani 等202044.0125.0737.76-Leveraging ParsBERT and Pretrained mT5 for Persian Abstractive Text SummarizationOfficial随 pn_summary 仓库发布这是pn_summary上目前收录的生成式Abstractive/混合模型 SOTA将波斯语预训练模型ParsBERT同样出自 Hooshvare 团队详见 persian/named_entity_recognition.md 中对 ParsBERT 在 ArmanPersoNERCorpus 与 PEYMA 上的高 F1 记录作为 BERT2BERT 结构的编码端与多语言生成模型mT5配合完成摘要生成在 ROUGE-1 上达到 44.01、ROUGE-2 25.07、ROUGE-L 37.76官方代码随pn_summary数据仓库一并发布。Pasokh单文档与多文档双形态数据集Pasokh 是另一个被收录的波斯语摘要数据集其规格与原文档记载如下来源覆盖7 家新闻机构的新闻内容横跨6 个新闻类别两种形态单文档Single-DocumentSD与多文档Multi-DocumentMD规模分别包含100、1000 条记录标注形式每篇文档覆盖5 个样本分别用于抽取式extractive与生成式abstractive示例。该数据集在原文档中被特别提及为在学术论文中可见、但线上可获取性存疑的典型例子——这恰好呼应了上文波斯语摘要资源稀缺的现状描述。抽取式模型与混合模型ModelROUGE-1ROUGE-2ROUGE-LMETEORPaper / SourceCodeBased on NER (SD)Khademi, Fakhredanesh202047.2033.40--Persian Automatic Text Summarization Based on Named Entity Recognition-Based on NER (SD)Khademi 等202045.4030.10--Conceptual Text Summarizer: A new model in continuous vector space-Feature Extraction (SD)Rezaei 等201978.0071.0074.00-Features in Extractive Supervised Single-document Summarization: Case of Persian NewsOfficialSummBotMulti-Feature Extraction (SD)Kermani, Ghanbari201948.7042.60--Extractive Persian Summarizer for News Websites-对这张表可以观察到几个有研究价值的模式均为基于表中数据的客观归纳而非外部结论得分最高的路线是显式特征工程Rezaei 等2019的 Feature Extraction 方法在 ROUGE-1/2/L 上分别达到 78.00 / 71.00 / 74.00是表中唯一三项指标全部报出、且显著领先其余条目的方法并提供了官方代码SummBot命名实体信息是有力的抽取信号两条 Based on NER 路线Khademi 等在同一年份分别报出 ROUGE-1 47.20 / 45.40 的成绩显示将命名实体识别结果作为句子打分特征在单文档抽取任务上的可行性多特征融合路线Kermani Ghanbari2019在 ROUGE-1 48.70 / ROUGE-2 42.60 上与 NER 路线量级接近但在表中略占优METEOR 一列在全部条目中均为空与文档METEOR 为可选指标的评估协议说明一致。如何阅读、复现与追踪这张榜单结合仓库整体机制可以给出三条使用建议把榜单当作入口而非终点每个条目的论文标题与官方代码链接是继续深挖的起点表格按最优结果置顶排序的规范见 README.md 的贡献指南保证了榜单的可读性若要复现某个模型优先以条目提供的官方实现为准。留意评估口径pn_summary使用全长度 F1 的 ROUGE-1/2/LMETEOR 可选Pasokh表中部分条目未报告 ROUGE-L跨数据集直接比较分数没有意义即使在同一数据集内也应注意文档开头的指标局限警告——高分不等于高质量。榜单可被机器消费如果你希望做更系统的对比分析可以运行仓库提供的导出脚本把整个波斯语摘要页解析为结构化 JSON在仓库根目录执行python structured/export.py persian脚本会依据 structured/README.md 的约定将 Markdown 中的数据集描述、链接与 SOTA 表格抽取为structured.json默认输出文件名可用--output覆盖。从 structured/export.py 的实现如extract_dataset_desc_links用正则抽取标题、按表格行解析模型与分数可以确认这类数据集描述 结果表格的页面正是该项目刻意设计的结构化数据来源。延伸阅读波斯语板块中与摘要研究高度相关的还有persian/named_entity_recognition.md由于 Pasokh 上的两条 SOTA 都基于命名实体识别NER了解 ArmanPersoNERCorpus 与 PEYMA 上的实体标注体系IOB 格式有助于理解这类抽取特征的构建方式persian/natural_language_inference.md摘要的内容保真与蕴含判断entailment密切相关FarsTail 数据集是该方向在波斯语上的代表english/summarization.md用于横向理解评估指标警告与榜单结构的同源英文版本。如需返回仓库总览可跳转至 README.md。赞分享NLP知识库文档【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址https://gitcode.com/gh_mirrors/nl/NLP-progress点击查看免费下载相关推荐终极风扇控制指南如何让电脑静音又凉爽的完整教程终极风扇控制指南如何让电脑静音又凉爽的完整教程 还在为电脑风扇噪音而烦恼吗你是否遇到过深夜工作时风扇突然狂转或者游戏时散热不足导致性能下降FanContNLP知识库文档3分钟快速掌握B站会员购抢票神器Python自动化购票终极指南3分钟快速掌握B站会员购抢票神器Python自动化购票终极指南 还记得那个令人沮丧的夜晚吗你最喜欢的歌手演唱会门票在B站会员购开售你提前半小时就守在电脑前NLP知识库文档NLP-progress 西班牙语文本摘要MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪NLP progress 西班牙语文本摘要MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪 本文基于 NLP progress 仓库中的 spaniNLP知识库文档上一篇彻底搞懂BetterScroll事件系统从scrollStart到scrollEnd全生命周期指南下一篇PortBender高级配置教程如何自定义过滤规则和优化性能参数创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考