新闻详情

新闻详情

首页 / 资讯中心 / 详情

NLP-progress 西班牙语文本摘要:MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪

发布时间:2026/9/20 7:57:29来源:尧图网络
NLP-progress 西班牙语文本摘要:MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪
NLP-progress 西班牙语文本摘要MLSUM 多语言摘要数据集与西班牙语 SOTA 结果追踪【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址: https://gitcode.com/gh_mirrors/nl/NLP-progress本文基于 NLP-progress 仓库中的 spanish/summarization.md 文档系统梳理西班牙语文本摘要Summarization任务的定义、评估指标的使用警告以及首个大规模多语言摘要数据集 MLSUM 在西班牙语上的基准结果与进展追踪方式。读者读完后可以掌握如何在 NLP-progress 中定位西班牙语摘要的 SOTA 结果表、如何正确解读 ROUGE/METEOR 指标、MLSUM 数据集的规模与构造方式以及如何结合仓库脚本将摘要结果导出为结构化数据。摘要任务的定义在 NLP-progress 仓库中Summarization文本摘要被定义为生成一个或多个文档的较短版本同时保留输入的大部分含义原文定义见 spanish/summarization.md。这一定义同时涵盖了两大技术路线抽取式摘要Extractive从原文中挑选并拼接重要句子生成的摘要全部由原文片段构成生成式摘要Abstractive模型自主改写并生成新句子表达相同内容但不依赖词汇级复制。西班牙语章节的主体内容是 MLSUM 数据集及其上的模型评测结果。在仓库的 README.md 中西班牙语部分明确收录了三项任务命名实体识别spanish/named_entity_recognition.md、实体链接spanish/entity_linking.md以及本文主题 Summarizationspanish/summarization.md说明摘要任务是该仓库西班牙语板块的核心追踪对象之一。重要警告自动评估指标的局限性在展示任何排行榜结果之前原文档专门给出了针对自动评估指标ROUGE、METEOR的警告。这是解读后续所有分数时都必须牢记的前提原文列出了三点核心局限只评估内容选择不评估质量ROUGE 和 METEOR 只衡量选了什么内容而不评估流畅度fluency、语法正确性grammaticality、连贯性coherence等其他质量维度过度依赖词汇重叠在评估内容选择时指标主要依赖词汇层面的重叠。然而一篇生成式摘要完全可以在没有任何词汇重叠的情况下表达与参考摘要相同的内容此时指标会给出错误的低分单一参考摘要问题考虑到摘要任务的主观性以及标注者之间较低的一致性这些指标在设计时假定每个输入配有多条参考摘要。但 MLSUM 等近期数据集每个输入只提供一条参考摘要与指标的设计前提不符。因此原文档明确指出仅凭这些指标来追踪进展、声称 SOTA 是值得质疑的。大多数论文会额外进行人工对比manual comparisons of alternative summaries但这种实验难以跨论文比较。仓库也欢迎读者就如何系统化地进行这种人工对比提出改进建议并贡献到仓库中贡献方式见下文。从仓库的底层实现看这一以表驱动的评估记录方式是有意设计的。structured/export.pystructured/export.py在解析 SOTA 表时会自动读取表头中的指标列extract_sota_table函数会将表头中除 Model、Paper/Source、Code 之外的所有列视为指标而 spanish/summarization.md 的表头正是ROUGE-1 | ROUGE-2 | ROUGE-L | METEOR四列说明这些指标就是该任务的标准评测协议。MLSUM首个大规模多语言摘要数据集MLSUMMultiLingual SUMmarization由 Scialom 等人提出是第一个大规模多语言摘要数据集。其核心特征如下数据来源从在线报纸online newspapers自动获取规模包含150 万以上1.5M条文章/摘要配对数据覆盖语言五种语言——法语french/summarization.md#mlsum、德语german/summarization.md#mlsum、西班牙语spanish/summarization.md#mlsum、俄语russian/summarization.md#mlsum、土耳其语turkish/summarization.md#mlsum英语联动与英语中流行的 CNN / Daily Mail 数据集english/summarization.md#cnn--daily-mail结合后构成一个大规模多语言数据集可为文本摘要社区开启新的研究方向。MLSUM 论文中基于当时的 SOTA 系统做了跨语言对比分析cross-lingual comparative analyses这些分析暴露出单一语言数据集上存在的偏差biases这正是推动使用多语言数据集的动机所在。需要注意的是MLSUM 的评测指标同样受前述警告约束该数据集每个输入仅提供一条参考摘要而 ROUGE/METEOR 指标在设计时要求多参考摘要。西班牙语 MLSUM 的基准结果与 SOTA 追踪NLP-progress 中西班牙语摘要的 MLSUM 结果表按时间顺序chronological order排列而非按分数排序。这一点与仓库中其他某些表格如 Gigaword 按 ROUGE-2 排序不同阅读时需注意排序语义。下表完整收录自 spanish/summarization.mdModelROUGE-1ROUGE-2ROUGE-LMETEORPaper / SourceCodeLead_321.876.2513.710.3MLSUMScialom 等2020官方实现Pointer-Generator24.636.5417.713.2MLSUMScialom 等2020官方实现M-BERTScialom 等202025.588.6120.414.9MLSUMScialom 等2020官方实现Oracle45.2326.2135.826.5MLSUMScialom 等2020官方实现MARGE-NEWS (Train All)Lewis 等2020--22.72-Pre-training via Paraphrasing官方实现对这 5 行结果的解读要点Lead_3基线抽取文章前三句作为摘要的强基线ROUGE-1 为 21.87。它在西班牙语上取得了不低的分数说明新闻文章的信息前置特性Pointer-Generator经典的指针生成网络See 等2017 提出的方法在 MLSUM 上的复现通过复制机制与生成机制的切换处理 OOV 词汇ROUGE-1 提升到 24.63M-BERTmBERT 微调基于多语言 BERT 的模型在 ROUGE-125.58、ROUGE-28.61、ROUGE-L20.4、METEOR14.9上全面超过前两者体现了多语言预训练表示对西班牙语摘要的增益Oracle上界参考抽取式摘要的理论上界从参考摘要反推最优句子组合ROUGE-1 高达 45.23远高于所有可学习模型反映了抽取式方法在 MLSUM 上的性能天花板MARGE-NEWS (Train All)基于释义预训练pre-training via paraphrasing的多语言模型仅在 ROUGE-L 上报告了 22.72。跨语言视角西班牙语在 MLSUM 五语言中的位置原文档强调 MLSUM 的价值在于跨语言对比。将仓库中其他四种语言的 MLSUM 表格对照阅读可以直观看到西班牙语结果所处的位置数据均来自仓库对应语言文件语言文档Lead_3 ROUGE-1Pointer-Generator ROUGE-1M-BERT ROUGE-1Oracle ROUGE-1MARGE-NEWS ROUGE-L法语 french/summarization.md28.7431.0831.5947.3225.79德语 german/summarization.md38.5739.844.7857.2342.77西班牙语 spanish/summarization.md21.8724.6325.5845.2322.72俄语 russian/summarization.md9.299.1910.9436.1411.03土耳其语 turkish/summarization.md34.7936.936.6350.6135.90从中可以看出两点现象这也正是原文档所述跨语言分析暴露出的偏差的具体体现相同模型在不同语言上分数差异巨大同一个 M-BERT在德语上 ROUGE-1 达 44.78在西班牙语上仅 25.58在俄语上低至 10.94。同一模型跨语言表现的不一致说明单语言基准无法反映模型的真实泛化能力各语言的上界空间不同Oracle 在德语上高达 57.23而在俄语上仅 36.14西班牙语为 45.23表明不同语言数据的抽取难度与标注特性存在系统性差异。这些对比正是 MLSUM 作为多语言数据集的核心研究价值单语结果不可直接跨语言推广评估多语言摘要能力必须使用多语言评测基准。如何用仓库脚本把西班牙语摘要结果导出为结构化数据NLP-progress 仓库提供了把 Markdown 中的摘要表格解析为机器可读 JSON 的官方工具便于对 SOTA 表做二次分析。具体用法见 structured/README.md环境要求Python 3.6创建虚拟环境并安装依赖virtualenv -p python3 venv source venv/bin/activate pip install -r requirements.txt在仓库根目录LICENSE 文件所在位置执行导出python structured/export.py 一个或多个目录或文件示例导出整个english/目录下的数据python structured/export.py english默认输出到structured.json可用--output参数覆盖输出文件名。对西班牙语摘要文件单独导出可执行python structured/export.py spanish/summarization.md。从实现上看structured/export.py解析器以#标题层级切分文档parse_markdown_file中注释的假设是H1 为任务、H2 为子任务、H3 为数据集、H4 为子数据集并假设 SOTA 表至少包含 Model 列extract_dataset_desc_and_sota_table中通过model in l.lower()识别表头。它会自动完成以下工作提取数据集描述文本及其中的链接extract_dataset_desc_links解析指标列与数值extract_sota_table将表头中除 Model、Paper/Source、Code 外的列全部视为指标从模型名中分离作者信息extract_model_name_and_author例如 M-BERT (Scialom et al., 2020) 会被拆分为模型名 M-BERT 与作者 Scialom et al.抽取论文与代码链接extract_paper_title_and_link、extract_code_links。因此spanish/summarization.md 中的西班牙语 MLSUM 表格可以被稳定地转换成结构化 JSON供搜索、统计或自动化下游使用。站点渲染与结果表的维护约定该仓库的摘要页面同时用于构建nlpprogress.com风格的展示站点。Jekyll 站点通过 _includes/table.html 将 YAML 形式的结果渲染为 HTML 表格该模板接收scores逗号分隔的指标名列表与results列表为每个模型输出Model by Authors (Year)行并循环渲染各指标列、论文链接与代码链接。这与 Markdown 源文件中Model | ROUGE-1 | ROUGE-2 | ...的表头结构一一对应。若读者希望为西班牙语摘要任务贡献新的实验结果可按仓库 README.md 中约定的规则操作结果优先收录已发表论文的结果有影响力的预印本可作为例外表格排序新增结果时应保持表格既有排序方式本文的 MLSUM 表按时间顺序排序README 中通用建议为最优结果置顶具体以各表标注为准代码列官方实现标记为 Official非官方实现标记为 Link无实现则留空提交流程点击文件右上角编辑按钮直接编辑 Markdown使用 Preview changes 预览表格渲染效果然后填写变更说明并 Create a new branch for this commit and start a pull request 提交 Pull Request。小结围绕 spanish/summarization.md本文完整梳理了摘要任务的定义ROUGE/METEOR 三类核心局限内容选择与质量脱钩、词汇重叠假设、单参考摘要问题MLSUM 数据集的规模1.5M 配对、五语言覆盖与跨语言对比价值西班牙语 MLSUM 上 5 个模型Lead_3、Pointer-Generator、M-BERT、Oracle、MARGE-NEWS的完整分数以及如何通过 structured/export.py 将结果表导出为 JSON。跨语言对照表明西班牙语摘要模型分数如 M-BERT ROUGE-1 25.58与德语44.78、土耳其语36.63存在明显差距而 Oracle 上界45.23也显著低于德语57.23——这正是 MLSUM 所揭示的多语言偏差也提醒研究者在追踪西班牙语摘要 SOTA 时应同时关注指标局限性、基线水平与多语言对比语境。【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址: https://gitcode.com/gh_mirrors/nl/NLP-progress创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MicroPython pyb.UART 串口编程完全指南:Pyboard 全系串口配置、流式读写与 RTS/CTS 硬件流控深度解析 2026/9/20 8:42:35

MicroPython pyb.UART 串口编程完全指南:Pyboard 全系串口配置、流式读写与 RTS/CTS 硬件流控深度解析

MicroPython pyb.UART 串口编程完全指南:Pyboard 全系串口配置、流式读写与 RTS/CTS 硬件流控深度解析 【免费下载链接】micropython MicroPython - a lean and efficient Python implementation for microcontrollers and constrained systems 项目地址: https:/…

阅读更多 →
联邦学习赋能车载轨迹预测:SUMO仿真+LaneGCN实战 2026/9/20 8:42:35

联邦学习赋能车载轨迹预测:SUMO仿真+LaneGCN实战

简介:本资源是一套面向智能交通与车联网方向研究者的Python轨迹预测系统源码,聚焦于分布式场景下的车辆轨迹建模与联邦学习协同优化,适用于高校研究生、自动驾驶算法工程师及边缘智能方向开发者。项目基于SUMO交通仿真生成真实感轨迹数据&…

阅读更多 →
AssetRipper:不改一行代码,把Unity游戏里的3D模型全拆出来 2026/9/20 8:42:35

AssetRipper:不改一行代码,把Unity游戏里的3D模型全拆出来

AssetRipper:不改一行代码,把Unity游戏里的3D模型全拆出来 【免费下载链接】AssetRipper GUI application to analyze game files 项目地址: https://gitcode.com/GitHub_Trending/as/AssetRipper 上周同事丢给我一个 Unity 游戏的 Assets 文件夹…

阅读更多 →
Atlas 300V 24G部署YOLO实战:模型转换与推理避坑指南 2026/9/20 8:42:35

Atlas 300V 24G部署YOLO实战:模型转换与推理避坑指南

最近项目里要跑一路车流检测,需要把 YOLO 模型从 GPU 训练环境迁到一台自带 Atlas 300V 24G 的服务器上。群里不少同学一听到“atlas部署yolo”就问:Atlas 300V 24G 是运算加速卡吗?能像显卡一样直接跑 torch 吗?答案比想象中复杂…

阅读更多 →
突破LLM记忆瓶颈:DeepSeek V4 LTM架构解析与实践 2026/9/20 8:42:35

突破LLM记忆瓶颈:DeepSeek V4 LTM架构解析与实践

1. 记忆瓶颈的本质与挑战在大型语言模型的发展历程中,记忆能力一直是制约模型性能的关键因素。传统模型的上下文窗口通常局限在几千个token范围内,这导致在处理长文档、复杂对话和跨文档推理时面临严重的信息丢失问题。记忆瓶颈主要体现在三个方面&#…

阅读更多 →
《李大霄投资战略第3版》完整目录与PDF获取处理全攻略 2026/9/20 8:39:34

《李大霄投资战略第3版》完整目录与PDF获取处理全攻略

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞