NLP-progress 对话系统全景:Dialogue 任务的基准数据集与 SOTA 追踪指南
发布时间:2026/9/20 4:14:56来源:尧图网络
NLP-progress 对话系统全景Dialogue 任务的基准数据集与 SOTA 追踪指南【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址: https://gitcode.com/gh_mirrors/nl/NLP-progress对话Dialogue是自然语言处理中最复杂也最难评估的任务之一。本文基于 NLP-progress 仓库中 english/dialogue.md 的完整内容系统梳理对话领域六大研究方向——对话行为分类、对话状态跟踪、检索式聊天机器人、生成式聊天机器人以及对话解纠缠Disentanglement——的基准数据集、评估指标与历年 SOTA 模型成绩并结合仓库的 structured/export.py 说明这些结果如何被机器化解析与复用。读完本文你将掌握对话各子任务的核心数据集与评测口径能够为自己的实验选取合适的基准与对照模型。一、为什么对话任务如此难以评估对话天然是交互式的一轮回复的好坏取决于历史上下文、说话人意图、甚至对话之外的知识。正如 english/dialogue.md 开篇所述过去的评估主要依赖人工评测human evaluation成本高昂且难以复现。因此研究社区逐渐转向两条路线一是为对话中的可分解子任务如给话语打标签、跟踪用户状态建立明确标注与自动指标二是为端到端对话建立大规模语料与可自动计算的排序/生成指标。NLP-progress 仓库采用任务H1→ 子任务H2→ 数据集H3→ SOTA 表的层级组织方式english/dialogue.md 正是这一规范下的英文对话任务档案。仓库的 structured/export.py解析入口会自动按这一层级把 Markdown 拆解为结构化的 JSONH1 作为task、H2 作为subtasks、H3 作为datasets并把每个数据集下的结果表解析为sota字段extract_sota_table。这意味着本文介绍的所有数据集与成绩都可以通过python structured/export.py english/dialogue.md一条命令导出为机器可读的 JSON方便后续检索与引用。二、对话行为分类Dialogue Act Classification2.1 任务定义对话行为分类是把对话中的每一句**话语utterance**按照其在对话中承担的功能进行分类的任务即判断说话人正在执行的动作。对话行为dialogue act是言语行为speech act的一种类型其理论基础来自 Austin1975与 Searle1969的言语行为理论。2.2 Switchboard 语料SwDASwitchboard-1 语料库是一个电话语音语料库包含约2,400 段双人电话对话涉及543 位说话人和约70 个预设对话话题。数据集同时提供音频文件、转写文本以及说话人与通话的元信息。Switchboard Dialogue Act CorpusSwDA在 Switchboard-1 的基础上补充了SWBD-DAMSL 标签集——这是对 DAMSLDiscourse Annotation and Markup System of Labeling标签体系的扩展。原始 220 个标签通过聚类归并缩减为42 个标签目的是改进在 Switchboard 语料上的语言模型性能标注使用的是 Switchboard-1 中由 1,155 段对话构成的子集。常见的标签包括statement-non-opinion非观点陈述、acknowledge确认、statement-opinion观点陈述、agree/accept同意/接受等。标注示例说话人Speaker:A对话行为Dialogue Act:Yes-No-Question话语Utterance:So do you go to college right now?SwDA 上的历年 SOTA按 Accuracy 排序模型Accuracy论文 / 来源代码SGNN (Ravi et al., 2018)83.1Self-Governing Neural Networks for On-Device Short Text Classification已开源CASA (Raheja et al., 2019)82.9Dialogue Act Classification with Context-Aware Self-Attention已开源DAH-CRF (Li et al., 2019)82.3A Dual-Attention Hierarchical Recurrent Neural Network for Dialogue Act Classification—ALDMN (Wan et al., 2018)81.5Improved Dynamic Memory Network for Dialogue Act Classification with Adversarial Training—CRF-ASN (Chen et al., 2018)81.3Dialogue Act Recognition via CRF-Attentive Structured Network—Bi-LSTM-CRF (Kumar et al., 2017)79.2Dialogue Act Sequence Labeling using Hierarchical encoder with CRF已开源RNN with 3 utterances in context (Bothe et al., 2018)77.34A Context-based Approach for Dialogue Act Recognition using Simple Recurrent Neural Networks—观察这张表可以发现成绩靠前的模型几乎都强调上下文建模self-attention、hierarchical RNN、CRF 序列结构说明单句分类远不足以解决对话行为识别话语间的依赖关系是关键。2.3 ICSI MRDA 语料MRDAMeeting Recorder Dialog Act语料包含约75 小时、75 场自然发生的会议语音涉及53 位说话人。标注使用的标签集是 SWBD-DAMSL 的修改版本包含三类标注信息对话行为片段边界、对话行为本身以及对话行为之间的对应关系。标注示例时间Time:2804-2810说话人Speaker:c6对话行为Dialogue Act:s^bd转写Transcript:i mean these are just discriminative.注意一段话语可能包含多个对话行为多个对话行为之间用^分隔。MRDA 上的历年 SOTA按 Accuracy 排序模型Accuracy论文 / 来源代码DAH-CRF (Li et al., 2019)92.2A Dual-Attention Hierarchical Recurrent Neural Network for Dialogue Act Classification—CRF-ASN (Chen et al., 2018)91.7Dialogue Act Recognition via CRF-Attentive Structured Network—CASA (Raheja et al., 2019)91.1Dialogue Act Classification with Context-Aware Self-Attention—Bi-LSTM-CRF (Kumar et al., 2017)90.9Dialogue Act Sequence Labeling using Hierarchical encoder with CRF已开源SGNN (Ravi et al., 2018)86.7Self-Governing Neural Networks for On-Device Short Text Classification—MRDA 的绝对成绩整体高于 SwDA90% vs 80%这与会议语料话语更长、结构更规整、标注一致性的差异有关。三、对话状态跟踪Dialogue State Tracking3.1 任务定义对话状态跟踪的目标是在对话的每一轮确定用户需求的完整表示它包含三部分目标约束goal constraint、一组被请求的槽位requested slots以及用户的对话行为users dialogue act。它是任务型对话系统中决定系统此刻该知道什么的核心模块。3.2 第二届对话系统技术挑战赛DSTC2在目标导向goal-oriented对话领域DSTC2第二届 Dialogue Systems Technology Challenges是常用的评测数据集。DSTC2 聚焦餐厅搜索领域模型按**单个槽位individual slot与联合槽位joint slot**两档精度进行评测。模型RequestAreaFoodPriceJoint论文 / 来源Zhong et al. (2018)97.5---74.5Global-locally Self-attentive Dialogue State TrackerLiu et al. (2018)-90849272Dialogue Learning with Human Teaching and Feedback in End-to-End Trainable Task-Oriented Dialogue SystemsNeural belief tracker (Mrkšić et al., 2017)96.590849473.4Neural Belief Tracker: Data-Driven Dialogue State TrackingRNN (Henderson et al., 2014)95.792868669Robust dialog state tracking using delexicalised recurrent neural networks and unsupervised gate表中 Joint 列代表所有槽位同时预测正确的联合精度它远低于单个槽位的精度——这正是状态跟踪任务的难点任一槽位的误差都会传导到整体。3.3 Wizard-of-OzWoZ 2.0WoZ 2.0 数据集是较新的状态跟踪评测集其评测与语音识别系统的噪声输出解耦即直接使用人工转写而非 ASR 输出。与 DSTC2 类似它覆盖餐厅搜索领域评测方式相同。模型RequestJoint论文 / 来源BERT-based tracker (Lai et al., 2020)97.690.5A Simple but Effective BERT Model for Dialog State Tracking on Resource-Limited SystemsGCE (Nouri et al., 2018)97.488.5Toward Scalable Neural Dialogue State Tracking ModelZhong et al. (2018)97.188.1Global-locally Self-attentive Dialogue State TrackerNeural belief tracker (Mrkšić et al., 2017)96.584.4Neural Belief Tracker: Data-Driven Dialogue State TrackingRNN (Henderson et al., 2014)87.170.8Robust dialog state tracking using delexicalised recurrent neural networks and unsupervised gate从 DSTC2 到 WoZ 2.0同一批模型如 Zhong et al. 2018 与 Neural Belief Tracker的成绩均有显著提升主要归因于 WoZ 2.0 摆脱了 ASR 噪声、评测环境更加干净。3.4 MultiWOZ多领域对话大语料MultiWOZ 数据集是人工-人工human-human书面对话的全标注集合覆盖多个领域与多个话题。规模约10k 段对话比此前所有已标注的任务型对话语料至少大一个数量级。对话设定在游客与信息台职员之间覆盖7 个领域。它是目前任务型对话研究中最主流的评测基准之一被细分为四个评测子任务Belief Tracking信念跟踪即状态跟踪模型Joint Acc2.0Slot2.0Joint Acc2.1Slot2.1MDBT (Ramadan et al., 2018)15.5789.53GLAD (Zhong et al., 2018)35.5795.44GCE (Nouri and Hosseini-Asl, 2018)36.2798.42Neural Reading (Gao et al., 2019)41.10HyST (Goel et al., 2019)44.24SUMBT (Lee et al., 2019)46.6596.44TRADE (Wu et al., 2019)48.6296.9245.60COMER (Ren et al., 2019)48.79DSTQA (Zhou et al., 2019)51.4497.2451.1797.21DST-Picklist (Zhang et al., 2019)53.3SST (Chen et al., 2020)55.23TripPy (Heck et al., 2020)55.3SimpleTOD (Hosseini-Asl et al., 2020)55.72Policy Optimization策略优化评测指标为复合公式INFORM SUCCESS× 0.5 BLEUINFORM 衡量系统是否提供有效信息、SUCCESS 衡量任务是否完成、BLEU 衡量回复语言质量模型INFORMSUCCESSBLEU2.0INFORM2.1SUCCESS2.1BLEU2.1TokenMoE (Pei et al., 2019)75.3059.7016.81Baseline (Budzianowski et al., 2018)71.2960.9618.8Structured Fusion (Mehri et al., 2019)82.7072.1016.34LaRL (Zhao et al., 2019)82.879.212.8SimpleTOD (Hosseini-Asl et al., 2020)88.967.116.9MoGNet (Pei et al., 2019)85.373.3020.13HDSA (Chen et al., 2019)82.968.923.6ARDM (Wu et al., 2019)87.472.820.6DAMD (Zhang et al., 2019)89.277.918.6SOLOIST (Peng et al., 2020)89.6079.3018.3MarCo (Wang et al., 2020)92.3078.6020.0292.5077.8019.54Natural Language Generation自然语言生成模型SERBLEUBaseline (Budzianowski et al., 2018)2.990.632End-to-End Modelling端到端建模评测公式同样是INFORM SUCCESS× 0.5 BLEU模型INFORMSUCCESSBLEU2.0DAMD (Zhang et al., 2019)76.360.418.6SimpleTOD (Hosseini-Asl et al., 2020)84.470.115.01SOLOIST (Peng et al., 2020)85.5072.9016.54MultiWOZ 之所以被拆成四个子任务分别评测是因为它在同一份语料上同时支持状态跟踪、策略优化、自然语言生成与端到端建模四种研究范式——从源码解析的角度看english/dialogue.md 中这四张表格恰好对应structured/export.py中同一数据集多个 SOTA 表的特殊处理逻辑handle_multiple_sota_table_exceptions导出时会按子数据集分别归档为独立的sota对象。四、检索式聊天机器人Retrieval-based Chatbots4.1 任务定义检索式系统以对话上下文 一批候选回复为输入对候选回复进行排序返回得分最高的一个。评测核心是可自动计算的排序指标。4.2 Ubuntu IRC 数据族围绕Ubuntu IRC 频道日志衍生出了多个版本的语料Uthus and Aha (2013)最早使用该资源的数据集但并非为检索式聊天机器人研究而建。UDC v1Lowe et al., 2015Ubuntu Dialogue Corpus 第一版。UDC v2Lowe et al., 2017Ubuntu Dialogue Corpus 第二版。DSTC 7Gunasekara et al., 2019DSTC 7 Track 1 使用的数据。DSTC 8Gunasekara et al., 2020DSTC 8 Track 2 使用的数据。每个版本都包含从 IRC 频道提取的对话集合通过**自动解纠缠disentangling**把同一时间线上交错的会话拆分开。各版本的具体任务略有差异但都围绕Recall_NK的变体展开——它衡量当共有 N 个候选时真实答案出现在前 K 个选项中的频率。DSTC 系列以 R_100K 与 MRR 评测数据模型R_1001R_10010R_10050MRR论文 / 来源DSTC 8 (main)Wu et al. (2020)76.197.9-84.8Enhancing Response Selection with Advanced Context Modeling and Post-trainingDSTC 8 (subtask 2)Wu et al. (2020)70.695.7-79.9Enhancing Response Selection with Advanced Context Modeling and Post-trainingDSTC 7Seq-Att-Network (Chen and Wang, 2019)64.590.299.473.5Sequential Attention-based Network for Noetic End-to-End Response SelectionUDC v2以 R_21 与 R_101 评测数据模型R_21R_101论文 / 来源UDC v2DAM (Zhou et al., 2018)93.876.7Multi-Turn Response Selection for Chatbots with Deep Attention Matching NetworkUDC v2SMN (Wu et al., 2017)92.372.3Sequential Matching Network: A New Architecture for Multi-turn Response Selection in Retrieval-Based ChatbotsUDC v2Multi-View (Zhou et al., 2017)90.866.2Multi-view Response Selection for Human-Computer ConversationUDC v2Bi-LSTM (Kadlec et al., 2015)89.563.0Improved Deep Learning Baselines for Ubuntu Corpus DialogsDSTC 各任务的更完整结果可参阅其任务报告。4.3 Reddit 语料Reddit Corpus包含来自 Reddit 平台的7.26 亿段多轮对话。任务形式是根据之前的对话历史从100 个候选回复其余为负采样中选出正确回复使用R_11001-of-100 排序准确率评测模型R_1100论文 / 来源PolyAI Encoder (Henderson et al., 2019)61.3A Repository of Conversational DatasetsUSE (Cer et al., 2018)47.7Universal Sentence EncoderBERT (Devlin et al., 2017)24.0BERT: Pre-training of Deep Bidirectional Transformers for Language UnderstandingELMO (Peters et al., 2018)19.3Deep contextualized word representations这张表很有参考价值ELMo 与 BERT 在检索式回复选择上反而不如为对话专门训练的 PolyAI Encoder 与 USE——说明对话语料的领域适配比通用预训练模型本身更重要。4.4 Advising 语料Advising Corpus收录密歇根大学学生与学业顾问之间的对话随 DSTC 7 Track 1 发布并在 DSTC 8 Track 2 中继续使用模型R_1001R_10010R_10050MRR论文 / 来源Yang et al. (2020)56.487.8-67.7Transformer-based Semantic Matching Model for Noetic Response SelectionSeq-Att-Network (Chen and Wang, 2019)21.463.094.833.9Sequential Attention-based Network for Noetic End-to-End Response Selection同一模型在 Advising 与 Ubuntu/DSTC 数据上成绩差异明显提示我们检索式对话系统的泛化高度依赖领域不同语料的 SOTA 不能直接横向比较。五、生成式聊天机器人Generative-based Chatbots5.1 任务定义生成式聊天机器人的核心任务是给定上下文生成**连贯且引人入胜consistent and engaging**的回复。5.2 PersonaChat 与 ConvAI2个性化闲聊生成任务最早由PersonaChat提出其动机是通过赋予智能体**显式人设persona**来增强闲聊机器人的趣味性与一致性。这里的 persona 被定义为若干条个人档案式的自然语言句子例如 I weight 300 pounds.。NIPS 2018 举办了基于该数据集的竞赛ConvAI2The Conversational Intelligence Challenge 2评测指标包括F1在词级别上评测回复质量Hits1真实下一句话在模型中排到第一的概率ppl语言建模困惑度perplexity。下表结果基于开发集测试集仍处于隐藏状态模型F1Hits1ppl论文 / 来源代码P^2 Bot (Liu et al., 2020)19.7781.915.12You Impress Me: Dialogue Generation via Mutual Persona Perception已开源TransferTransfo (Thomas et al., 2019)19.0982.117.51TransferTransfo: A Transfer Learning Approach for Neural Network Based Conversational Agents已开源Lost In Conversation17.79-17.3NIPS 2018 Workshop Presentation已开源Seq2Seq Attention (Dzmitry et al., 2014)16.1812.629.8Neural Machine Translation by Jointly Learning to Align and Translate已开源KV Profile Memory (Zhang et al., 2018)11.955.2-Personalizing Dialogue Agents: I have a dog, do you have pets too?已开源值得注意的现象是Hits1 与 F1 并不完全相关——P^2 Bot 的 F1 最高但 Hits1 略低于 TransferTransfo而纯 Seq2Seq 基线的 Hits1 仅有 12.6。这说明生成质量与选对下一句的能力是两个不同维度也印证了对话评测的复杂性。六、对话解纠缠Disentanglement6.1 任务定义与评估指标如 Ubuntu 数据所述IRC 等多人聊天频道中多段对话会混合在同一条时间线上。对话解纠缠的目标就是把交错在一起的对话逐段分开。该任务可以形式化为聚类问题且没有公认的唯一最优指标主流评估指标包括Variation of InformationVI信息变差衡量聚类划分的信息损失1-1 F-1基于最大流max-flow对簇进行一一匹配后的 F-1Precision / Recall / F-score对簇做精确匹配的 P/R/FLocal overlap局部重叠评估局部簇结构的重叠程度由Shen et al. (2006)定义的另一种 F-1 形式。6.2 Ubuntu IRC 解纠缠由Kummerfeld et al. (2019)人工标注模型VI1-1PrecisionRecallF-Score论文 / 来源代码BERT BiLSTM93.3-44.349.646.8Pre-Trained and Attention-Based Neural Networks for Building Noetic Task-Oriented Dialogue Systems-FF ensemble: Vote (Kummerfeld et al., 2019)91.576.036.339.738.0A Large-Scale Corpus for Conversation Disentanglement已开源Feedforward (Kummerfeld et al., 2019)91.375.634.638.036.2A Large-Scale Corpus for Conversation Disentanglement已开源FF ensemble: Intersect (Kummerfeld et al., 2019)69.326.667.021.132.1A Large-Scale Corpus for Conversation Disentanglement已开源Linear (Elsner and Charniak, 2008)82.151.412.121.515.5You Talking to Me? A Corpus and Algorithm for Conversation Disentanglement已开源Heuristic (Lowe et al., 2015)80.653.710.87.68.9Training End-to-End Dialogue Systems with the Ubuntu Dialogue Corpus已开源这张表生动展示了没有单一指标可一锤定音BERT BiLSTM 的 VI 最低93.3VI 越低越好但在 1-1/P/R/F 上并非最优FF ensemble: Intersect 的 F-Score32.1超过 Vote38.0之外的所有模型但 VI 反而最差69.3。6.3 Linux IRC 解纠缠该数据被人工标注过三轮由Elsner and Charniak (2008)标注由Mehri and Carenini (2017)标注一部分由Kummerfeld et al. (2019)标注。分别以两轮标注Kummerfeld 标注 / Elsner 标注为基准的评测结果数据模型1-1LocalShen F-1论文 / 来源代码KummerfeldLinear (Elsner and Charniak, 2008)59.780.863.0You Talking to Me? A Corpus and Algorithm for Conversation Disentanglement已开源KummerfeldFeedforward (Kummerfeld et al., 2019)57.780.359.8A Large-Scale Corpus for Conversation Disentanglement已开源KummerfeldHeuristic (Lowe et al., 2015)43.467.950.7Training End-to-End Dialogue Systems with the Ubuntu Dialogue Corpus已开源ElsnerLinear (Elsner and Charniak, 2008)53.181.955.1You Talking to Me? A Corpus and Algorithm for Conversation Disentanglement已开源ElsnerFeedforward (Kummerfeld et al., 2019)52.177.853.8A Large-Scale Corpus for Conversation Disentanglement已开源ElsnerWang and Oard (2009)47.075.152.8Context-based Message Expansion for Disentanglement of Interleaved Text Conversations-ElsnerHeuristic (Lowe et al., 2015)45.173.851.8Training End-to-End Dialogue Systems with the Ubuntu Dialogue Corpus已开源同一模型在不同标注版本Kummerfeld vs Elsner上成绩不同说明标注标准本身也是影响评测的变量对比模型时必须注明所使用的标注版本。七、如何在仓库中继续追踪对话研究7.1 定位与贡献规范本仓库在 README.md 的目录树中将 Dialogue 列为英文任务之一并在愿望清单Wish list中明确列出更多对话任务More dialogue tasks作为待补充方向。若你想为某个数据集补充新结果需要遵循仓库的贡献规范README.md优先引用已发表论文的结果、数据集须至少被一篇发表论文用作评测、推荐附带实现链接官方实现标注Official非官方实现标注Link并在表中保持成绩从高到低排序。7.2 机器可读导出所有对话数据均可通过仓库提供的解析工具导出为结构化 JSON# 在仓库根目录执行 python structured/export.py english/dialogue.md解析器按标题层级自动识别任务H1、子任务H2、数据集H3与 SOTA 表输出默认写入structured.json可用--output参数自定义文件名详见 structured/README.md。对于 MultiWOZ 这种同一数据集包含多张 SOTA 表的特殊情况解析器会走专门的分表处理分支handle_multiple_sota_table_exceptions按子数据集分别归档。7.3 本地浏览你可以按 jekyll_instructions.md 的指引在本机构建站点确认 Ruby 环境后执行bundle install与bundle exec jekyll serve即可在本地浏览器预览包含全部对话任务表格的站点english/dialogue.md 中的成绩表由_includes/table.html与_includes/chart.html这类模板组件负责渲染。结语纵观 english/dialogue.md 的六大数据集家族可以提炼出对话研究的三条主线可分解子任务对话行为分类、状态跟踪依赖精细标注与明确的自动指标端到端对话检索式、生成式在追求可复现自动评测的同时仍受限于人工评测的高成本语料工程解纠缠、多领域标注则决定了上层模型的评测边界。无论是复现 SwDA 上的 SGNN/CASA还是基于 MultiWOZ 构建状态跟踪基线本文梳理的语料、指标与 SOTA 表格加上仓库提供的结构化导出工具都可以作为你进入对话系统研究的可靠起点。【免费下载链接】NLP-progressRepository to track the progress in Natural Language Processing (NLP), including the datasets and the current state-of-the-art for the most common NLP tasks.项目地址: https://gitcode.com/gh_mirrors/nl/NLP-progress创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网