新闻详情

新闻详情

首页 / 资讯中心 / 详情

论文阅读:Advancing Semantic Textual Similarity Modeling

发布时间:2026/10/1 8:03:15来源:尧图网络
论文阅读:Advancing Semantic Textual Similarity Modeling
1. 论文信息题目 Advancing Semantic Textual Similarity Modeling: A Regression Framework with Translated ReLU and Smooth K2 Loss作者Bowen Zhang, Chunping Li会议EMNLP 2024 Main Conference论文主要研究 Semantic Textual SimilaritySTS语义文本相似度核心思路是将传统的相似度分类任务转化为回归任务直接预测两个文本之间的连续相似度。2. 研究背景传统的文本相似度任务可以将相似度划分为多个等级例如0不相似 1低相似 2中等相似 3高度相似如果使用分类方法模型最终需要预测0 / 1 / 2 / 3但这些标签本身具有明显的顺序关系。例如真实值为 2预测 3 → 与真实值比较接近 预测 0 → 与真实值差距较大普通分类损失并不能很好地体现这种“距离关系”。因此论文提出与其将相似度看成离散类别不如直接预测一个连续的相似度分数。例如QA1如何申请国家助学金 QA2国家助学金怎么申请 ↓ Similarity Regression ↓ 0.923. 论文方法论文采用两个文本分别经过共享的编码器得到表示Text A ──→ Encoder ──→ u │ ├──→ Similarity Head │ Text B ──→ Encoder ──→ v然后利用作为输入通过回归层直接得到相似度分数。对于 K 类任务最终输出层的参数规模可以从3×hidden_dimension×K →3×hidden_dimension×1两个损失函数Translated ReLU给预测误差设置一个容忍范围。当预测值已经足够接近真实值时不再继续产生梯度。只有误差超过一定范围后才继续优化。Smooth K2 Loss同样保留一个误差容忍区间但超过阈值后采用二次形式进行惩罚误差越大惩罚越强。4. 实验结果论文在 STS-12STS-16、STS-B、SICK-R 等 7 个 STS 数据集上进行实验。在作者的实验设置下BERT-base Smooth K2 Loss平均 76.03 SpearmanRoBERTa-base Smooth K2 Loss平均 76.04 Spearman整体结果表明将 STS 建模为回归任务并设计针对性的回归损失可以取得较好的语义相似度效果。论文同时比较了训练资源消耗在其设置下回归方案相比 SimCSE 使用了更低的训练显存。5. 对我们当前 LAUR 项目的启发目前的 LAUR 主要是文本 ↓ BERT LAUR ↓ 分类 Head ↓ 类别标签而新任务可能涉及QA1 QA2 ↓ 相似度学习 ↓ 连续相似度 ↓ 后续进行 QA 分组因此这篇论文给我的主要启发是考虑将 LAUR 原有的分类任务进一步扩展为相似度回归任务。也就是原 LAUR 文本 → LAUR → 分类 可能的后续方向 QA1 QA2 ↓ LAUR ↓ Similarity Regression ↓ 相似度分数这样仍然保留了 LAUR 的持续学习特点同时改变任务目标。6. 与任务的联系都涉及文本/问答之间的语义相似度都可以采用连续相似度而不是简单分类标签回归结果可以进一步用于后续的相似 QA 分组因此这篇论文更适合作为LAUR 从分类任务向相似度回归任务扩展7. 总结这篇论文最核心的思想将具有连续语义关系的文本相似度从分类问题转化为回归问题并通过 Translated ReLU 和 Smooth K2 Loss 改善回归训练。现有 LAUR ↓ 持续学习 ↓ 分类任务 ↓ ──────────── ↓ 相似度回归 ↓ QA 两两相似度 ↓ 进一步进行分组
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

数据结构全梳理:从数组链表到哈希表与复杂度分析 2026/10/1 11:10:56

数据结构全梳理:从数组链表到哈希表与复杂度分析

读过多年书,带过新人,也在线上给别人看过代码,发现一个非常有意思的现象:很多人写程序,真正卡住的不是语法,不是框架,而是“数据该怎么摆”。一次简单的查询优化,有人能把数组复制出…

阅读更多 →
数据结构入门指南:从线性表到哈希表,掌握核心原理与应用 2026/10/1 11:10:47

数据结构入门指南:从线性表到哈希表,掌握核心原理与应用

1. 数据结构是什么,为什么每个程序员都绕不开它我第一次接触数据结构这个词是在大二的数据结构课上,当时完全不明白这门课到底在讲什么。链表、栈、队列、二叉树,每一个概念都抽象得要命,考试前背了一堆定义,考完就忘。…

阅读更多 →
【共创稿事节】喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录 2026/10/1 11:10:39

【共创稿事节】喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录

喵屿 Pura X Max 折叠屏适配:HarmonyOS Dev Assistant 实战全记录 本文基于「喵屿」应用在 HUAWEI Pura X Max 折叠屏上的一多适配实战,结合 HarmonyOS Dev Assistant 的官方能力与全流程编排,系统梳理插件介绍、安装配置、一多适配能力、一次…

阅读更多 →
Matlab中用CNN做单输入单输出时间序列预测的完整实践指南 2026/10/1 11:10:33

Matlab中用CNN做单输入单输出时间序列预测的完整实践指南

上个月我在做一个设备振动信号的预测任务:输入过去20个采样点的振动幅值,预测下一个采样点的数值。这就是典型的单输入单输出时间序列预测——只有一个特征序列作为输入,输出也只是一个未来值。我一开始用的ARIMA,后来同时试了LST…

阅读更多 →
基于Spring Boot的自习室预订座位管理系统:从规则设计到并发实践 2026/10/1 11:10:24

基于Spring Boot的自习室预订座位管理系统:从规则设计到并发实践

1. 为什么这类系统总在“预选座”和“实际履约”之间翻车先说个我亲眼见过的场景:学校考研自习室,两百多个座位,每天早上六点半开门,五点半就有人在门口排队。有人为了占座,把复习资料往桌上一堆,一整天人都…

阅读更多 →
Node-RED低代码可视化:零Node.js基础构建工业数据看板 2026/10/1 11:10:10

Node-RED低代码可视化:零Node.js基础构建工业数据看板

1. 这不是写代码,是搭积木:为什么“拖拽可视化”能绕过Node.js门槛 “即使不会node.js,拖拽就可完成数据的可视化展示”——这句话乍看像营销话术,但背后是一套真实存在的、已被工业现场和中小团队验证数年的低代码可视化路径。它…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉