新闻详情

新闻详情

首页 / 资讯中心 / 详情

Large Language Models Assisting Ontology Evaluation

发布时间:2026/10/4 14:22:23来源:尧图网络
Large Language Models Assisting Ontology Evaluation
文章主要内容总结研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献:提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。评估LLM在自动CQ验证中的效果,发现o1-preview和o3-mini的表现接近人类平均水平。通过19位来自8个国际机构的知识工程师参与的用户研究,表明LLM建议能提高验证准确性(尤其建议正确时)、降低任务难度,但错误建议会降低人类表现,揭示了效率与准确性的权衡。关键发现:自动评估中,o1-preview在OntoEval数据集上的macro-F1达0.66,优于其他模型。半自动评估中,正确LLM建议使用户准确率提升13%,错误建议使准确率下降28%;整体上LLM辅助未显著改变准确率,但降低了任务难度感知。任务难度与准确率呈中等负相关,且用户存在学习效应,无辅助时学习效果更明显。创新点
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersona... 2026/10/4 14:22:09

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersona...

文章主要内容和创新点 主要内容 本文旨在探究价值相似性对大型语言模型(LLMs)代理间关系建立的影响,通过两个实验验证“价值相似性越高,信任和人际亲密感越强”这一社会科学原则在人工社会中是否成立,并考虑语言(英语和日语)对结果的影响。 初步实验:评估不同LLM、提…

阅读更多 →
Auto-Formulating Dynamic Programming Problems with Large Language Models 2026/10/4 14:21:40

Auto-Formulating Dynamic Programming Problems with Large Language Models

文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)实现动态规划(DP)问题的自动建模,旨在解决传统DP建模依赖专家知识、现有LLM方法在DP任务中表现不佳的问题。主要内容包括: 问题背景:DP作为运筹学中的核心方法,其建模涉及多阶段决策和随机过渡,且现实场景中的DP问…

阅读更多 →
Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large... 2026/10/4 14:21:36

Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large...

文章主要内容和创新点 主要内容 本文是一项关于大型语言模型(LLMs)处理事实与反事实信息竞争机制的可复现性研究,重点探究注意力头在这一过程中的作用。研究旨在复现并整合Ortu等人、Yu等人及McDougall等人的三项近期研究成果,通过机械可解释性工具分析模型习得事实与矛盾…

阅读更多 →

最新相关资讯

【外设】之大彩串口显示屏 2026/10/4 15:04:22

【外设】之大彩串口显示屏

大彩串口屏初步使用 1 .官网下载 STM32 屏幕 GUI 设计资料 http://www.gz-dc.com/category/typeid/4112 找到 STM32 Keil 工程,移植相关代码因项目而异进行移植,由于项目简单,本人只对用到的指令接口进行修改。 比如:注意事项&…

阅读更多 →
无法下载Windows系统iso文件 2026/10/4 15:02:13

无法下载Windows系统iso文件

当我遇到这个问题的时候,我打开了一个网站: 登录 然后我打算下载的时候: 突然那个官方的连接就可以下载了:

阅读更多 →
【清华代码熊】DeepSeek V4.1 Flash 后训练详解 2026/10/4 14:32:28

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

📌 上期解析了 DeepSeek V4.1 Flash 模型架构改进,本期解析 DeepSeek V4.1 Flash 预训练/后训练技术: 🌟 预训练:45T 文本 多模态混合语料、直接训练 sparse attention(取消 DeepSeek V4 的 dense 冷启动&…

阅读更多 →
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ... 2026/10/4 14:31:41

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic ...

文章主要内容和创新点 主要内容 本文聚焦于多模态大语言模型(MLLM)强化学习(RL)训练中的效率问题,提出了一个名为Shuffle-R1的框架。研究发现,当前RL训练存在两个关键缺陷: 优势值坍缩(Advantage Collapsing):批次中大多数优势值集中在零附近,导致有效梯度信号被淹…

阅读更多 →
PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction 2026/10/4 14:31:34

PRvL: Quantifying the Capabilities and Risks of Large Language Models for PII Redaction

一、文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)实现个人身份信息(PII)脱敏的研究,旨在解决传统脱敏方法(如基于规则的系统、领域特定命名实体识别(NER)模型)泛化能力差、跨格式/跨语境适应性弱的问题。 研究通过全面评估多种LLM架构(包括密集型LLM(D-LLM…

阅读更多 →
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model 2026/10/4 14:31:34

LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model

文章主要内容和创新点 主要内容 本文聚焦于二进制图像-文本相关性评估任务(判断图像与文本“相关”或“不相关”),针对该任务中文本格式多样、相关性定义随场景变化等挑战,提出了基于多模态大语言模型(MLLM)的解决方案LLaVA-RE。 模型设计:LLaVA-RE基于LLaVA 1.5架构,…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉