新闻详情

新闻详情

首页 / 资讯中心 / 详情

结合 LLM 的智能检索:从“幻觉“到“可信“的文献检索实战方案 上

发布时间:2026/10/1 10:38:50来源:尧图网络
结合 LLM 的智能检索:从“幻觉“到“可信“的文献检索实战方案 上
结合 LLM 的智能检索从幻觉到可信的文献检索实战方案关键词大语言模型/智能检索/幻觉抑制/ Prompt工程/交叉验证/ RAG一、背景与痛点为什么直接用大模型查文献会翻车大语言模型LLM基于 Transformer 架构在海量数据上训练参数规模普遍超过百亿具备上下文理解、知识推理与文本生成能力被视为通往 AGI 的重要路径。自 2022 年 11 月 ChatGPT 发布以来PaLM、LLaMA、GPT-4 等模型快速迭代应用已渗透到学术研究、临床决策、法律文书、金融风险预测等专业领域。国内也进入井喷期DeepSeek、豆包、Kimi、文心一言等工具已深入人心。传统检索系统受限于关键词匹配的机械性难以应对复杂语义查询而 LLM 凭借深层语义理解可通过对话式交互精准捕捉研究意图显著提升检索效率。但问题随之而来——幻觉。幻觉Hallucination指自然语言生成模型输出的内容与原文本不符、或与现实客观事实相悖的现象。按能否通过原文本直接验证可分为内在幻觉Intrinsic Hallucinations与给定文本直接冲突外在幻觉Extrinsic Hallucinations无法从给定文本中验证、却又与事实不符。在文献检索场景下幻觉的破坏力尤其突出模型一旦编造出看起来很合理、实则不存在的论文标题、作者、会议一应俱全会直接误导研究方向严重时导致学术成果的错误推导。所以本文的核心命题就是如何让LLM检索出来的文献真实存在于现实世界二、核心思路多策略组合拳抑制幻觉研究借鉴了漏洞挖掘领域的成果——Zhang 等人[7]在将 LLM 用于漏洞挖掘时提出了二次验证机制。本报告把这一思路迁移到文献检索并组合了三种策略1.二次验证让模型对自己生成的文献再判断一次2.Prompt工程用领域限定 角色扮演 示例引导的复合指令约束输出3.交叉验证用另一个模型去校验第一个模型的答案。实验统一任务请列举近三年提出的基于 LLM的漏洞检测技术的文献并用谷歌学术核验文献真实性。核心评价指标为真实率真实率真实文献数目/生成文献总数目2.1 二次验证Self-Check原理在大模型生成回答后引导模型对自身输出再次评估借助上下文学习能力优化结果。执行流程如下对应原文图 2-1【Mermaid流程图可在支持Mermaid的平台渲染】flowchart LRU[用户] --|请列举近三年基于LLM的漏洞检测文献| L[大模型]L --|生成文献列表| UU --|请对自己生成的文献判断,给出真实存在的文献| LL --|二次验证后输出| U典型案例KimiKimi 在二次验证环节直接否定了自己初次生成的所有文献不再认可最初的输出——这说明二次验证对 Kimi 的自我纠错触发明显但也暴露出它否定虚假文献后给不出真实列表的局限。2.2 Prompt 工程领域限定 角色扮演 示例引导Prompt 是给模型的导航仪。本报告设计的复合指令模板如下原文逐字引用你是一个严谨的科研助手必须遵守以下规则1.所有陈述必须基于真实可靠的文献列表禁止胡编乱造。2.每个结论后必须标注来源文献编号。3.如果文献证据不足回答当前文献未提供充分证据。用户问题请列举近三年提出的基于LLM的漏洞检测技术的文献三段式的作用领域限定聚焦LLM 漏洞检测技术减少无关信息干扰角色扮演模拟严谨科研助手赋予专业视角与行为准则示例引导用明确规则规范输出格式提高可用性。2.3 交叉验证跨模型互验国内主流模型Kimi、豆包、腾讯元宝、文心 4.5、文心 X1多为闭源无法微调、训练数据不可见单一模型在架构、参数、数据上的差异会导致不同的局限性。做法先让上述模型各自生成答案再把答案统一投喂给DeepSeek做二次判断Prompt 为以上是询问请列举近三年提出的基于LLM的漏洞检测技术的文献之后大模型给出的答案请对其中的模型进行判断给出真实存在的文献。利用不同模型的互补优势识别并纠正单一模型的错误输出。2.4 实验结果汇总表 2-1直接询问大模型无任何优化大模型真实文献总文献真实率Kimi060豆包340.75腾讯元宝030文心 4.5150.20文心X1270.2857直接问Kimi /腾讯元宝真实率0文心系列不足30%豆包最好0.75但只给了4篇。表 2-2二次验证后大模型真实文献总文献真实率Kimi00–豆包340.75腾讯元宝020文心 4.5140.25文心X1670.8571文心X1从28.57%跃升到85.71%文心4.5从20%微升到25%Kimi否定全部虚假文献但给不出真列表豆包、腾讯元宝真实率不变。表 2-3 Prompt工程后大模型真实文献总文献真实率Kimi060豆包460.6667腾讯元宝040文心 4.5050文心X1580.625文心X1提到62.5%豆包扩量到6篇仍保持66.7%Kimi、腾讯元宝无改善文心4.5反而下降推测与模型不稳定性有关。表 2-4交叉验证后DeepSeek校验大模型真实文献总文献真实率Kimi441.00豆包111.00腾讯元宝6100.60文心 4.5360.50文心X1441.00交叉验证是四种策略里提升最猛的Kimi、豆包、文心X1全部达到100%腾讯元宝从0升到60%文心4.5从20%升到50%。同时腾讯元宝、文心4.5的总文献数也增加了说明交叉验证还能拓宽检索范围。小结单靠模型自我二次验证无法全面解决问题Prompt 工程对部分模型有效但波动大跨模型交叉验证在真实性指标上收益最高。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

MySQL连接报错排查:Linux下socket文件路径问题全解析 2026/10/1 11:36:34

MySQL连接报错排查:Linux下socket文件路径问题全解析

刚在 Linux 上装完 MySQL,兴冲冲执行 mysql -uroot -p ,结果屏幕弹出一句 Cant connect to local MySQL server through socket /var/lib/mysql/mysql.sock 。这个报错在 MySQL 安装阶段出现得极其高频,几乎每个新手都会撞一次。事实上它…

阅读更多 →
React Native鸿蒙商城App多语言设置实战与踩坑指南 2026/10/1 11:36:34

React Native鸿蒙商城App多语言设置实战与踩坑指南

如果今年你还在纠结 React Native 到底能不能在鸿蒙生态里跑起来,那我建议你找个真实项目试一试。我这段时间正好在做一个基于 RN for OpenHarmony 的商城 App,从框架选型、组件适配到多语言设置,踩了不少坑。今天先把“语言设置”这块单独拎…

阅读更多 →
表格结构检测数据集2.zip:标注解析与YOLOv8训练实战 2026/10/1 11:36:34

表格结构检测数据集2.zip:标注解析与YOLOv8训练实战

简介:表格结构检测数据集2.zip 面向文档数字化、表格结构识别(TSR)方向的算法工程师与研究者,用于训练模型自动解析表格中的行、列及跨行跨列合并单元格,可服务于发票、报表、合同等文档的自动化录入与RPA流程。资源共…

阅读更多 →
数据结构 ----- 二叉搜索树 2026/10/1 11:36:33

数据结构 ----- 二叉搜索树

BST,AVL,红黑树共性:本质都是二叉搜索树,都遵守BST规则,中序遍历的结果都是升序有序序列,节点结构都是二叉树节点:数据域左指针右指针基础操作逻辑一致,查找,插入&#x…

阅读更多 →
BRD/MRD/PRD 本质是需求穿透三阶漏斗 2026/10/1 11:36:33

BRD/MRD/PRD 本质是需求穿透三阶漏斗

简介:本资源是一份面向产品经理初学者与进阶从业者的专业文档资料,系统梳理商业需求文档(BRD)、市场需求文档(MRD)和产品需求文档(PRD)的核心定位、适用对象及协同逻辑。重点详解BRD…

阅读更多 →
OpenClaw两步部署实战:阿里云ECS+Docker容器化AI助手落地 2026/10/1 11:36:26

OpenClaw两步部署实战:阿里云ECS+Docker容器化AI助手落地

最近群里好几个朋友都在问我同一个问题:OpenClaw 到底怎么落地跑起来?说实话,第一次搞这个项目的时候我也被它的部署方式折腾了一会,文档写得不算差,但总有些细节要自己试错。后来我在阿里云的一台 2核4G 的 ECS 上把流…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉