新闻详情

新闻详情

首页 / 资讯中心 / 详情

RAG 重排序:基于 Jev 实现的 rerank skill

发布时间:2026/10/1 15:58:02来源:尧图网络
RAG 重排序:基于 Jev 实现的 rerank skill
候选列表了关键结果排不对RAG 系统检索文档时一般分两步。第一步用关键词匹配或者向量检索,从语料库里先捞出一个候选池,比如三十份。这一步靠速度,几毫秒扫完整个库,目标是别漏掉正确答案,不是把正确答案排在第一。第二步是重排序,把这三十份重新排个序,让真正对的那份排到前面,这一步才决定最终喂给大模型的上下文里,排在最前面的是不是真答案。这两步的分工,用三张图能看得很清楚。一堆文档(the pile)→ 快速检索候选池(fast search shortlist)→ 重排序结果(re-ranked)。同样的几份候选,顺序在每一步都不一样。TypeSafe 官方文档里有一份 cookbook,专门讲这第二步怎么用 Jev 做。他们的实验用的是 CLERC,一个法律检索数据集,3565 段美国法院判决书节选,跑了 40 个查询,每个查询用 BM25 从候选池里挑 30 份候选。候选池里含有正确答案的比例是 100%,但正确答案排在候选池第一位的比例,只有 5%。答案就在候选池里,排在第几个,基本靠不住。原因不复杂。BM25 认词面重叠,不认语义。两段判决书都在讲即席判决的适用标准,一段是真正被引用的那个先例,另一段只是话题相似的另一个案子,词汇重叠度差不多,BM25 分不出高下。Jev 怎么打分重排序要给每一对查询-候选打一个可以互相比较的分数。用通用大模型也能做,但得自己定义打分标准,提示模型套用,反复调用还可能给出不一样的分数,一个只需要一个数字的任务,平白多花时间和钱。Jev 的做法是把打分请求变成一个是非问题,用它的Noul类型接住。问题类似这样,这份候选段落,有没有可能就是被引用的那个判例?“Noul返回一个 0 到 1 的数字,叫 noul,就是答案是’是’的概率”。判定标准写在criteria里,什么算真、什么算假,写清楚就行。每份候选单独发一次请求,互不知晓彼此。40 个查询乘以 30 份候选,一共 1200 次调用,并发跑。拿到 1200 个 noul 之后,按分数从高到低给每个候选池重新排序,重排序之后,正确答案排在第一位的比例从 5% 提到 18%,排进前五的比例从 15% 提到 35%,排进前十的比例从 38% 提到 62%。1200 次调用总共花了 0.0645 美元。照这个思路做的 rerank skill这套逻辑本身不复杂,查询加候选,单独打分,排序。麻烦的是每次都要重新写一遍调用代码。上周把这个流程做成了一个小工具,叫 jev-rerank,放在 GitHub 上。https://github.com/openwhat007/jev-rerank它同时是一个 Claude Code 和 Codex 的 agent skill。clone 到对应的 skill 目录,配一次 API 接口,以后跟 Claude 说一句帮我重排一下这些候选,它就会调这个工具。默认问题是通用的相关性判断,直接能用,场景比较窄的时候,比如判断法律引用是不是同一个具体规则,也可以自己写判断标准。支持 OpenRouter 和 TypeSafe 官方接口两种接入方式,接哪个都行,代码不用改。用一个真实例子简单验证过一次,拿Jev 什么时候发布这个问题的十条搜索结果做重排序,不改任何默认设置。原来排第一的维基百科掉到了第六,原来排第六的、专门讲发布日期的那篇文章冲到了第一。搜索引擎排的是话题相关,维基百科那篇文章内容很全,架构、定价、市场反应都讲了,但发布日期只是里面一句话。重排序排的是这条内容到底有没有直接回答问题,那篇专门讲发布日期的文章,内容窄,但正对着这个问题,分数自然更高。判断标准从跟这个话题有关换成了直接回答了这个问题,顺序就变了。对 RAG 来说,候选池召回率再高,排序这一步不做或者做得粗糙,最后喂给大模型的仍然可能是排在前面但答不上问题的那几段。重排序这一步,决定的是最终上下文质量。小结这个 skill 是给 agent 直接用的,装起来很简单,clone 下来,配上自己的 OpenRouter key 或者 TypeSafe 官方 key,两个命令就能用,不用额外写调用代码。实际用下来速度也快,单次判断只是一个概率数字,不用等模型生成一段分析再解析,一批候选并发跑完,基本秒回。Jev把”生成问题“真正的变成了程序可用的”变量“真正的加速了AI落地的工程化至于判断的结果是否正确则取决于训练的数据是否覆盖了业务如果没有则需要积累”高质量的业务数据“进行二次训练了这才是最有用的的脏活累活。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Python面部表情识别系统实战:从环境配置到摄像头实时部署全指南 2026/10/1 17:22:26

Python面部表情识别系统实战:从环境配置到摄像头实时部署全指南

简介:面向Python图像识别与深度学习的课程设计需求,此项目提供了一套完整可运行的面部表情识别分析方案。系统选取高兴与沮丧两种情绪,构建二分类识别流程,完整覆盖图像处理与图像分析两个阶段;借助Keras、TensorFlow、…

阅读更多 →
Qt源码编译OpenGL功能测试失败:configure检测机制与平台解决指南 2026/10/1 17:22:26

Qt源码编译OpenGL功能测试失败:configure检测机制与平台解决指南

简介:Qt 5.9.9在Ubuntu 14.04 LTS下执行./configure -prefix $PWD/qtbase -opensource时,常报The OpenGL functionality tests failed错误,导致配置中断。遇到该报错的开发者,可参考这套包含3个文件的排错记录与验证文件&#xff…

阅读更多 →
VMware Tools安装全指南:macOS虚拟机驱动优化与故障排查 2026/10/1 17:22:25

VMware Tools安装全指南:macOS虚拟机驱动优化与故障排查

帮你折腾过十几次macOS虚拟机的人来聊聊VMware Tools这件事。很多人在VMware里把macOS系统装好,开机一看:分辨率固定在1024x768、鼠标拖不动、剪贴板复制不了东西,还以为是系统安装有问题,其实真正的原因是缺了VMware Tools这层驱…

阅读更多 →
基于Python+OpenCV的人脸识别考勤系统实现详解 2026/10/1 17:22:25

基于Python+OpenCV的人脸识别考勤系统实现详解

简介:这是基于Python与OpenCV构建的人脸识别员工考勤系统毕业设计项目,已经过导师指导并获高分通过,适用于高校毕业设计、课程设计与期末大作业,也可作为计算机视觉初学者的人脸识别实践范本。资源包大小为197.57MB,共…

阅读更多 →
TSN网络调度与仿真:TSNkit生成门控表,OMNeT++验证闭环 2026/10/1 17:22:24

TSN网络调度与仿真:TSNkit生成门控表,OMNeT++验证闭环

简介:面向TSN网络研究与开发人员的实践资源,围绕TSNkit与OMNeT仿真框架,解决TSN网络建模、流量调度与性能验证问题。压缩包大小83.24MB,内含OMNeT工程源码、TSNkit扩展模块及YANG配置示例,目录结构清晰,便于…

阅读更多 →
基于YOLOv8的实验室防护服穿戴检测完整项目实践 2026/10/1 17:22:18

基于YOLOv8的实验室防护服穿戴检测完整项目实践

简介:基于YOLOv8的实验室防护服穿戴规范检测项目,针对实验室安全规范检查需求,面向计算机视觉、人工智能方向的毕业设计或课程设计,提供含完整数据集、源码、可视化界面及部署教程的一站式资源包。项目代码经测试可直接运行&#…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉