新闻详情

新闻详情

首页 / 资讯中心 / 详情

yao-meta-skill - output-eval-method

发布时间:2026/9/7 20:24:17来源:尧图网络
yao-meta-skill - output-eval-method
输出评估方法输出评估实验室Output Eval Lab证明技能是否改善了最终面向用户的结果而不仅仅是路由是否正确。何时使用对生产Production、库Library、受治理Governed或团队分发的技能使用输出评估。脚手架Scaffold技能可以用一个冒烟用例起步但生产级及以上在推广之前应该展示出带技能相对基线的正向信号。用例设计每个用例应该包括一个真实的提示词或任务形态任何必需的输入文件一个代表不使用技能完成任务时的基线输出一个代表技能引导行为的带技能输出可以在没有主观猜测的情况下检查的断言可选的用于品味、完整性或判断力的人工审查备注断言规则优先选择能捕捉实质性质量的断言必需的交付物路径必需的部分或契约必需的边界或排除性语言必需的证据路径禁止的通用占位符禁止的不安全操作避免只奖励措辞记忆的断言。如果一个用例可以通过复述一句话就通过却在真实工作中失败那么这个断言就太窄了。得分解读第一份 v0 记分卡报告基线通过率带技能通过率绝对差值失败的断言和失败分类当生成了reports/output_execution_runs.md时的执行模式、计时和 token 证据盲 A/B 评审包数量推荐的下一步修复生产推广应要求带技能通过率超过基线并解释每一个失败的断言。执行证据在记分卡之后运行执行证据python3 scripts/yao.py output-exec默认情况下这会记录当前用例的输出作为recorded_fixture。这对可复现性有用但它不是模型执行的证据。要收集真实的运行证据请传入--runner-command并附上命令或 JSON 字符串列表。运行器从 stdin 接收 JSON 请求并应返回包含以下内容的 JSONoutput可选的execution_kindcommand或model可选的provider和model可选的usage.input_tokens、usage.output_tokens和usage.total_tokens只有返回 provider/model 元数据或execution_kind: model的运行才应算作模型执行的。如果缺少 token 用量报告可以估算 token但估算必须标注为估算值。对于没有外部模型凭据的本地发布门槛冒烟证据使用确定性运行器python3 scripts/yao.py output-exec --runner-command[python3,scripts/local_output_eval_runner.py]这会验证命令运行器契约、计时捕获、评分路径和失败处理。它绝不能被描述为基于提供商的模型证据。对于基于提供商的证据使用带真实凭据的捆绑提供商运行器YAO_OUTPUT_EVAL_MODELgpt-4.1-mini\OPENAI_API_KEY...\python3 scripts/yao.py output-exec --provider-runner openai提供商运行器调用与 OpenAI Responses API 兼容的端点读取相对于evals/output/的输入文件返回execution_kind: model并在提供商返回用量字段时记录观察到的 token 用量。如果 API 密钥或模型缺失运行器必须失败而不是回退到固定夹具或假装存在模型证据。只有经过审查的兼容端点才使用--provider-base-url非默认的 HTTPS 主机需要--allow-custom-base-url而纯 HTTP 只允许与--allow-insecure-localhost一起用于本地测试服务器。盲 A/B 评审每次输出评估运行还应该生成reports/output_blind_review_pack.mdreports/output_blind_review_pack.jsonreports/output_blind_answer_key.json评审包必须隐藏变体 A 或变体 B 来自基线还是技能引导输出。答案密钥是独立的审计证据只有在评审者做出判断之后才能打开。评审者裁定盲审之后在reports/output_review_decisions.json中记录评审者的选择包含reviewer、reviewed_at、winner_variant、可选的confidence以及必需的基于评分标准的reason然后运行python3 scripts/adjudicate_output_review.py --write-template python3 scripts/yao.py output-review裁定报告写入reports/output_review_decisions.jsonreports/output_review_adjudication.jsonreports/output_review_adjudication.md当没有评审者决定时报告应说明用例处于待定状态Review Studio审查工作室应链接到决定模板。不要把待定用例算作人工一致。只有带评审者元数据和非空reason的真实winner_variantA或B才应计入一致率、分歧数和评审者判断数。裁定报告必须保持盲审完整性待定和无效的决定应显示预期的胜者为隐藏状态。只有在某个用例存在带理由的有效评审者决定之后才揭示expected_winner_variant。防过拟合保留一个小的公开冒烟集和一个独立的留出集。把真实的失败轮换进分类体系而不是只修改失败的提示词。每当输出看起来不错但边界仍然不清晰时就添加近似邻居用例。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Spring AI集成Milvus:从零搭建RAG知识库向量检索全流程 2026/9/7 20:54:25

Spring AI集成Milvus:从零搭建RAG知识库向量检索全流程

1. RAG 项目里,为什么偏偏是 Milvus先说结论:做 RAG 知识库,向量数据库是整个系统的“记忆中枢”。前面文档解析、切块做得再好,embedding 模型选得再强,最后检索阶段拉闸,整个问答体验一样稀碎。我见过太多…

阅读更多 →
Linux下Hadoop伪分布式安装实战:从JDK到YARN一步步搭好环境 2026/9/7 20:54:25

Linux下Hadoop伪分布式安装实战:从JDK到YARN一步步搭好环境

很多学大数据的朋友,第一个拦路虎往往不是MapReduce编程,也不是HDFS读写,而是连Hadoop环境都装不起来。网上教程一搜一大把,但要么版本老得跑不动,要么关键步骤一笔带过,照着敲完一启动就是一堆英文报错&am…

阅读更多 →
Knowhere 上手实战:四种方式把文档变成 AI 能读懂的结构化记忆 2026/9/7 20:54:25

Knowhere 上手实战:四种方式把文档变成 AI 能读懂的结构化记忆

实操篇 接上篇3个月3000 Star,这个开源项目在RAG链路上做对了什么? 上篇我们讲了 Knowhere 解决的核心问题——“解析之后、检索之前”这段空白:它把一堆被解析丢掉的 PDF 重新整理成带章节目录、表格/图片关联、跨文档链接的“文档地图”。…

阅读更多 →
Hadoop 本地模式部署全指南:从环境配置到交付验证 2026/9/7 20:54:25

Hadoop 本地模式部署全指南:从环境配置到交付验证

Hadoop的本地模式(Local Mode)是我在大数据这条路上跑通的第一个环境,也是后来给团队新人做环境验收时最常提到的一个起点。它别听着“本地”两个字就觉得低人一等。恰恰相反,本地模式是理解Hadoop运行机制最快的一条路径&#xf…

阅读更多 →
杰理SDK开发-【BUG】触摸按键提示音音量不正常,对比其它提示音音量偏大或随手机系统音量变化而变化 2026/9/7 20:54:25

杰理SDK开发-【BUG】触摸按键提示音音量不正常,对比其它提示音音量偏大或随手机系统音量变化而变化

前言 现在为止也开发了许多杰理TWS蓝牙耳机、音响项目 SDK的案子,在调试案子时不断的向前辈们学习到了很多关于蓝牙音响、蓝牙TWS耳机专业的知识。想在这里做一个学习汇总,方便各位同行和对杰理芯片SDK感兴趣的小伙伴们学习; 相关信息 项目型号:AC6973D4 SDK版本:AC897N_…

阅读更多 →
信号量:互斥、同步、死锁(伪代码解释说明) 2026/9/7 20:51:23

信号量:互斥、同步、死锁(伪代码解释说明)

一、信号量基础机制信号量由 计数器、等待队列、原子P/V操作 组成。P/V 为原子操作&#xff0c;执行过程不可被线程调度打断。P、V 标准底层逻辑// P&#xff1a;申请资源&#xff0c;资源不足则阻塞 P(S){S--;if(S < 0)线程阻塞&#xff0c;进入等待队列; }// V&#xff1a…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞