新闻详情

新闻详情

首页 / 资讯中心 / 详情

Comet × LangSmith集成指南:把Agent Skill评估与Trace追踪带入企业生产环境

发布时间:2026/9/30 9:15:24来源:尧图网络
Comet × LangSmith集成指南:把Agent Skill评估与Trace追踪带入企业生产环境
Comet × LangSmith集成指南把Agent Skill评估与Trace追踪带入企业生产环境【免费下载链接】cometComet: agent skill harness for turning ideas into evaluated workflows项目地址: https://gitcode.com/rpamis/cometComet是一个面向 Agent 的 Skill 评估与运行框架agent skill harness for turning ideas into evaluated workflows内置的comet eval评估系统自带LangSmith 集成套件一次评估运行即可把 Skill 评估结果、Rubric 分数、Token 成本与 Claude Code 完整 Trace 轨迹同步到你的 LangSmith 项目让 Agent Skill 的质量评估从本地跑个报告升级为企业级的可观测、可对比、可回溯的生产实践。一、为什么要把 Comet 评估接入 LangSmithComet 的comet eval默认使用local 套件报告写在项目本地的.comet/eval/runs/里适合日常开发。但进入团队协作或生产环境后你通常需要评估数据集中存储按项目/团队统一审计对比不同 Skill 版本、不同模型、有无 Skill 注入CONTROL对照的效果差异出问题时逐轮查看 Agent 的工具调用轨迹而不只是一张汇总表。这正是 Comet 的langsmith套件要解决的问题它复用与 local 套件完全相同的任务集、treatment 组合与 Rubric 判据只把结果上报层切换到 LangSmith无需重写任何评估定义。官方说明见 docs/operations/EVAL-USAGE.md中文版本docs/operations/EVAL-USAGE-ZH.md。二、集成后你的 LangSmith 项目里会有什么LangSmith 概念Comet 映射你能看到什么Dataset example每个评估任务任务输入 预期产物、必需 Skill、Rubric 判据Experiment每个 treatmentSkill 组合CONTROL与注入 Skill 的实验并排对比Run outputs每次运行轮次数、工具调用数、耗时、Token、成本、调用的 SkillFeedback scoresRubric 各维度 检查通过率rubric.*分项分数与checks_pass_rate嵌套 TraceClaude Code 完整轨迹逐轮对话、工具调用细节三、三步完成集成第 1 步获取仓库并配置 API Keygit clone https://gitcode.com/rpamis/comet cd comet/eval uv sync --extra langsmith然后在eval/.env或eval/langsmith/.env中配置三个变量即可LANGSMITH_API_KEYlsv2_pt_... LANGSMITH_PROJECTcomet-skill-eval LANGSMITH_TRACINGtrue Comet 会从这组LANGSMITH_*配置自动派生Claude Code 官方轨迹插件所需的TRACE_TO_LANGSMITH、CC_LANGSMITH_API_KEY、CC_LANGSMITH_PROJECT通常你不需要手动设置任何CC_*变量见 eval/langsmith/README.md。第 2 步运行 LangSmith 评估套件最简方式——直接用 CLI 的--suite langsmith它会读取上述环境变量、准备轨迹插件并写入项目本地报告comet eval ./my-skill --suite langsmith --html也可以走 pytest 路径做实验对比一个 treatment 对应一个 experiment用LANGSMITH_EXPERIMENT命名便于在对比页并排查看LANGSMITH_EXPERIMENTCOMET_FULL_040_BETA \ uv run pytest langsmith/tests/tasks/test_tasks.py \ --taskcomet-fix-median --treatmentCOMET_FULL_040_BETA -v LANGSMITH_EXPERIMENTCONTROL \ uv run pytest langsmith/tests/tasks/test_tasks.py \ --taskcomet-fix-median --treatmentCONTROL -v套件默认通过BENCH_TASKS_DIR等环境变量复用 eval/local/ 中的任务、treatment 与 Skill 库机制定义在 eval/langsmith/tests/conftest.py所以你在 LangSmith 里看到的评估口径与本地报告完全一致。CLI 侧的实现入口是 app/commands/eval.ts。第 3 步可选启用 Claude Code 全链路轨迹只需保持LANGSMITH_TRACINGtrue。首次运行时套件会用node:20容器把官方langsmith-tracing插件一次性构建到eval/.cache/langsmith-cc-plugin缓存目录之后运行直接复用并只读挂载进任务容器。轨迹会通过CC_LANGSMITH_PARENT_DOTTED_ORDER嵌套在对应的 run 下。几点行为保证便于生产环境放心使用轨迹追踪是best-effort插件缺失或构建失败时只跳过轨迹Rubric 与 treatment 对比照常上报不会弄挂评估想固定版本或关闭自动构建可设置CC_LANGSMITH_PLUGIN_DIR指向宿主机插件目录或CC_LANGSMITH_PLUGIN_AUTO_BUILDfalse。四、如何在 LangSmith 里读结果先看实验对比页同一任务下CONTROL与注入 Skill 的实验并排放置rubric.*分数与checks_pass_rate一眼可见优劣再看单 run 详情轮次数、工具调用、Token 与成本异常时下钻到嵌套的 Claude Code Trace 定位具体哪一步走偏失败归因本地 HTML 报告同时会给出 harness / workflow / task / model 四级 failure attribution可用来区分评估环境问题和Skill 真实能力问题。五、常见问题速查现象原因与处理环境里开了 tracingLangSmith 却没有任何 experiment未加--suite langsmith。Local 套件不会创建 LangSmith 实验必须显式选择 langsmith 套件运行被跳过、提示凭据缺失套件对非单元测试运行强制校验LANGSMITH_API_KEY配置到eval/.env即可只有分数没有轨迹轨迹插件未就绪。等待首次自动构建完成或用CC_LANGSMITH_PLUGIN_DIR指定已构建插件目录只想低成本冒烟comet eval ./my-skill --quick --html使用固定 smoke 任务不消耗完整评估六、延伸资料评估套件总览与排错指引docs/operations/EVAL-USAGE-ZH.mdLangSmith 套件安装、运行与轨迹插件细节eval/langsmith/README.md套件环境装配与插件自动构建逻辑eval/langsmith/tests/conftest.py上报封装inputs / outputs / feedback实现eval/langsmith/tests/tasks/test_tasks.py可复用的任务与 treatment 语料库eval/local/LangSmith CLI 命令实现app/commands/eval.ts按这套流程走下来你的 Agent Skill 评估就同时拥有了本地 HTML 报告快速反馈与LangSmith 集中观测生产审计双通道——同一套任务、同一套 Rubric数据口径完全一致可以直接支撑版本回归与模型选型的量化决策。【免费下载链接】cometComet: agent skill harness for turning ideas into evaluated workflows项目地址: https://gitcode.com/rpamis/comet创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2200张YOLO疼痛检测数据集实操:从标注到训练避坑指南 2026/9/30 10:13:14

2200张YOLO疼痛检测数据集实操:从标注到训练避坑指南

最近在整理手上的医疗健康项目时,发现“疼痛检测”这个方向的热度比我预想的高很多。临床医生觉得它实用,患者不一定能准确描述自己的疼痛程度;算法工程师却觉得头疼,因为“疼”本身没有一个统一的标注标准。我这次花了不少时间&a…

阅读更多 →
Jev决策模型:不生成文字的Agent架构如何颠覆传统LLM决策 2026/9/30 10:13:14

Jev决策模型:不生成文字的Agent架构如何颠覆传统LLM决策

1. 一个Java老兵眼中的Jev:不生成文字的决策模型到底在做什么第一次看到Jev这个模型的时候,我的反应和大多数Java开发者一样:又一个Agent框架?市面上Agent框架已经多到快赶上Java的ORM框架数量了,LangChain、AutoGPT、…

阅读更多 →
Ubuntu 22.04英文桌面VMware开发环境配置指南 2026/9/30 10:13:14

Ubuntu 22.04英文桌面VMware开发环境配置指南

1. 为什么选Ubuntu 22.04英文桌面?——从真实开发场景倒推安装逻辑 我第一次在VMware里装Ubuntu 22.04英文桌面,不是为了“尝鲜”,而是被ROS 2 Humble的CI流水线逼的。当时团队新接入一个基于Gazebo Ignition的仿真项目,CI脚本里所…

阅读更多 →
DeepSeek本地部署与API调用实战指南:绕过官网私有化接入 2026/9/30 10:13:14

DeepSeek本地部署与API调用实战指南:绕过官网私有化接入

简介:本资源是一份面向AI开发者与自然语言处理研究者的DeepSeek模型实践指南,系统梳理了非官网环境下调用DeepSeek-R1模型的三种主流路径:硅基流动与华为云平台的API接入、ChatBox客户端配置实操,以及基于LM Studio的本地部署全流…

阅读更多 →
Android RescueParty 救援机制:触发到 recovery 清数据 2026/9/30 10:13:13

Android RescueParty 救援机制:触发到 recovery 清数据

开机动画转了两三分钟,屏幕一黑,机器自己重启了;再转,再黑,再重启。反复四五轮之后,屏幕直接跳进一个蓝底或黑底的 recovery 菜单,然后提示正在清除数据。这个场景做过定制板子、安卓盒子、车机…

阅读更多 →
局域网组网实战:从物理接线到Wireshark抓包验证 2026/9/30 10:13:06

局域网组网实战:从物理接线到Wireshark抓包验证

简介:本资源是一份完整的《计算机网络》课程设计实践报告,面向高校计算机、人工智能等相关专业本科生,聚焦局域网组网这一核心实践环节,系统解决从硬件选型、服务器部署到网络接入的全流程设计问题。压缩包含1个562KB的Word文档&a…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉