新闻详情

新闻详情

首页 / 资讯中心 / 详情

可观测性开箱即用:Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析

发布时间:2026/9/26 6:56:43来源:尧图网络
可观测性开箱即用:Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析
可观测性开箱即用Archestra中OpenTelemetry追踪、Prometheus指标与日志体系全解析【免费下载链接】archestraEnterprise AI Platform with guardrails, MCP registry, gateway orchestrator项目地址: https://gitcode.com/gh_mirrors/ar/archestraArchestra 是企业级 AI 平台带 AI 护栏、MCP 注册中心、网关与编排器它的可观测性开箱即用内置 OpenTelemetry 分布式追踪、Prometheus 指标暴露与 OTLP 日志导出配合官方 Grafana 仪表盘无需自研监控代码就能看清每一次 LLM 调用的延迟、Token 消耗与成本。本文带你完整走查这套 可观测性体系 的三大支柱。为什么 AI 平台需要一套完整的可观测性传统 Web 应用看 QPS 和错误率就够了但 AI 平台多了一个钱袋子和黑盒子成本不可见一次对话可能触发多轮 LLM 调用和 MCP 工具执行不追踪就不知道哪个 Agent 在烧钱延迟难归因用户抱怨慢到底是模型首 Token 慢还是平台自身的鉴权、护栏、工具调度慢行为难审计Agent 调用了哪些工具、传了什么参数、模型回了什么出问题时拿不出证据Archestra 用 OpenTelemetryOTel Prometheus Loki 这套业界标准组合回答了以上三个问题且全部以标准协议导出——你可以接 Jaeger、Tempo、Grafana Cloud 等任意 OTLP 兼容后端。一张图看懂指标、追踪、日志三条管道Archestra 的可观测性数据流向如下Web 进程在http://localhost:9050/metrics暴露 Prometheus 格式指标独立的Worker 进程Helm 部署默认形态在:9000/metrics暴露任务队列与知识库流水线指标追踪与日志统一通过 OTLP 协议发到 OpenTelemetry Collector默认http://localhost:4318追踪走/v1/traces日志走/v1/logsCollector 将追踪写入Grafana Tempo、日志写入Loki再由 Grafana 统一呈现仓库里附带了一套开箱即用的开发环境编排一条命令拉起 Tempo、Loki、OTel Collector、Prometheus、Grafana 全家桶编排文件docker-compose.observability.ymlPrometheus 抓取配置prometheus.yml每 10 秒抓取一次 Archestra 指标Collector 管道配置otel-collector-config.yamlPrometheus 指标全解LLM 成本与延迟一眼看清核心 LLM 指标建议优先关注指标名含义llm_request_duration_secondsLLM 请求耗时可按 provider、model、agent、状态码细分llm_tokens_totalToken 消耗input/output 分开计数llm_cost_total美元成本估算真实计费口径用sum(llm_cost_total{billing_modemetered})llm_time_to_first_token_seconds首 Token 时间TTFT挑低延迟模型的好依据llm_time_to_first_byte_seconds首字节时间含平台自身鉴权/护栏开销与 TTFT 对比即可分离平台慢还是模型慢llm_tokens_per_second输出吞吐tokens/sllm_active_users24h/7d 活跃用户数跨副本聚合请用max()而非sum() 小技巧llm_cache_tokens_total、llm_cache_savings_total还能单独追踪提示词缓存省了多少钱对重度使用长 System Prompt 的团队很实用。其他值得接入告警的指标组MCP 指标mcp_tool_calls_total、mcp_tool_call_duration_seconds追踪工具调用成功率与耗时mcp_server_deployment_status可统计自托管 MCP 服务器处于 running / hibernated 等状态的数量RAG / 知识库指标rag_connector_syncs_total、rag_embedding_batches_total、rag_query_duration_seconds覆盖同步、向量化到检索的全链路任务队列指标task_queue_tasks_dead_total进入死信队列是最该告警的信号应用层指标HTTP 请求直方图、Node.js 事件循环滞后nodejs_eventloop_lag_seconds、V8 堆内存、进程 CPU/内存OpenTelemetry 分布式追踪LLM 调用的全链路视角只需一个环境变量开启ARCHESTRA_OTEL_EXPORTER_OTLP_ENDPOINThttp://your-collector:4318支持 Bearer / Basic 认证ARCHESTRA_OTEL_EXPORTER_OTLP_AUTH_*系列变量不配置则匿名导出。默认追踪什么默认只采集 GenAI 相关的干净追踪避免噪音LLM API 调用——专属 Span 记录模型、Token、耗时命名如chat gpt-4o-miniMCP 工具调用——execute_tool {tool_name}含被护栏拦截mcp.blockedtrue的决策记录知识库操作——Embedding / Rerank 调用同样有 Span 与成本追踪Skill 沙箱执行——Rust 原生运行时导出service.namearchestra-sandbox-rs的 Span需要看 HTTP 路由等基础设施细节时设置ARCHESTRA_OTEL_VERBOSE_TRACINGtrue会话级统一追踪一次对话一棵树内置 Chat 的每轮对话会生成一棵统一的追踪树chat {agentName} ← 父 Span ├── chat {model} ← LLM 调用 ├── execute_tool {工具名} ← MCP 工具执行 └── chat {model} ← 工具结果后的追问通过X-Archestra-Session-Id头传入会话 ID即可按gen_ai.conversation.id把同一 Agent 会话的所有调用聚合到一条时间线上无论入口是 Chat UI、A2A 协议、MS Teams 还是 Emailroute.category与archestra.trigger.source都能帮你按渠道过滤。两个实用特性内容捕获默认把 Prompt / Completion / 工具参数与结果记录为 Span 事件单事件截断至 10,000 字符便于完整审计可用ARCHESTRA_OTEL_CAPTURE_CONTENTfalse关闭。若启用了静态内容加密该项默认自动关闭防止密文数据库的内容以明文外泄指标跳追踪Exemplars所有 LLM 与 MCP 指标都携带追踪示例点在 Grafana 中点击某个指标数据点可直接跳转到 Tempo 中对应的 Trace——从发现异常到定位请求只需一次点击日志体系从 OTel Collector 到 Loki 的闭环Archestra 的日志不走各容器 stdout 各自为政的老路OTel Collector 统一接收 OTLP 日志并转发到 LokiLoki 3.x 原生支持 OTLP 摄取开发环境的管道在 otel-collector-config.yaml 中定义。Grafana 数据源配置还开启了traces-to-logs 双向跳转从一条追踪按service.name标签直接捞出相关日志见 datasources.yml。真用户监控RUM把用户怎么用也变成日志除基础设施遥测外Archestra 还支持Real User Monitoring企业版功能浏览器端事件经后端转发为你的 OTLP 日志记录只需设置ARCHESTRA_RUM_EXPORTER_OTLP_ENDPOINThttp://your-collector:4318捕获的事件是封闭白名单——session.start、page_view、Core Web VitalsLCP/CLS/INP、主线程长任务、客户端错误指纹、API 请求耗时等且不包含聊天内容、姓名、原始 URL 等敏感信息隐私友好。在 Grafana Loki 中按{service_nameArchestra Web}查询即可搭建用量看板5 个官方 Grafana 仪表盘克隆即用平台内置 5 个覆盖全场景的仪表盘 JSON位于 platform/dev/grafana/dashboards/仪表盘关注点GenAI ObservabilityLLM 请求、Token、成本、延迟与追踪MCP Monitoring工具调用成功率、错误率、耗时Agent Sessions会话级审计可下钻 LLM 调用 / 工具调用 / 关联日志Application MetricsHTTP 流量、Node.js 健康、任务队列、PostgreSQLRAG Knowledge Base连接器同步、Embedding 管道、检索性能配合 install-dashboards.sh 脚本可一键导入全部仪表盘幂等可重复执行并通过--postgres-provider适配 OTel Collector / Cloud SQL / Azure 等不同数据库指标来源。快速上手三步搭好最小可观测性环境启动全家桶运行docker compose -f platform/dev/docker-compose.observability.yml up -dGrafana 监听 3002 端口指向 Collector给 Archestra 后端设置ARCHESTRA_OTEL_EXPORTER_OTLP_ENDPOINT本地开发时默认http://localhost:4318即可验证闭环发起一次 Chat 对话 → 打开 Grafana 的 GenAI Observability 面板 → 点击llm_request_duration_seconds的某个数据点 → 通过 Exemplar 直达 Tempo 中的完整追踪 → 再按 trace ID 捞出 Loki 日志 生产环境Helm 部署提醒worker 是独立进程请确保抓取配置同时覆盖 web 的:9050与 worker 的:9000两个指标端点否则任务队列与知识库流水线指标会缺失。小结Archestra 把企业级 AI 平台最头疼的看得见、算得清、查得到做成了默认能力Prometheus 指标回答花了多少钱、快不快OpenTelemetry 追踪回答这次调用到底发生了什么Loki 日志与 RUM回答用户和产品实际表现如何。三者共享同一套 OTLP 管道与 Grafana 呈现层标准协议意味着你可以随时替换后端而不必改动一行平台代码。 更多细节请查阅官方文档platform-observability.md部署相关环境变量见 platform-deployment.md 的Observability Metrics章节。【免费下载链接】archestraEnterprise AI Platform with guardrails, MCP registry, gateway orchestrator项目地址: https://gitcode.com/gh_mirrors/ar/archestra创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Codex CLI 用量限制全解析:从报错到恢复的排查与优化指南 2026/9/26 6:56:38

Codex CLI 用量限制全解析:从报错到恢复的排查与优化指南

1. 从一次深夜报错说起:Codex CLI 的用量限制到底卡在哪那天晚上十一点多,我正用 Codex CLI 跑一个批量代码审查任务,前面几十个文件都顺顺利利,结果到第 N 个请求时终端突然甩出一行红字:Youve hit your usage limit。…

阅读更多 →
基于Spring Boot+Vue的高校教育资源共享平台完整实现方案 2026/9/26 6:56:38

基于Spring Boot+Vue的高校教育资源共享平台完整实现方案

在高校里做资源共享平台,最麻烦的从来不是代码,而是“资源分散”这件事本身。最近帮一位学弟完整实现了一个基于Spring Boot Vue的前后端分离高校教育资源共享平台,从需求梳理、数据库设计、接口开发,到前端联调、Docker部署&…

阅读更多 →
Java八种基本类型全解析:从JVM设计到包装类陷阱 2026/9/26 6:56:38

Java八种基本类型全解析:从JVM设计到包装类陷阱

前阵子帮一位准备跳槽的朋友做模拟面试,他背了一堆Spring Boot、Redis、消息队列的八股文,结果我上来第一句问“Java八种基本类型是哪八种,六种数字类型分别是什么?”他先愣住了,然后答出“byte、short、int、long、fl…

阅读更多 →
angle bisector: The angle bisector divides the angle into two equal parts. 2026.09.25 2026/9/26 6:56:38

angle bisector: The angle bisector divides the angle into two equal parts. 2026.09.25

中秋节数学复习angle bisector: The angle bisector divides the angle into two equal parts. 角平分线把角分成两个相等的角标准尺规作图

阅读更多 →
Codex CLI 用量限制报错全解析:从触发机制到解决方案 2026/9/26 6:56:38

Codex CLI 用量限制报错全解析:从触发机制到解决方案

1. 从一次深夜报错说起:Codex CLI 的用量限制到底卡在哪那天晚上十一点多,我正用 Codex CLI 跑一个批量代码重构任务,前面几十个文件都顺顺利利,结果下一条命令直接甩回来一句Youve hit your usage limit。当时第一反应是网络问题…

阅读更多 →
生产总监绩效考核指标体系构建与生产管理效能优化路径 2026/9/26 6:56:32

生产总监绩效考核指标体系构建与生产管理效能优化路径

在企业的运营管理中,关键绩效指标(KPI)是评估生产总监和管理团队表现的重要工具。财务类、内部运营类、客户类和员工类的指标,能够直观地反映出公司在不同方面的运作状况,并为战略决策提供数据支持。通过对这些指标的详细拆解,企业可以精准识别优劣势,优化资源配置,提高…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉