新闻详情

新闻详情

首页 / 资讯中心 / 详情

用Spring Boot搭建AI成本与稳定性监控看板:Token、预算、429、熔断与降级

发布时间:2026/8/30 5:18:27来源:尧图网络
用Spring Boot搭建AI成本与稳定性监控看板:Token、预算、429、熔断与降级
文章摘要Spring AI 2.0已经可以通过Micrometer输出模型调用耗时与Token指标但企业要真正控制成本还需要把模型价格、业务场景、租户、预算、重试、Tool Calling和降级事件统一起来。本文实现一个轻量级AI成本与稳定性监控服务从ChatResponse读取Usage计算单次费用写入业务成本表同时用Micrometer记录低基数指标并提供租户月预算、场景成本、429、熔断和降级看板所需的数据模型与PromQL。一、最终要看哪些数据系统健康看板QPS P95/P99延迟 当前并发 错误率 429 超时 熔断 降级成本看板输入Token 输出Token 缓存读写Token 按模型成本 按租户成本 按业务场景成本 单任务平均成本 预算使用率质量辅助完成率 重试次数 工具调用次数 人工接管率二、为什么Prometheus不能单独做财务结算Prometheus适合趋势和告警但不适合最终账单指标可能有采样数据有保留期限实例重启和标签变化会影响序列不适合保存每个用户高基数记录难以做审计和追溯。推荐Micrometer → 实时监控 成本明细表 → 结算与审计三、价格配置模型publicrecordModelPrice(Stringprovider,Stringmodel,BigDecimalinputPerMillion,BigDecimaloutputPerMillion,BigDecimalcacheWritePerMillion,BigDecimalcacheReadPerMillion,LocalDateeffectiveFrom){}价格不能写死在业务代码中。配置表CREATETABLEai_model_price(idBIGINTPRIMARYKEY,providerVARCHAR(64)NOTNULL,modelVARCHAR(128)NOTNULL,input_per_millionDECIMAL(18,8)NOTNULL,output_per_millionDECIMAL(18,8)NOTNULL,cache_write_per_millionDECIMAL(18,8),cache_read_per_millionDECIMAL(18,8),effective_fromDATENOTNULL,effective_toDATE);模型价格变化后保留历史版本。四、请求上下文publicrecordAiCostContext(StringrequestId,StringtenantId,StringuserId,StringbusinessScene,StringpromptVersion,StringmodelTier){}tenantId和userId从认证上下文读取不信任前端直接传值。五、从ChatResponse读取UsageChatResponseresponsechatClient.prompt().user(message).call().chatResponse();Usageusageresponse.getMetadata().getUsage();读取longinputusage.getPromptTokens();longoutputusage.getCompletionTokens();longtotalusage.getTotalTokens();不同Provider的详细缓存Token可以通过统一Usage字段或getNativeUsage()读取。必须允许Usage为空这时标记为COST_UNKNOWN不要默认为0否则财务数据会被低估。六、成本计算器ComponentpublicclassAiCostCalculator{privatestaticfinalBigDecimalMILLIONnewBigDecimal(1000000);publicBigDecimalcalculate(UsageSnapshotusage,ModelPriceprice){BigDecimalinputCostcost(usage.inputTokens(),price.inputPerMillion());BigDecimaloutputCostcost(usage.outputTokens(),price.outputPerMillion());BigDecimalcacheWriteCostcost(usage.cacheWriteTokens(),price.cacheWritePerMillion());BigDecimalcacheReadCostcost(usage.cacheReadTokens(),price.cacheReadPerMillion());returninputCost.add(outputCost).add(cacheWriteCost).add(cacheReadCost);}privateBigDecimalcost(longtokens,BigDecimalperMillion){if(perMillionnull){returnBigDecimal.ZERO;}returnBigDecimal.valueOf(tokens).multiply(perMillion).divide(MILLION,10,RoundingMode.HALF_UP);}}七、成本明细表CREATETABLEai_usage_record(idBIGINTPRIMARYKEY,request_idVARCHAR(64)NOTNULL,tenant_idVARCHAR(64)NOTNULL,user_idVARCHAR(64),business_sceneVARCHAR(64)NOTNULL,providerVARCHAR(64)NOTNULL,modelVARCHAR(128)NOTNULL,prompt_versionVARCHAR(64),input_tokensBIGINT,output_tokensBIGINT,cache_write_tokensBIGINT,cache_read_tokensBIGINT,model_call_countINTNOTNULL,tool_call_countINTNOTNULL,retry_countINTNOTNULL,estimated_costDECIMAL(18,10),cost_statusVARCHAR(32)NOTNULL,duration_msBIGINT,result_statusVARCHAR(32)NOTNULL,created_atTIMESTAMPNOTNULL);索引CREATEINDEXidx_ai_usage_tenant_monthONai_usage_record(tenant_id,created_at);CREATEINDEXidx_ai_usage_scene_monthONai_usage_record(business_scene,created_at);八、为什么要记录model_call_count一次ChatClient请求可能包含第一次模型选择工具 第二次模型读取工具结果 第三次模型修复结构化输出最终Usage可能是累计值但为了分析效率还要记录模型轮次。指标平均每个业务请求模型调用次数如果从1.3突然上升到4.8可能发生Tool循环输出修复重试Agent规划失效。九、Micrometer低基数指标ComponentpublicclassAiMetrics{privatefinalMeterRegistryregistry;publicAiMetrics(MeterRegistryregistry){this.registryregistry;}publicvoidrecordCost(Stringscene,StringmodelTier,BigDecimalcost){registry.counter(enterprise.ai.estimated.cost,scene,scene,model_tier,modelTier).increment(cost.doubleValue());}publicvoidrecordFallback(Stringscene,Stringreason){registry.counter(enterprise.ai.fallback,scene,scene,reason,reason).increment();}}不要把userId requestId conversationId作为Meter标签。十、预算表CREATETABLEai_budget(idBIGINTPRIMARYKEY,scope_typeVARCHAR(32)NOTNULL,scope_idVARCHAR(128)NOTNULL,budget_monthCHAR(7)NOTNULL,warning_amountDECIMAL(18,2)NOTNULL,hard_limit_amountDECIMAL(18,2)NOTNULL,currencyVARCHAR(8)NOTNULL,UNIQUE(scope_type,scope_id,budget_month));范围ORGANIZATION PROJECT TENANT BUSINESS_SCENE十一、预算检查publicBudgetDecisioncheck(StringtenantId,Stringscene,BigDecimalestimatedRequestCost){BigDecimalmonthCostusageRepository.sumMonthCost(tenantId,YearMonth.now());BudgetbudgetbudgetRepository.findTenantBudget(tenantId,YearMonth.now());BigDecimalprojectedmonthCost.add(estimatedRequestCost);if(projected.compareTo(budget.hardLimitAmount())0){returnBudgetDecision.BLOCK;}if(projected.compareTo(budget.warningAmount())0){returnBudgetDecision.WARN;}returnBudgetDecision.ALLOW;}请求前只能估算调用后再用实际Usage结算。十二、预算接近上限如何降级80% → 告警 90% → 默认切换低成本模型 95% → 关闭非核心AI功能 100% → 阻止请求或转规则系统模型路由publicModelTierroute(BudgetDecisiondecision,ModelTierrequested){returnswitch(decision){caseALLOW-requested;caseWARN-requested.downgrade();caseBLOCK-ModelTier.NONE;};}十三、429看板区分rate_limit_exceeded insufficient_quota project_spend_limit指标enterprise_ai_429_total{ reasonrate_limit }不要把所有429合并否则无法判断应该等待重试 还是 立即停止并调整预算十四、熔断与降级指标resilience4j_circuitbreaker_state resilience4j_circuitbreaker_calls_seconds enterprise_ai_fallback_total enterprise_ai_degraded_request_total看板应显示当前熔断状态最近打开次数降级模型比例转人工数量被预算阻止数量。十五、核心PromQL输入Token速率sum by (gen_ai_request_model) ( rate(gen_ai_client_token_usage_total{ gen_ai_token_typeinput }[5m]) )输出Token速率sum by (gen_ai_request_model) ( rate(gen_ai_client_token_usage_total{ gen_ai_token_typeoutput }[5m]) )模型平均耗时sum(rate(gen_ai_client_operation_seconds_sum[5m])) / sum(rate(gen_ai_client_operation_seconds_count[5m]))业务降级速率sum by (scene, reason) ( rate(enterprise_ai_fallback_total[5m]) )十六、日报接口GetMapping(/internal/ai-cost/daily)publicDailyCostReportdaily(RequestParamLocalDatedate){returnreportService.build(date);}返回{date:2026-07-31,totalCost:128.43,totalRequests:45210,costPerSuccess:0.0031,topScenes:[],topTenants:[],fallbackCount:318,rateLimitCount:26}十七、看板布局建议第一行今日费用 月度费用 预算使用率 成功请求 单次成功成本第二行请求趋势 Token趋势 P95延迟 错误率第三行模型成本占比 业务场景成本 租户成本Top10第四行429 熔断 降级 重试 Tool失败十八、需要防止的统计错误1. Tool Calling只算最后一次模型会低估成本。2. Provider未返回Usage时记0应该记未知。3. 价格更新后重算历史历史记录应使用调用当时价格版本。4. Prometheus值作为账单不适合最终审计。5. 把userId作为指标标签造成高基数爆炸。总结一个可用的AI成本看板必须把Spring AI Usage 模型价格 业务上下文 预算 429 熔断 降级组织在一起。Micrometer负责实时健康和趋势数据库明细负责按租户、场景和请求进行成本结算与审计。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

互动短剧系统架构设计与状态机实战:从Demo到生产最佳实践 2026/8/30 19:57:11

互动短剧系统架构设计与状态机实战:从Demo到生产最佳实践

各位技术人好。最近短视频与短剧赛道的热度大家有目共睹,但一个更值得关注的新方向已经浮出水面——互动内容。无论是互动短剧、互动游戏,还是品牌定制互动广告,平台们都在用“让用户参与剧情走向”的方式提升留存和停留时长。今天我们不聊营…

阅读更多 →
以人为本AI:从感知到行动的6层连接框架详解 2026/8/30 19:57:11

以人为本AI:从感知到行动的6层连接框架详解

之前在服务机器人、无人机视觉感知、智能助手这类项目里做技术落地时,踩过不少“单点很强、整机瘫痪”的坑。视觉模型能检测出画面里的行人和障碍物,大语言模型能流畅对话,底盘控制模块也能正常运动,可一旦把几块能力串起来&#…

阅读更多 →
智能汽车与机器人同源:从控制到数据闭环的技术复用 2026/8/30 19:57:11

智能汽车与机器人同源:从控制到数据闭环的技术复用

从传闻中的“机器人员工入职”,到大众解读中的“车企与机器人公司牵手”,宇树和理想这对组合引起的讨论,已经远远超出一次商业合作本身。很多人看到的是“四足机器狗 增程汽车”的标签叠加,然后得出结论:这又是一次营销造势。但如…

阅读更多 →
具身智能跨越“死亡谷”:技术栈、数据闭环与ROS 2落地路线 2026/8/30 19:57:11

具身智能跨越“死亡谷”:技术栈、数据闭环与ROS 2落地路线

具身智能这三年从学术热词变成了产业规划里的高频词:先是概念验证,接着是地方政策、融资榜单、上市公司公告,再往前一步就是量产交付。但真正做工程的人更关心另一件事——它能不能从实验室原型变成可持续迭代、可交付、可赚钱的产品。这个阶…

阅读更多 →
老电视片段处理:FFmpeg转码、字幕制作与归档全流程 2026/8/30 19:57:11

老电视片段处理:FFmpeg转码、字幕制作与归档全流程

“2001年11月5日俄罗斯国家电视台(РТР)播出的《消息》节目片段”这个标题,把档案整理需要的基础信息都给了:频道、日期、节目名。真正的问题往往不是“能不能播放”,而是拿到这种历史电视片段之后,怎么把它变成一个能查、能播、…

阅读更多 →
DeepSeek + Pi 组合实战:编码智能体低成本接入与选型指南 2026/8/30 19:47:10

DeepSeek + Pi 组合实战:编码智能体低成本接入与选型指南

最近在 AI 编程工具圈里,DeepSeek、Pi、Claude Code 这几个关键词频繁被放在一起讨论。不少群里都在传“DeepSeek Pi 王炸组合跑赢 Claude Code”,甚至有人翻出 Pi 创始人的旧访谈,说这套组合“早就被押中了”。我翻了一圈相关技术资料&…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞