新闻详情

新闻详情

首页 / 资讯中心 / 详情

AD-Bench 实测:LLM Agent 广告投放只拿 69 分,TaoToken 统一 Key 跑通轨迹感知评估

发布时间:2026/9/27 22:09:42来源:尧图网络
AD-Bench 实测:LLM Agent 广告投放只拿 69 分,TaoToken 统一 Key 跑通轨迹感知评估
1. 为什么 AD-Bench 值得你花一个下午跑一遍AD-Bench 是腾讯团队做的一个真实广告投放场景下的 LLM Agent 评测基准全称是 AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents。它从 823 条真实广告分析请求出发不仅看 Agent 最终答案对不对还看它调用工具的轨迹合不合理。结论很扎心即便是 GPT-5.1 也只能拿到 69 分Pass3L3 复杂任务更是掉到 50% 左右。它适合谁如果你正在做广告投放分析类 Agent、想验证自己的工具调用链路是否可靠、或者单纯想复现一下最强模型也只拿 69 分这个结论AD-Bench 是目前少有的、数据来自真实业务请求的评测集。它和 GAIA、AgentBench 最大的区别在于数据不是编的评估不只看结果还看过程。我这次实测的目标很明确用 TaoToken 统一 Key 把 LLM Agent 接进 AD-Bench 的评估流程跑通轨迹感知评估并复现 GPT-5.1 的 69 分结论。下面把可复制的配置、验证动作和踩坑清单全部摊开。2. TaoToken 前置统一 Key 与 API 通道准备AD-Bench 的评估流程需要 Agent 反复调用 LLM 做规划、工具选择、参数生成和最终总结。如果每个模型都单独配一套 Key 和 endpoint切换模型复现对比会非常痛苦。TaoToken 的价值就在这里一个 Key、一个 API 通道就能在 GPT-5.1、Gemini-3-Pro、DeepSeek-V3、混元等模型之间切换特别适合做这种多模型横向评测。你需要先拿到 API Key。访问 https://taotoken.net/api-keys 创建注意这个页面是控制台里的密钥管理入口。创建后你会得到一个 sk- 开头的 Key后面所有配置都用它。API 基础地址统一用 https://taotoken.net/api不要加任何多余路径。模型名称按 TaoToken 文档里的命名填写比如 gpt-5.1、gemini-3-pro、deepseek-v3 这类。如果你不确定某个模型的确切 ID去 https://taotoken.net/doc 查模型列表或者直接在 https://taotoken.net/models 里对话测试一下。注意AD-Bench 的 Agent 会高频调用工具单次评估可能产生几十到上百次请求。建议先在模型对话页面用小样本确认模型可用再跑全量。3. 可复制配置settings.json / config.toml / CC Switch / ClineAD-Bench 官方代码基于 ReAct 框架Agent 的 LLM 调用层通常抽象成一个 provider 配置。下面给出三种常见接入方式的骨架你可以按自己用的工具选一个。3.1 settings.json 骨架通用 OpenAI 兼容格式{ llm_provider: { base_url: https://taotoken.net/api, api_key: sk-你的TaoToken密钥, model: gpt-5.1, temperature: 0.0, max_tokens: 4096, timeout: 120 }, agent: { framework: react, max_steps: 15, tool_choice: auto }, benchmark: { dataset: ad-bench, split: test, difficulty: [L1, L2, L3], trajectory_eval: true } }temperature 设 0.0 是为了让轨迹可复现AD-Bench 的轨迹覆盖率评估对随机性很敏感。max_steps 设 15 是经验值L3 任务平均需要 8-12 步留点余量。3.2 config.toml 骨架如果你用 Python 侧配置[llm] base_url https://taotoken.net/api api_key sk-你的TaoToken密钥 model gpt-5.1 temperature 0.0 max_tokens 4096 [agent] framework react max_steps 15 tool_choice auto [benchmark] dataset ad-bench trajectory_eval true judge_model gemini-3-projudge_model 单独指定是因为 AD-Bench 用 LLM Judge 判断答案正确性论文里用的是 Gemini-3-Pro。你可以通过 TaoToken 用同一个 Key 调它不用再配第二套凭证。3.3 CC Switch 配置片段如果你用 CC Switch 管理多模型切换在配置里加一个 TaoToken 的 provider{ providers: [ { name: taotoken, base_url: https://taotoken.net/api, api_key: sk-你的TaoToken密钥, models: [gpt-5.1, gemini-3-pro, deepseek-v3, hy-2.0] } ] }这样你在跑 AD-Bench 时可以在不同模型间快速切换复现论文里的对比表格。3.4 Cline 配置片段Cline 里选 OpenAI Compatible然后填{ apiProvider: openai, openAiBaseUrl: https://taotoken.net/api, openAiApiKey: sk-你的TaoToken密钥, openAiModelId: gpt-5.1 }Cline 适合你手动调试单条 AD-Bench 查询看看 Agent 实际调了哪些工具、参数传得对不对。正式跑全量还是用脚本。4. 验证请求跑通 AD-Bench 评估并复现 69 分配置好之后先做一次最小验证确认 TaoToken 通道和 AD-Bench 评估链路都通。第一步用 curl 确认 API 可达curl https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer sk-你的TaoToken密钥 \ -H Content-Type: application/json \ -d { model: gpt-5.1, messages: [{role: user, content: 返回 OK}], max_tokens: 10 }如果返回正常说明 Key 和通道没问题。第二步跑 AD-Bench 的单条 L1 任务python run_adbench.py \ --config config.toml \ --task_id L1_001 \ --trajectory_eval \ --output ./results/L1_001.json预期结果L1 任务轨迹覆盖率应该在 93% 以上答案正确。如果轨迹覆盖率低于 90%说明 Agent 漏了关键工具调用步骤检查工具定义是否和 AD-Bench 的 9 个工具对齐。第三步跑 L3 任务验证难度梯度python run_adbench.py \ --config config.toml \ --task_id L3_042 \ --trajectory_eval \ --output ./results/L3_042.jsonL3 任务你会看到轨迹覆盖率明显下降GPT-5.1 大概在 50-70% 之间答案正确率也掉到 50% 左右。这和论文里 L3 Pass3 约 50% 的结论一致。第四步跑全量复现 69 分python run_adbench.py \ --config config.toml \ --split test \ --pass_k 3 \ --trajectory_eval \ --output ./results/full_gpt51.json跑完后看汇总指标。GPT-5.1 的 Pass3 应该在 69% 附近Pass1 在 57% 附近。如果你跑出来偏差超过 5 个点大概率是 judge_model 不一致或者 temperature 没设 0。5. 本篇常见错排查清单报错一401 Unauthorized。检查 api_key 是否带了 sk- 前缀base_url 是否写成了 https://taotoken.net/api 而不是带 /v1 的完整路径。TaoToken 的 base_url 就是 https://taotoken.net/apiSDK 会自动拼 /v1/chat/completions。报错二模型不存在。模型 ID 大小写敏感gpt-5.1 不要写成 GPT-5.1。去 https://taotoken.net/doc 确认确切 ID。报错三轨迹覆盖率始终为 0。大概率是工具名称没对齐。AD-Bench 的 9 个工具是 get_user_account_list、get_account_advertise_list、daily_data_by_group_and_field、search、filter、calculator、summarize_results、knowledge_retrieval、report。你的 Agent 工具定义必须和这些名字完全一致否则子序列匹配会全部失败。报错四L2 任务答案对但轨迹覆盖率低。这是论文里提到的 L2 弱相关现象r0.372。Agent 可能跳过了 filter 直接算或者漏了 daily_data_by_group_and_field 的分组步骤。检查 Agent 的规划 prompt强制它先筛选再计算。报错五L3 任务跑到一半上下文超限。这就是论文里的 E4 依赖性崩溃。解决办法是在 Agent 里加信息压缩检索结果超过 2000 token 时先 summarize_results 再进下一步不要把原始数据全塞进上下文。报错六LLM Judge 判断不稳定。judge_model 固定用 gemini-3-protemperature 设 0。如果还是不稳定检查答案比对时是否做了数值归一化AD-Bench 对数值精度有要求。报错七Pass3 跑出来远低于 69%。先确认你是不是只跑了 L1 和 L2。全量 test split 包含 L1/L2/L3 三档L3 占比 29%漏掉 L3 会导致分数虚高或虚低。另外确认 pass_k 设的是 3 不是 1。6. 下一步把评估结果变成 Agent 优化动作跑通 AD-Bench 只是第一步。真正有价值的是拿轨迹覆盖率数据去定位你的 Agent 在哪一层翻车。如果 L1 覆盖率低于 93%问题在工具定义和基础规划如果 L2 答案对但覆盖率低问题在参数传递和计算精度如果 L3 覆盖率暴跌问题在多步推理的上下文管理和知识检索。想继续深入的话可以去 https://taotoken.net/coding-plan 看看长期编码和 Agent 场景的套餐适合需要反复跑评测的团队。单次验证模型能力用 https://taotoken.net/models 的对话页面就够了。接入文档和完整参数说明在 https://taotoken.net/docAPI Key 管理在 https://taotoken.net/api-keys。我实测下来最深的感受是AD-Bench 的轨迹感知评估确实能抓到蒙对答案的假阳性。如果你的 Agent 系统只监控最终答案准确率建议加上轨迹日志哪怕不跑全量 AD-Bench至少把工具调用序列记下来做子序列检查。这一步的成本很低但能提前发现很多规划层面的退化。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于YOLOv8的焊缝缺陷检测系统:从数据标注到部署全流程解析 2026/9/27 23:06:46

基于YOLOv8的焊缝缺陷检测系统:从数据标注到部署全流程解析

简介:这是一套基于YOLOv8的化工管道焊缝缺陷检测系统,面向计算机视觉、人工智能等专业学生完成毕业设计或课程设计,也可作为初学者的深度学习实战参考。项目代码经完整测试,包含可视化界面、完整数据集、部署说明,可一…

阅读更多 →
基于VGG与Flask的图像风格迁移系统实战解析 2026/9/27 23:06:46

基于VGG与Flask的图像风格迁移系统实战解析

简介:这套资源是基于VGG网络和Flask框架开发的在线图像风格迁移系统,属于计算机视觉方向的完整毕业设计。项目形态为可交互的Web应用,用户上传图片后即可应用任意风格迁移,并可调节风格化程度、选择是否保留颜色,适合毕…

阅读更多 →
1200张风电叶片缺陷图训练YOLO检测模型全流程指南 2026/9/27 23:06:46

1200张风电叶片缺陷图训练YOLO检测模型全流程指南

简介:面向风电叶片缺陷检测任务,这份已标注数据集提供约1200张图像、10个缺陷类别(含blade、drenaj、erozyon、etiket等),采用标准YOLO标注格式,适合目标检测学习者或相关领域工程师直接用于模型训练、验证…

阅读更多 →
8G 显卡跑本地大模型做代码生成:从翻车到落地 2026/9/27 23:06:46

8G 显卡跑本地大模型做代码生成:从翻车到落地

文章目录一、背景:8GB 显卡的硬约束二、方案一:Claude Code 接 Ollama(能跑,但先翻车)2.1 坑一:401 Invalid API Key(不是 Ollama 报的)2.2 坑二:Windows 的 .bat 不能有…

阅读更多 →
南京找擅长网络犯罪辩护的律师事务所,天倪律师团队提供全程法律服务 2026/9/27 23:06:32

南京找擅长网络犯罪辩护的律师事务所,天倪律师团队提供全程法律服务

随着数字技术的深度普及与互联网经济的快速发展,我国涉网刑事犯罪的数量持续增长,新型网络犯罪的形态也日趋复杂,电信网络诈骗、帮助信息网络犯罪活动、非法获取计算机信息系统数据等案件占比逐年攀升。在这类案件中,电子证据繁杂…

阅读更多 →
用 Python 拆解深圳新房按揭月供:等额本息逐月利息与本金的摊还明细 2026/9/27 23:06:32

用 Python 拆解深圳新房按揭月供:等额本息逐月利息与本金的摊还明细

数据分析按揭月供是一个固定数字,但这个数字每个月的内部结构并不一样:前期利息占比高,后期本金占比高。很多人只盯着月供总额,却没意识到同一笔月供里"还掉的欠款"和"付掉的利息"每个月都在变。本文由深工优…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉