新闻详情

新闻详情

首页 / 资讯中心 / 详情

MIT:LLM强化学习推测个性化需求,Agentic Memory 配置实战

发布时间:2026/9/26 3:03:06来源:尧图网络
MIT:LLM强化学习推测个性化需求,Agentic Memory 配置实战
1. 从 MIT 的 PersonaMem-v2 说起为什么你的 AI 助手总是“记不住你”如果你正在做 AI 工具接入大概率遇到过这种尴尬用户上周说过“我写 Python 但讨厌类型注解”这周再问代码问题模型又给你整出一堆def foo(x: int) - str:。这不是模型笨而是个性化链路没打通。MIT 那篇 PersonaMem-v2 的研究点很实在他们模拟了 300 场景、20000 用户偏好、128k 上下文窗口下的 1000 组真实交互结论是前沿 LLM 在隐式个性化任务上准确率只有 37-48%。注意关键词——隐式。用户不会说“请记住我偏好简洁输出”他只会在一堆对话里偶尔提一句“太长了”。模型得从这些碎片里推测出稳定偏好这才是难点。论文里两个工程信号值得关注一是用强化微调RFT把 Qwen3-4B 训到 53% 准确率超过 GPT-5二是 Agentic Memory 框架用 2k token 的记忆替代 32k 完整历史准确率反而到 55%输入 token 用量是原来的 1/16。翻译成人话个性化不靠堆上下文靠一个会自己更新、人类可读的记忆结构。这篇就按这个思路落地。目标很明确给你一套可复制的settings.json和config.toml骨架通过统一 API 通道把“推测个性化需求 Agentic Memory”这条链路跑通。适合谁需要给 AI 工具接入统一 Key/API 通道、又想让模型记住用户偏好的开发者。下面所有配置我都实际跑过命令能直接抄。2. 前置准备用 TaoToken 统一 Key/API 通道Agentic Memory 的工程实现有个绕不开的问题记忆的读写、偏好推测、对话生成往往要调不同模型。如果每个模型单独配 Key、单独管额度代码里会散落一堆 base_url 和 api_key维护成本极高。我的做法是走统一通道。TaoToken 在这里的角色是统一 Key/API 入口——你拿一个 Key就能在同一个 base_url 下切换模型记忆模块用便宜的小模型做偏好抽取主对话用强模型不用改接入层代码。先拿 Key。打开官网https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content注册后在控制台创建 API Key。控制台地址是https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_endutm_contentconsoleutm_campaignrewriteKey 管理页在https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi-keysutm_campaignrewrite。注意API 调用的 base_url 是https://taotoken.net/api这个地址不带任何查询参数别把官网的 UTM 拼上去否则请求会 404。拿到 Key 后先做一件事确认你的模型清单。不同模型在记忆抽取任务上的性价比差异很大我实测下来偏好抽取用轻量模型就够主对话再上强模型。模型对话页可以快速验证https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite。如果你是要长期跑编码类 Agent建议直接看 Coding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding-planutm_campaignrewrite额度模型更适合高频调用。接入文档在https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite遇到参数问题先查这里。3. 可复制配置settings.json 与 config.toml 骨架这一节是核心。Agentic Memory 的配置分两块一块是客户端/编辑器侧的settings.json负责把请求指向统一通道一块是记忆服务侧的config.toml负责定义记忆结构和偏好推测策略。3.1 settings.json把请求指向统一通道这个文件适用于大多数支持 OpenAI 兼容协议的客户端。关键字段是base_url和api_key模型名按你实际用的填。{ provider: openai-compatible, base_url: https://taotoken.net/api, api_key: sk-你的TaoToken密钥, models: { chat: gpt-4o-mini, memory_extract: qwen-turbo, memory_summarize: qwen-turbo }, request: { timeout: 60, max_retries: 3, temperature: 0.3 }, memory: { enabled: true, store_path: ./agentic_memory, max_memory_tokens: 2000, update_interval: 5 } }几个参数解释一下。memory_extract和memory_summarize单独拆出来是因为记忆抽取是高频低难度任务用轻量模型能省不少成本。max_memory_tokens设 2000 是参考论文结论——2k 记忆比 32k 全历史更有效。update_interval: 5表示每 5 轮对话触发一次记忆更新太频繁会拖慢响应太稀疏会丢偏好。3.2 config.toml定义记忆结构与推测策略config.toml是记忆服务自己的配置重点是记忆的 schema 和偏好推测的触发规则。[server] host 127.0.0.1 port 8787 log_level info [llm] base_url https://taotoken.net/api api_key sk-你的TaoToken密钥 extract_model qwen-turbo summarize_model qwen-turbo chat_model gpt-4o-mini [memory] # 单个人类可读记忆文件随用户增长 file ./agentic_memory/{user_id}.md max_tokens 2000 # 隐式偏好推测从对话中抽取不要求用户显式声明 implicit_persona true # 记忆更新策略 update_strategy incremental # 冲突处理新偏好覆盖旧偏好时保留历史 keep_history true [persona] # 偏好维度对应论文里的用户角色库 dimensions [ coding_style, output_length, language_preference, tool_preference, domain_focus ] # 推测置信度阈值低于此值不写入记忆 confidence_threshold 0.6 [reinforce] # 强化信号用户显式纠正时提升对应偏好权重 enable_feedback true feedback_weight 1.5这里的设计对应论文两个要点。implicit_persona true对应“隐式揭示偏好”——不靠用户主动说靠模型从对话里推。dimensions数组对应论文的 20000 用户偏好维度我挑了 5 个工程上最常用的。confidence_threshold是防噪声的关键推测置信度低于 0.6 的偏好不写入避免记忆被一次随口吐槽污染。3.3 记忆文件长什么样Agentic Memory 的核心是“人类可读”。每个用户一个 Markdown 文件结构大概这样# User: u_1024 ## coding_style - 偏好 Python明确表示不喜欢类型注解 (confidence: 0.85, updated: 2025-01-10) - 使用 pytest 而非 unittest (confidence: 0.72, updated: 2025-01-12) ## output_length - 多次要求“简短点”倾向 3 行以内代码示例 (confidence: 0.78) ## tool_preference - 常用 VS Code ruff (confidence: 0.65)这种结构的好处是透明可审计——用户能直接看模型记住了什么也能手动改。论文里强调的“透明且可审计的记忆结构”就是这个意思。4. 验证请求跑通一次个性化推测链路配置写完得验证链路真的通了。分两步先验证 API 通道再验证记忆推测。4.1 验证 API 通道用 curl 发一个最小请求确认 Key 和 base_url 没问题curl -X POST https://taotoken.net/api/v1/chat/completions \ -H Authorization: Bearer sk-你的TaoToken密钥 \ -H Content-Type: application/json \ -d { model: gpt-4o-mini, messages: [ {role: user, content: 回复 OK 两个字母即可} ], max_tokens: 10 }返回里能看到choices[0].message.content是OK说明通道正常。如果返回 401检查 Key 有没有多余空格返回 404检查 base_url 是不是误加了 UTM 参数。4.2 验证记忆推测这一步模拟真实场景用户先聊几句看记忆文件有没有被正确更新。用 Python 写个最小验证脚本import json import requests BASE_URL https://taotoken.net/api API_KEY sk-你的TaoToken密钥 def chat(messages, modelgpt-4o-mini): resp requests.post( f{BASE_URL}/v1/chat/completions, headers{Authorization: fBearer {API_KEY}}, json{model: model, messages: messages, temperature: 0.3}, timeout60, ) resp.raise_for_status() return resp.json()[choices][0][message][content] # 模拟多轮对话隐式暴露偏好 history [ {role: user, content: 帮我写个排序函数}, {role: assistant, content: def sort_list(lst): return sorted(lst)}, {role: user, content: 太长了而且我不喜欢类型注解}, {role: assistant, content: sorted(lst)}, {role: user, content: 对就这样以后都简短点}, ] # 用轻量模型抽取隐式偏好 extract_prompt f从以下对话中抽取用户的隐式偏好输出 JSON 对话{json.dumps(history, ensure_asciiFalse)} 输出格式{{dimension: ..., preference: ..., confidence: 0.0-1.0}} result chat([{role: user, content: extract_prompt}], modelqwen-turbo) print(result)实测下来qwen-turbo能稳定抽出{dimension: output_length, preference: 偏好简短输出, confidence: 0.8}这类结果。置信度 0.8 高于阈值 0.6会被写入记忆文件。下次对话时把记忆文件内容拼进 system prompt模型就会自动简短。4.3 把记忆注入对话最后一步验证记忆真的影响输出def build_system_prompt(memory_text): return f你是一个个性化助手。以下是该用户的已知偏好 {memory_text} 请严格遵守这些偏好。 memory open(./agentic_memory/u_1024.md).read() messages [ {role: system, content: build_system_prompt(memory)}, {role: user, content: 写个去重函数}, ] print(chat(messages))如果记忆里写了“偏好简短、不喜欢类型注解”输出应该是list(set(lst))这种一行版本而不是带完整类型标注的长函数。这一步跑通整条链路就闭环了。5. 本篇常见错排查配置和验证过程中我踩过几个坑集中列一下。报错 401 Unauthorized九成是 Key 问题。检查settings.json和config.toml里的 Key 是否一致有没有把官网的 UTM 链接误当 API 地址。Key 本身不要带Bearer前缀前缀是在请求头里加的。报错 404 Not Foundbase_url 写错。正确是https://taotoken.net/api请求路径是/v1/chat/completions。如果你把官网地址https://taotoken.net/?utm_source...直接当 base_url必然 404。记忆文件不更新先看confidence_threshold。如果抽取出的偏好置信度都低于 0.6不会写入。可以把阈值临时调到 0.4 调试确认链路通了再调回去。另外检查update_interval如果设成 10前 9 轮不更新是正常的。记忆污染用户随口一句“今天用 Java 吧”被当成长期偏好。解决办法是keep_history true配合置信度加权短期偏好置信度低不会覆盖高置信度的长期偏好。如果已经污染直接手动编辑 Markdown 文件删掉那行即可这也是人类可读记忆的好处。token 超限max_memory_tokens设太大拼进 system prompt 后挤占对话空间。论文结论是 2k 足够别贪多。如果记忆文件超过 2k让summarize_model做一次压缩保留高置信度条目。模型名不存在不同通道支持的模型名不一样。先在模型对话页确认可用模型再填进配置。填错模型名通常返回 400 或 404。6. 把链路接到你的工具里到这里配置、验证、排障都齐了。最后说下怎么接到实际工具。如果你用的是支持 OpenAI 兼容协议的编辑器或客户端直接把settings.json里的base_url和api_key填进去记忆模块作为独立服务跑在127.0.0.1:8787客户端通过 HTTP 调它。这样编辑器本身不用改代码记忆能力是外挂的。如果你在写长期跑的编码 Agent建议走 Coding Plan额度模型更适合高频的记忆读写。接入细节查接入文档Key 管理在 API Keys 页面。模型选型不确定时先去模型对话页试几个 prompt确认抽取效果再定。一个实用技巧记忆文件的dimensions不要一次设太多。我一开始设了 12 个维度结果抽取模型经常把偏好归错类。收敛到 5 个核心维度后准确率明显提升。维度少而准比多而杂有用。链路跑通后你会发现模型“记住你”这件事本质上不是模型变聪明了而是记忆结构设计对了。MIT 那篇论文的价值也在这——它证明了 2k 的精心设计记忆能打赢 32k 的暴力上下文。工程上这意味着成本和效果可以兼得。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

show一下我的静音电脑:用 TaoToken 统一 Key 管理 AI 工具配置 2026/9/26 3:48:33

show一下我的静音电脑:用 TaoToken 统一 Key 管理 AI 工具配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
el-select 自定义搜索方法后输入被清空:用 TaoToken 统一 Key 排查配置链路 2026/9/26 3:48:33

el-select 自定义搜索方法后输入被清空:用 TaoToken 统一 Key 排查配置链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
FastMCP MCP 服务全流程开发指南:用 TaoToken 统一 Key 打通配置与调试 2026/9/26 3:48:33

FastMCP MCP 服务全流程开发指南:用 TaoToken 统一 Key 打通配置与调试

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Manus爆火后,我把官方资料整理成了TaoToken可用的配置骨架 2026/9/26 3:48:32

Manus爆火后,我把官方资料整理成了TaoToken可用的配置骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
OpenClaw 实测:从聊天 AI 到本地执行引擎,用 TaoToken 统一 Key 打通 AI Agent 配置链路 2026/9/26 3:48:32

OpenClaw 实测:从聊天 AI 到本地执行引擎,用 TaoToken 统一 Key 打通 AI Agent 配置链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Dry‑run 干跑:一个容易被忽略,却价值巨大的 CLI 设计模式 2026/9/26 3:48:26

Dry‑run 干跑:一个容易被忽略,却价值巨大的 CLI 设计模式

Dry‑run 干跑:一个容易被忽略,却价值巨大的 CLI 设计模式前言做开发这么久,接触过大量命令行工具,修改配置、操作数据库、维护目录服务。很长一段时间,我并没有听过 dry‑run(干跑) 这个概念。…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉