Cursor+扣子(Coze):一键爬取公众号文章至多维表格的配置与验证
发布时间:2026/9/26 3:33:02来源:尧图网络
1. 从手动复制到自动入库公众号文章批量进多维表格的真实痛点做内容运营或者个人知识库的朋友大概率都遇到过这个场景刷到一篇不错的公众号文章想存进多维表格做素材库于是打开文章、全选、复制、切到表格、粘贴、再手动补上标题、作者、发布时间、链接。一篇两篇还行一天十几篇下来手指和耐心一起报废。更麻烦的是公众号文章没有稳定的公开接口想批量拿历史文章靠浏览器插件一条条点效率低还容易漏。我试过用纯脚本硬爬结果卡在登录态和反爬策略上维护成本高得离谱。后来换了个思路用 WeWe RSS 这类开源项目把公众号转成标准 RSS 订阅源再用扣子Coze的工作流做解析和字段映射最后写入飞书多维表格。整个链路里Cursor 负责帮我快速部署和改配置扣子负责编排TaoToken 负责给工作流里的大模型节点提供统一的 Key 和 API 通道。这套组合跑通之后新增一篇文章从“手动五分钟”变成“自动几秒钟”而且字段映射一次配好后面基本不用管。这篇文章面向的是想搭个人知识库、做热点文章搜集、或者需要整理公众号关键词的读者。你不需要是后端工程师只要能看懂配置文件、会复制命令、愿意跟着步骤点几下就能把这套流程跑起来。下面我会把 config.toml、settings.json 的骨架、TaoToken 的接入方式、以及一次端到端抓取验证动作完整写出来你照着做就能确认字段映射和写入结果是否正确。2. TaoToken 前置统一 Key 与 API 通道让工作流里的大模型节点不再东拼西凑扣子工作流里会用到多个大模型节点比如拆解文章、打标签、整理格式。如果你每个节点都去单独申请 Key、单独配 Base URL管理起来会很乱而且不同模型的调用格式还不一样。TaoToken 在这里的作用就是提供一个统一的 API 通道你只需要一个 Key就能在扣子的插件或 HTTP 节点里调用模型对话能力。具体来说TaoToken 的 API 地址是https://taotoken.net/api官网是https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content。你可以在官网注册后拿到 API Key然后在扣子的工作流里把需要调用大模型的节点配置成 HTTP 请求指向 TaoToken 的接口。这样做的好处是Key 只有一份换模型或者调参数时不用改多处而且扣子工作流里的大模型节点如果支持自定义 Base URL也可以直接填 TaoToken 的地址。如果你后面要长期跑编码类任务或者 Agent 编排可以了解一下 Coding Plan它更适合持续性的开发场景。单纯验证模型对话效果的话模型对话页面就能直接试。接入文档在 doc 里API Key 管理在 api-keys 里。这些入口我都放在文末的 CTA 分流里按你的实际需求点进去就行。需要提醒的是TaoToken 在这里扮演的是合规的 API 通道角色你调用的是模型能力不要把它理解成某种绕过限制的工具。配置时只填官方给的地址和 Key不要自己拼接来路不明的代理地址。3. 可复制配置Cursor 部署 WeWe RSS 与扣子工作流骨架3.1 用 Cursor 快速部署 WeWe RSSWeWe RSS 是一个开源项目通过微信读书抓取公众号历史文章输出标准 RSS。它的 GitHub 地址是https://github.com/cooderl/wewe-rss。你不需要把源码克隆下来慢慢读直接用 Docker 跑打包好的镜像就行。Cursor 在这里的用法是把项目地址丢给它让它帮你生成 docker-compose.yml 和启动命令。先确保本机装了 Docker。Windows 上如果 Docker 更新失败通常是缺 WSL 补丁在命令行执行wsl --update再重启 Docker 即可。然后新建一个目录比如wewe-rss在里面创建docker-compose.ymlversion: 3.9 services: wewe-rss: image: cooderl/wewe-rss:latest container_name: wewe-rss ports: - 4000:4000 environment: - DATABASE_TYPEsqlite - AUTH_CODEyour_strong_password - SERVER_ORIGIN_URLhttp://localhost:4000 - PLATFORM_URLhttps://weread.965111.xyz volumes: - ./data:/app/data restart: unless-stopped这里有几个参数要改。AUTH_CODE是 API 访问的授权码建议改成你自己的强密码不要用默认值。SERVER_ORIGIN_URL如果你要外网访问就改成你的公网 IP 或域名本地测试保持 localhost 即可。PLATFORM_URL在国内访问遇到 DNS 解析问题时加上能提高稳定性。数据目录./data用来持久化 SQLite 数据库别删。创建数据目录并启动mkdir -p data docker compose up -d启动后访问http://localhost:4000点击“账号管理”添加微信读书账号需要扫码登录。然后进入“公众号源”提交公众号文章链接来添加订阅。注意添加频率不要太高频率过高会被封控需要等 24 小时。这一步是整套流程的数据源头订阅源稳定了后面的自动化才有意义。3.2 扣子工作流的 settings.json 骨架扣子工作流的编排逻辑是开始节点接收飞书云文档链接和多维表格链接然后依次经过获取文档内容、大模型提取链接、循环读取文章、打标签、整理格式、写入多维表格。下面是一个 settings.json 的骨架你可以根据实际节点 ID 调整{ workflow: { name: gzh_to_bitable, start: { inputs: { doc_url: 飞书云文档链接, bitable_url: 多维表格链接 } }, nodes: [ { id: get_doc, type: feishu_doc, action: get_document_info, input: { url: {{start.doc_url}} } }, { id: extract_links, type: llm, provider: taotoken, base_url: https://taotoken.net/api, api_key: {{secrets.TAOTOKEN_KEY}}, prompt: 从以下内容中提取所有公众号文章链接整理成 JSON 数组{{get_doc.content}} }, { id: loop_articles, type: loop, items: {{extract_links.result}}, body: [ { id: read_article, type: plugin, action: read_link, input: { url: {{item}} } }, { id: tag_article, type: llm, provider: taotoken, base_url: https://taotoken.net/api, api_key: {{secrets.TAOTOKEN_KEY}}, prompt: 给这篇文章打 3 个标签输出 JSON{{read_article.content}} }, { id: format_row, type: llm, provider: taotoken, base_url: https://taotoken.net/api, api_key: {{secrets.TAOTOKEN_KEY}}, prompt: 整理成字段标题、作者、发布时间、链接、标签、摘要。输出 JSON{{read_article.content}} }, { id: write_bitable, type: feishu_bitable, action: create_record, input: { url: {{start.bitable_url}}, fields: {{format_row.result}} } } ] } ] } }这个骨架里secrets.TAOTOKEN_KEY是你在扣子里配置的环境变量值就是 TaoToken 的 API Key。三个大模型节点分别负责拆解文章、打标签、整理格式都走同一个 Base URL 和 Key这就是统一通道的价值。写入多维表格的节点用飞书的多维表格插件字段名要和你表格里的列名完全一致否则会写入失败。3.3 飞书云文档与多维表格的准备在飞书里新建一个云文档把 WeWe RSS 输出的 RSS 内容复制进去。RSS 地址在 WeWe RSS 的订阅源页面可以找到格式类似http://localhost:4000/feeds/xxx.xml。你可以用浏览器打开这个地址全选内容粘贴到云文档。然后新建一个多维表格列名建议设为标题、作者、发布时间、链接、标签、摘要。这几列要和上面format_row节点输出的 JSON 字段一一对应。4. 验证请求一次端到端抓取确认字段映射与写入结果配置完成后不要急着批量跑先做一次单篇验证。在扣子工作流里把开始节点的doc_url填成你刚建的飞书云文档链接bitable_url填成多维表格链接然后点击试运行。观察每个节点的输出。get_doc节点应该返回云文档的纯文本内容。extract_links节点应该返回一个 JSON 数组里面是公众号文章链接。如果这里返回空数组说明云文档里的 RSS 内容格式不对或者大模型没提取到链接可以手动在 prompt 里加一句“链接通常以 https://mp.weixin.qq.com 开头”。loop_articles节点会逐条处理。read_article节点读取链接内容如果返回 403 或空内容可能是文章需要登录态或者链接失效。tag_article和format_row节点输出 JSON检查字段名是否和你的多维表格列名一致。最后write_bitable节点执行后打开多维表格应该能看到新增一行记录标题、作者、发布时间、链接、标签、摘要都有值。如果写入成功但字段错位比如标题写到了作者列那就是format_row的 JSON key 和表格列名不匹配。回到工作流把 prompt 里的字段名改成和表格列名完全一致比如表格列叫“文章标题”prompt 里就输出{文章标题: ...}。这一步是字段映射的核心配一次后面就稳了。验证通过后你可以把云文档的 RSS 内容更新做成定时任务或者用 WeWe RSS 的自动更新功能让整个链路定期跑。扣子工作流支持定时触发设置成每天跑一次就能自动把新文章同步进多维表格。5. 本篇常见错排查从 Docker 启动失败到写入字段错位Docker 启动后访问 localhost:4000 打不开。先看容器状态docker ps如果容器不断重启看日志docker logs wewe-rss。常见原因是AUTH_CODE没改或者数据目录权限不对。Windows 上还要确认 WSL 补丁已装执行wsl --update后重启 Docker Desktop。添加公众号时提示频率过高。这是微信读书的风控不是代码问题。等 24 小时再试或者降低添加频率一次只加一两个。不要用脚本疯狂提交容易被封号。RSS 地址能打开但内容为空。检查PLATFORM_URL是否配置。国内网络环境下不配这个变量可能拿不到微信读书的数据。另外确认微信读书账号还在登录状态扫码登录过期后需要重新扫。扣子工作流里大模型节点报 401 或 403。检查secrets.TAOTOKEN_KEY是否填对Base URL 是否是https://taotoken.net/api。如果扣子的大模型节点不支持自定义 Base URL就改用 HTTP 请求节点手动构造请求体Header 里带Authorization: Bearer 你的Key。写入多维表格报字段不存在。飞书多维表格的列名是大小写和空格敏感的。你的 JSON key 必须和列名完全一致。建议先在表格里把列名定好再回到工作流里改 prompt。如果表格里有单选或多选字段写入的值要符合选项范围否则也会失败。文章内容读取为空。公众号文章有的需要登录态才能看全文read_link插件可能拿不到。可以换成用大模型节点直接根据链接和摘要生成内容或者只存标题、链接、标签这些元数据不存全文。根据你的知识库需求取舍。6. 按需选择入口排障、验证模型与长期编码的分流建议整套流程跑下来最花时间的其实是排障和字段对齐。如果你在接入 TaoToken 或者配置扣子工作流时遇到问题优先看 API Keys 和接入文档里面有针对 HTTP 请求节点和大模型节点的配置示例。如果你只是想先验证一下模型对话效果比如测试拆解文章和打标签的 prompt 是否合理可以直接用模型对话页面快速试。如果你打算把这套链路长期用于编码类任务或者 Agent 编排比如让 Cursor 和扣子联动做更复杂的自动化Coding Plan 会更适合持续性的开发场景。入口我整理在这里按你的实际需求点排障与接入API Keys 管理https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content接入文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content验证模型对话模型对话https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content长期编码与 AgentCoding Planhttps://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content控制台Consolehttps://taotoken.net/console?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content最后说一个我踩过的坑扣子工作流里的循环节点如果单次循环里调用了多个大模型节点整体耗时会长。建议把打标签和整理格式合并成一个 prompt减少调用次数。另外多维表格的写入频率也有限制批量跑的时候加个延时别一次性写几百条。字段映射验证通过后把工作流复制一份做备份改坏了能快速回滚。
网站建设高端定制企业官网