新闻详情

新闻详情

首页 / 资讯中心 / 详情

深入自己.skill源码:6个Python工具如何解析聊天记录与照片,构建数字分身

发布时间:2026/9/26 22:24:50来源:尧图网络
深入自己.skill源码:6个Python工具如何解析聊天记录与照片,构建数字分身
深入自己.skill源码6个Python工具如何解析聊天记录与照片构建数字分身【免费下载链接】yourself-skill与其蒸馏别人不如蒸馏自己。欢迎加入数字永生Inspired by colleague-skill同事skill。项目地址: https://gitcode.com/gh_mirrors/yo/yourself-skill自己.skill 是一个开源的自我蒸馏工具提供你的微信/QQ 聊天记录、日记和照片它会通过 6 个 Python 源码工具解析出你的口头禅、语气词、标点习惯与照片时间线最终构建一个用你的方式思考和说话的数字分身。本文带你快速看懂 tools/ 目录下的源码结构与工作机制。为什么是自己.skill与其蒸馏别人不如蒸馏自己。欢迎加入数字永生同事跑了你可以蒸馏同事但最该被蒸馏的其实是你自己。自己.skill 把你解构成两部分部分文件内容Part A — Self Memory自我记忆self.md经历、价值观、生活习惯、重要记忆、人际关系Part B — Persona人格模型persona.md5 层性格结构硬规则 → 身份 → 说话风格 → 情感模式 → 人际行为运行逻辑很简单收到消息 → Persona 判断你会怎么回应 → Self Memory 补充背景与价值观 → 用你的方式输出。完整设计思路可参考产品文档 docs/PRD.md。项目结构一览源码都在哪里整个仓库遵循 AgentSkills 开放标准结构非常清晰yourself-skill/ ├── SKILL.md # Skill 入口 ├── prompts/ # 7 个 Prompt 模板分析与生成 ├── tools/ # 6 个 Python 解析与管理工具本文主角 ├── selves/ # 生成的自我 Skill ├── docs/PRD.md # 产品需求文档 └── requirements.txt其中 prompts/ 负责思考信息录入、记忆提取、人格建模而 tools/ 负责动手——解析文件、生成结构、管理版本。两者分工协作是典型的Prompt 脚本架构。6个Python工具逐个拆解1️⃣ wechat_parser.py — 微信聊天记录解析器这是还原度最高的数据源处理器位于 tools/wechat_parser.py。它的亮点是格式自动检测根据文件后缀与内容特征自动识别 WeChatMsg 导出txt/csv/html、留痕导出json、PyWxDump 导出sqlite或纯文本粘贴。更关键的是 analyze_messages 函数的统计能力它只盯着我发的消息提取高频语气词哈、嗯、哦、嘛……→ 直接映射你的口头禅高频 Emoji→ 你的表情包偏好平均消息长度→ 判断你是短句连发型还是长段落型标点习惯句号/感叹号/问号/省略号/波浪号→ 语气指纹这些统计结果会被写入 Markdown 报告供 AI 提炼人格特征。2️⃣ qq_parser.py — QQ 聊天记录解析器适合学生时代的自己位于 tools/qq_parser.py。它适配 QQ 消息管理器导出的 txt 与 mht 两种格式通过正则匹配时间戳 发送者 QQ号的固定模式逐行拆出消息见 parse_qq_txt。对 mht 这类带 HTML 标签的文件它会先剥离标签再提取纯文本。最后同样统计目标消息数并抽样前 50 条作为分析素材。3️⃣ social_parser.py — 社交媒体内容解析器朋友圈、微博、小红书、日记截图都交给它位于 tools/social_parser.py。它的设计很巧妙先扫描目录按扩展名把文件分成图片 / 文本 / 其他三类scan_directory。文本文件txt/md/json/csv直接内嵌进报告图片截图则列出路径清单交给 AI 的 Read 工具逐张看图提取你的价值观和表达风格。4️⃣ photo_analyzer.py — 照片元信息分析器不是看照片内容而是读照片记忆位于 tools/photo_analyzer.py。基于 Pillow 读取每张 JPEG/PNG 的EXIF 信息拍摄时间DateTimeOriginal→ 按时间排序生成你的人生时间线GPS 坐标get_exif_data 会把度分秒换算成十进制度并处理南纬/西经的负号→ 找出你的常去地点最终输出一份照片时间线分析报告哪一天在哪拍过照一目了然。这就是为什么示例中的数字分身能回答我最喜欢的地方是哪里——答案藏在你的照片元数据里。5️⃣ skill_writer.py — Skill 文件管理器解析完成后该写文件了位于 tools/skill_writer.py。它管理四类动作动作作用list列出所有已生成的自我 Skillinit初始化目录结构versions/ memories/chats、photos、notescombine合并 self.md persona.md 生成完整 SKILL.mdcreate完整创建流程以示例产物 selves/example_me/ 为例meta.json存版本与档案self.md是记忆persona.md是人格四件套齐活后即可被/小北直接调用。6️⃣ version_manager.py — 版本存档与回滚数字分身会进化那就需要后悔药位于 tools/version_manager.py。backup每次更新前把self.md / persona.md / SKILL.md / meta.json四个核心文件打包进带时间戳的versions/存档目录rollback回滚前先自动备份当前版本再恢复旧文件——双保险永不丢数据list查看所有历史版本配合对话纠正说我不会这样说即写入 Correction 层见 prompts/correction_handler.md你的数字分身可以持续迭代。从聊天记录到数字分身完整流程把 6 个工具串起来整条流水线是这样的录入通过 prompts/intake.md 问 3 个问题——代号、基本信息年龄/职业/城市、自我画像MBTI/星座/性格标签全部可跳过解析按需调用wechat_parser/qq_parser/social_parser/photo_analyzer把原材料变成统计报告建模prompts/self_analyzer.md 提取自我记忆prompts/persona_analyzer.md 提取 5 层人格生成按 prompts/self_builder.md 和 prompts/persona_builder.md 模板产出self.md与persona.md组装skill_writer.py --action combine合并为可运行的 SKILL.md进化新资料来了走 prompts/merger.md 增量合并版本随时可回滚快速上手三步拥有数字分身① 克隆并安装在 git 仓库根目录执行mkdir -p .claude/skills git clone https://gitcode.com/gh_mirrors/yo/yourself-skill .claude/skills/create-yourself② 安装可选依赖照片解析需要 Pillowpip install -r requirements.txt③ 在 Claude Code 中输入/create-yourself按提示提供数据即可。完成后用/{slug}召唤你的数字分身常用管理命令命令说明/list-selves列出所有自我 Skill/{slug}调用完整 Skill像你一样思考和说话/{slug}-self自我档案模式帮你回忆和分析自己/{slug}-persona人格模式仅性格和表达风格/yourself-rollback {slug} {version}回滚到历史版本/delete-yourself {slug}删除写在最后 读完整套源码你会发现自己.skill 的精华不在算法复杂度而在工程化的克制6 个 Python 工具各司其职都是可独立运行的命令行脚本边界清晰Prompt 与脚本分层思考和动手互不干扰版本管理与回滚机制让数字永生也有了安全网这个 Skill 不会定义你。它只是把你从生物硬盘导出到 Markdown完成一次格式转换。你的口头禅、你的深夜 emo、你拍过的每张带 GPS 的照片都是人格的原材料。如果你想深入理解某个解析器的实现细节建议直接打开 tools/wechat_parser.py 边读边跑——与其蒸馏别人不如先蒸馏自己。【免费下载链接】yourself-skill与其蒸馏别人不如蒸馏自己。欢迎加入数字永生Inspired by colleague-skill同事skill。项目地址: https://gitcode.com/gh_mirrors/yo/yourself-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

酒店做网站别再被坑:3种方案对比,避开备案陷阱看真实报价 2026/9/27 0:07:03

酒店做网站别再被坑:3种方案对比,避开备案陷阱看真实报价

酒店做网站别再被坑:3种方案对比,避开备案陷阱看真实报价 很多酒店老板一提到建站就头疼,尤其是备案流程让人一头雾水,明明交了钱,网站却迟迟上不了线。其实, 酒店做网站 的核心不在于页面多花哨,而在于 建站报价…

阅读更多 →
怎么提高网站关键字排名速查手册 2026/9/27 0:06:43

怎么提高网站关键字排名速查手册

提高网站关键字排名6大注意事项避坑指南 网站做好了没人访问,这是很多中小企业老板最头疼的事。你花了钱做了站,结果百度搜不到,360也查无此站,流量几乎为零。别急,问题往往出在技术细节和运营策略的 注意事项 上。今天不谈虚的,直接拆解…

阅读更多 →
怎么知道自己网站的权重选哪家好 2026/9/27 0:06:30

怎么知道自己网站的权重选哪家好

3招看懂网站权重真相,告别瞎猜,建站选服务商不踩坑 网站做好了,后台数据却一片死寂,没人访问,这是很多老板和项目经理最头疼的噩梦。你花了大几万请人开发,UI做得花里胡哨,功能也全,但就是没流量,这钱算是打水漂了?别急着怪推广,先问自己一个问…

阅读更多 →
基于ERA5与Atlite的全国风光出力因子计算:30公里网格逐小时序列 2026/9/27 0:06:24

基于ERA5与Atlite的全国风光出力因子计算:30公里网格逐小时序列

简介:基于ERA5历史气象再分析数据与Atlite库构建的中国2020年全域风电与光伏发电出力因子时间序列计算模型资源包,面向新能源发电预测、电力系统规划与碳中和政策评估等研究场景,适合能源领域研究人员、电网调度人员及可再生能源方向学生使用…

阅读更多 →
基于CNN特征的本地图片视频重复检测与整理方案 2026/9/27 0:06:23

基于CNN特征的本地图片视频重复检测与整理方案

我前两年整理的素材库,图片视频加起来大概两万多份,每次找素材翻半天不说,光是硬盘里重复的备份就占了好几百GB。最头疼的是同一张图换了个尺寸、转了格式、或者加了点水印再存一遍,MD5根本查不出来,几百个G的重复文件…

阅读更多 →
列车运行图系统设计与实现:pyETRC原型Java毕设源码解析 2026/9/27 0:05:25

列车运行图系统设计与实现:pyETRC原型Java毕设源码解析

简介:这是一份基于Python与PyQt5开发的简易中国铁路列车运行图系统源码,项目灵感与功能设定源自Java版ETRC系统,可定位为毕业设计或课设级别的完整示例。系统支持读取和导出ETRC的*.trc运行图文件,相比原版进一步提供精确到秒的时…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉