新闻详情

新闻详情

首页 / 资讯中心 / 详情

WeClone 完整教程:用微信聊天记录微调大模型,做出你的 AI 数字分身

发布时间:2026/9/9 13:23:16来源:尧图网络
WeClone 完整教程:用微信聊天记录微调大模型,做出你的 AI 数字分身
WeClone 完整教程用微信聊天记录微调大模型做出你的 AI 数字分身【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeCloneWeClone 是一个从聊天记录创建 AI 数字分身的大语言模型微调项目把微信聊天导出的 CSV 记录转成训练集跑一次 LoRA 微调一张 16GB 显存的显卡就能得到一个说话像你的聊天机器人还能挂回微信里自动回复。从数据到上线实际只分四步。 第一次跑通把微信聊天记录变成训练数据集先 clone 仓库并装依赖git clone https://gitcode.com/GitHub_Trending/we/WeClone pip install -r requirements.txt数据是效果的关键。用 PyWxDump 把微信聊天记录解密导出为 CSV导出类型选 CSV再把这些文件放进data/csv目录。然后执行项目自带的预处理脚本它会只保留你发出的消息并自动过滤手机号、身份证、邮箱、网址./make_dataset/csv_to_json.py脚本在make_dataset/下有三个变体区别只在同一个人连发多句时怎么处理默认版用逗号拼接单句多轮.py会把历史句放进提示词的history字段。另外make_dataset/blocked_words.json是禁用词库命中整句直接丢弃可以按自己的隐私需求往里加词。 第一次出效果16GB 显存 LoRA 微调 ChatGLM3默认底座是 ChatGLM3-6B用 LoRA 方式做 SFT 微调约 16GB 显存。把模型下载到本地后改两个地方就能开始训练settings.json里按自己的数据量调整num_train_epochs、lora_rank显存吃紧就调小per_device_train_batch_size训练入口是src/train_sft.py作者实测 loss 降到 3.5 左右降太多容易过拟合python src/train_sft.py单卡不够就上多卡装好 deepspeed 后用deepspeed --num_gpusN src/train_sft.py启动即可。仓库还提供了src/train_pt.py的预训练阶段脚本但作者自己的结论是提升不明显新手可以跳过。 第一次分享给别人Web 演示、命令行和微信机器人训练完先自己把玩。Web 演示一条命令起服务浏览器打开就能聊python ./src/web_demo.py命令行交互用src/cli_demo.py对外提供服务则启动src/api_service.py之后可以配合src/test_model.py用一组常见聊天问题给模型体检。想让它住进微信就把它部署成微信机器人先起 API 服务再跑src/wechat_bot/下的入口终端会出登录二维码扫码后私聊或群里 都能用python ./src/api_service.py python ./src/wechat_bot/main.py提醒一句微信有封号风险建议用小号并且该号必须绑定银行卡。⚙️ 三个高频问题显存不够、换模型、效果差怎么办显存不够官方表格里 QLoRA 4-bit 跑 7B 只要 6GB。项目基于 LLaMA Factory 生态换 QLoRA、换更小的模型如 7B 以下改settings.json里对应字段即可模板system提示词要同步调整。换模型默认 ChatGLM3 之外可换 LLaMA Factory 支持的任意模型下载后把settings.json里的model_name_or_path指向本地路径。效果差作者用 2 万条数据也只能差强人意但有时很搞笑。效果很大程度上取决于聊天数据的数量和质量先扩充数据比调参更有用。聊天记录就是你独一无二的语料库别人复制不走。找个周末把四步跑完你的数字分身就能替你先回几轮消息了。【免费下载链接】WeClone One-stop solution for creating your AI twin from chat history Fine-tune LLMs with your chat logs to capture your unique style, then bind to a chatbot to bring your digital self to life.项目地址: https://gitcode.com/GitHub_Trending/we/WeClone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Uncorrectable ECC错误详解:原理、排查与MBIST验证 2026/9/9 14:11:28

Uncorrectable ECC错误详解:原理、排查与MBIST验证

如果你在服务器、工作站或某台存储设备上,看到诊断工具里赫然显示uncorrectable ECC error count: 2,第一反应是什么?我之前帮朋友排查一台存储服务器的时候,就碰到过这种显示——面板上数字不大不小,正好是 2&#xf…

阅读更多 →
如何把 Protractor 测试用例迁移到 Puppeteer 2026/9/9 14:11:28

如何把 Protractor 测试用例迁移到 Puppeteer

如何把 Protractor 测试用例迁移到 Puppeteer 【免费下载链接】puppeteer JavaScript API for Chrome and Firefox 项目地址: https://gitcode.com/GitHub_Trending/puppeteer1/puppeteer 如果你的 Angular 项目还依赖 Protractor 跑 e2e 测试,这篇文章给出一…

阅读更多 →
串口调试助手使用指南:从波特率原理到故障排查实战 2026/9/9 14:11:28

串口调试助手使用指南:从波特率原理到故障排查实战

简介:串口调试助手2.2是由龚建伟老师开发的串口通信调试工具,面向嵌入式、单片机、工控等领域,是开发者和硬件工程师进行设备联调、协议验证的高效辅助工具。资源包为rar格式,体积仅116KB,包含3个文件:可执…

阅读更多 →
Canvas绘制大数据表格:十万行秒开渲染的实践方案 2026/9/9 14:11:28

Canvas绘制大数据表格:十万行秒开渲染的实践方案

做后台系统的人,迟早都会撞上“大数据量表格”这堵墙。最开始我用Element Plus的el-table,几万行数据一铺,页面直接卡成幻灯片,滚动一下浏览器都要问你要不要停止响应。后来换DOM级虚拟滚动,能撑住,但数据量…

阅读更多 →
SLAM工业级ICP配准引擎:手写可微实时鲁棒实现 2026/9/9 14:11:28

SLAM工业级ICP配准引擎:手写可微实时鲁棒实现

1. 这不是“抄个代码就能跑”的ICP,而是SLAM系统里真正扛得住实测的配准内核 你搜“SLAM中的ICP算法代码完整实现”,大概率会撞上三类内容:一是教科书式伪代码,变量命名像数学公式(p_i, q_j, R, t)&#xf…

阅读更多 →
新英格兰10机39节点系统接入风机模块的Simulink建模与仿真研究 2026/9/9 14:08:27

新英格兰10机39节点系统接入风机模块的Simulink建模与仿真研究

新英格兰10机39节点系统在电力系统研究领域的分量,搞过暂态稳定、频率响应、机电暂态仿真的朋友应该都不陌生。这套由麻省理工学院和通用电气在新英格兰地区电网基础上简化的标准测试系统,几乎是每个做电力系统研究的硕士博士绕不开的“实验台”。但原版…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞