新闻详情

新闻详情

首页 / 资讯中心 / 详情

Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说

发布时间:2026/10/2 6:55:23来源:尧图网络
Wenyi全书理解机制揭秘:预扫(Prescan)如何让AI读懂整本小说
Wenyi全书理解机制揭秘预扫Prescan如何让AI读懂整本小说【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyiWenyi 是一款开源的 AI 小说翻译工具它的核心卖点不是逐段翻译而是全书理解机制在动笔之前先通过一个名为预扫Prescan的阶段让 AI 通读整本小说生成每章摘要Chapter Digest和全书梗概Book Synopsis再按章翻译。本文将为你拆解这套机制的原理、配置方法与实战效果帮你理解长篇小说 AI 翻译质量背后的关键。为什么整本小说翻译对 AI 是个难题大语言模型都有上下文长度限制而一本几十上百万字的小说远超这个上限。如果只让 AI 看眼前这一段就动手翻译容易出现三类问题人名、称谓前后不一致同一角色在不同章节被译成不同名字伏笔与呼应被破坏后文才揭晓的身份、反转在前文翻译时无法把握分寸语气与风格漂移开篇和结尾像两个不同的人写的。Wenyi 的解法很直观先让 AI 用低成本方式读完全书把理解结果固化成稳定的文本再作为翻译上下文注入每一批翻译请求。预扫Prescan如何工作两步走的全书理解预扫的完整实现位于 agents/synopsis.py它由Synopsizer代理完成两个步骤。第一步并行生成每章摘要Chapter Digest预扫阶段会遍历每一章源文调用低成本fast tier模型为每章写一份限定长度的摘要。其提示词模板见 chapter_digest_system.txt要求覆盖关键剧情进展与转折点出场人物及其处境重要信息与伏笔角色名统一以目标语言表达。由于各章相互独立这一步可以并行执行。并发度由 config.yaml 中的prescan_concurrency控制默认为 4prescan: true prescan_concurrency: 4 # 并行生成章节摘要的worker数第二步Map-Reduce 合并出全书梗概几十上百份章节摘要如何合成一份不超限的全书梗概Synopsizer.book_synopsis采用了经典的Map-Reduce 分组合并策略按 12000 字符预算把摘要分组每组合并成更高层的梗概若结果仍有多组则继续递归合并直到只剩一份为止。提示词见 book_synopsis_system.txt要求最终梗概涵盖主线与结局、核心人物弧光、世界观、揭秘与伏笔、整体基调——并统一使用目标语言的角色名。这套逻辑保证无论书多长喂给翻译器的全书梗概长度始终可控。理解结果如何注入翻译上下文这是预扫真正产生价值的地方。每个翻译批次的提示词都遵循**稳定信息在前**的拼装顺序风格指引 → 全书梗概 → 当前章摘要 → 相关术语表 → 源语言注释 → 已翻译的近文上下文 → 待译源文 → 后一段源文好处有两个早章也享受剧透翻译第一章时AI 已经知道主角的结局走向能更准确地拿捏语气与称谓前缀稳定可复用缓存全书梗概和章摘要作为固定全局前缀配合提示词缓存Cache Reuse显著降低重复计费——这是用廉价模型预扫换昂贵模型省钱的巧妙设计。预扫与翻译的整体流程可以在 docs/pipeline.md 的流程图里看到中文版见 docs/zh/pipeline.md。断点续传预扫是幂等的Wenyi 的预扫结果直接持久化到每章的meta[source_digest]字段与全书分析结果中写入逻辑见 pipeline/preparation.py。这意味着中途中断后重跑已完成的章节摘要会被复用不会重复花钱只翻译缺失部分已完成的批次自动跳过。在 Web 端查看预扫成果翻译完成后你可以直接在 Web 端核对每章的译文质量并查看双语对照效果。校对工作台位于 proofreading 功能目录界面长这样注意事项字幕SRT不走预扫需要说明的是预扫属于书籍工作流Orchestrator。.srt字幕文件走一条轻量并行路径没有全书预扫、术语表与 Review 阶段——因为字幕本身不存在全书上下文问题。详见 docs/usage.md。总结预扫的三个核心价值价值说明一致性角色名、称谓、伏笔贯穿全书省成本廉价模型先读全书昂贵模型只做翻译且前缀可缓存可恢复摘要幂等持久化断点续传不重复计费如果你想深入了解配置项prescan与prescan_concurrency的完整说明可以查看 docs/zh/configuration.md。这套先理解、后翻译的全书理解机制正是 Wenyi 让 AI 真正读懂整本小说的关键。【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Jetson Orin Nano适配IMX219摄像头全栈调试指南 2026/10/2 11:03:31

Jetson Orin Nano适配IMX219摄像头全栈调试指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
二手24盘位硬盘柜改造:静音与电源升级全记录 2026/10/2 11:03:24

二手24盘位硬盘柜改造:静音与电源升级全记录

四百多块收一套24盘位的二手硬盘柜,还带电源。说实话,刚看到这个价格的时候我也愣了一下,毕竟随便一台四盘位成品NAS就要两千往上。这件事的起因是我身边几个玩NAS的朋友都在嚷着盘位不够用,手机相册、影视库、工作备份、各种容器…

阅读更多 →
paperclip 实战:Node.js + React 构建 AI agents 编排层 2026/10/2 11:03:24

paperclip 实战:Node.js + React 构建 AI agents 编排层

1. 从 paperclip 这个名字说起:它到底想解决什么问题第一次看到paperclip这个项目名,我脑子里蹦出来的画面是那个经典的曲别针小助手——一个看起来不起眼、但总能在关键时刻帮你把零散纸张归拢到一起的小工具。事实也确实如此,这个项目在社区…

阅读更多 →
搭建本地AI求职决策框架:让每次投递变得精准 2026/10/2 11:03:24

搭建本地AI求职决策框架:让每次投递变得精准

我一度以为自己很会“用AI找工作”。简历让大模型润色,JD丢给AI提炼关键词,然后一键批量投递,效率高得惊人。结果三个月下来,我投出去两百多份简历,面试邀请屈指可数,来的还都是和方向不太对口的岗位。这个…

阅读更多 →
hindsight 实战:为 LLM Agent 构建分层记忆系统与 MCP 集成 2026/10/2 11:03:24

hindsight 实战:为 LLM Agent 构建分层记忆系统与 MCP 集成

1. 从 "hindsight" 这个名字说起:为什么 Agent Memory 值得单独造一个轮子 第一次看到 "hindsight" 这个项目名,我脑子里蹦出来的不是技术架构,而是一句老话——事后诸葛亮。但恰恰是这个略带自嘲意味的词,点…

阅读更多 →
AI技能包(Skills):让AI告别临场发挥,实现可复用的自动化工作流 2026/10/2 11:03:24

AI技能包(Skills):让AI告别临场发挥,实现可复用的自动化工作流

你有没有过这种经历:同一个活儿,翻来覆去跟AI交代,每次开场都要先砸一长串背景、规则、输出格式,说完还得补一句“这次务必记住”。结果换一个新会话,一切归零,你又得从头讲一遍。以前我也觉得这是AI不够聪…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉