ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

wenyi文译全书理解原理揭秘:预扫、章节梗概与滚动上下文如何保证长篇小说译名一致

wenyi文译全书理解原理揭秘:预扫、章节梗概与滚动上下文如何保证长篇小说译名一致 wenyi文译全书理解原理揭秘预扫、章节梗概与滚动上下文如何保证长篇小说译名一致【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyi长篇小说翻译最大的难题是模型记不住前面写过什么。wenyi文译正是为解决这个问题而生的 AI 文学翻译工具它把先建立全书理解再按章稳定翻译作为默认策略翻译开始前先用预扫读完全书生成章节梗概与全书概览翻译过程中再靠滚动上下文和术语库让代词、称谓和译名跨章保持一致 。为什么长篇小说的译名容易翻车大语言模型每次请求都是失忆的——你给它第 100 章它并不知道第 3 章里林黛玉已经被译成了什么。直接按章丢给模型常见后果是同一个人物前面叫小翠后面突然变成翠儿专有名词招式、地名、组织前后拼写漂移早期章节无法感知后文伏笔语气和人物弧光对不上。wenyi 的答案是把全书理解从一次性提示词变成可持久化的产物梗概生成一次、落盘保存之后所有翻译批次都引用同一份剧情知识。第一步预扫Prescan——翻译前先读完全书wenyi 的预扫由专门的 Synopsizer 智能体执行核心逻辑在 synopsis.py。它分两步走1. 逐章生成梗概每一章的源文被单独摘要成一段目标语言的梗概注意梗概直接写成译文语言方便后续提示词拼装并保存在章节元数据source_digest中。这一步支持可配置并发prescan_concurrency默认 4 个 worker 并行且幂等可续跑——中断后再次运行已完成的梗概直接复用不会重复花钱。2. 合并为全书概览所有章节梗概按原始章节顺序拼装与 worker 完成顺序无关再结合风格分析摘要合并成一份整书 synopsis。面对超长书籍时它采用分组 map-reduce策略每轮把约 12000 字符为一组先做小结再把小结继续归并直到收敛为一份概览从而把提示词长度约束在模型能力之内。关键设计点在于这两份产物都是稳定的全局前缀。翻译每批段落时提示词的前半部分风格 → 全书概览 → 章节梗概保持不变只有待译原文在变化。固定的前缀能命中模型服务的提示词缓存显著降低成本而前知后事则让第 1 章就带着对全书伏笔的认知去翻译。第二步滚动上下文——让相邻批次无缝衔接全书概览解决的是宏观剧情而代词指代、对话语气这类微观衔接靠的是滚动上下文Rolling Context实现位于 context.py。它维护一个最近已译段落队列默认最多保留 40 段可通过rolling_context_segments调整每批翻译完成后立即追加新译文。下一批的提示词里前文译文始终紧邻新一批待译正文于是同章相邻批次在代词、称谓、语气上自然延续跨批次的未完句、长段拆分形成的续段也不会被提前收句。除此之外wenyi 还会取紧接其后的一条原文片段作为只读参考它帮助模型识别跨批次的未完句避免强行补上结束标点。这条参考只用于衔接判断不允许模型提前翻译也不计入段落对齐计数——这是一个很克制的工程细节。第三步术语库 审校闭环——一致性最终落锁前两步提供软约束术语库提供硬约束。样章分析会建立初始术语库翻译过程中再从已完成的源文与译文中持续抽取人物、地名、组织、术语、招式和称谓后续批次只注入当前章节匹配到的词条避免无关术语挤占上下文。翻译全部完成后可选的 Agent Review 阶段还会基于最终术语库做全书语义审校发现同一术语出现互相矛盾的一致性建议时交给仲裁器统一确认的问题再由 Fixer 修订——而 Fixer 拿到的上下文里同样包含风格指南、全书概览、本章梗概与相关术语形成完整的闭环。这套机制在 pipeline.md 中有完整的流程图与说明配置项集中在 config.yamlpipeline.book_understanding可关闭预扫以省钱prescan_concurrency控制预扫并发。新手快速上手想体验这套全书理解流程只需三步克隆仓库git clone https://gitcode.com/gh_mirrors/we/wenyi在 config.yaml 中配置模型提供商与source_lang/target_lang运行uv run wenyi translate 你的书.epub预扫会自动执行进度实时显示中断后可随时续跑。更多命令行用法见 usage.md语言与流程开关说明见 configuration.md。小结wenyi 保证长篇小说译名一致的配方并不神秘机制解决什么问题关键源码预扫 章节梗概模型提前知道全书剧情synopsis.pymap-reduce 全书概览超长书籍提示词不超限synopsis.py滚动上下文相邻批次代词/语气衔接context.py术语库持续抽取人物、地名译名统一pipeline.mdAgent Review 审校事后兜底矛盾建议仲裁pipeline.md把全书理解沉淀为可复用的持久化产物再配合滚动上下文与术语约束wenyi 让把整本书交给模型这件事在成本和质量之间找到了平衡。如果你想深入了解每个阶段的实现细节源码是最好的老师——欢迎动手翻一翻packages/core/wenyi_core/pipeline/下的模块 【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/gh_mirrors/we/wenyi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表