ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Wenyi实时术语库深度解析:长篇文本翻译术语零冲突的关键

Wenyi实时术语库深度解析:长篇文本翻译术语零冲突的关键 Wenyi实时术语库深度解析长篇文本翻译术语零冲突的关键【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyiWenyi 是一款面向长篇文学作品的开源 AI 翻译工具其实时术语库Glossary机制是保证长篇小说翻译中人名、地名、称谓前后一致、术语零冲突的核心设计。本文将为你解读这套机制的工作原理从术语如何被自动提取、冲突如何被记录到你如何一键裁决帮助你彻底告别同一角色译成两个名字的尴尬。一、长篇文本翻译中术语冲突为什么难避免长篇作品动辄数十万字同一个角色可能以林、林小姐、小林等多种形式出现。如果每一批翻译都让模型自由发挥很容易出现人名漂移前半部分译作安娜后半部分变成安雅称谓失配日语敬语、亲属称谓在中后段突然换了一套说法批量翻译放大问题AI 分批次并行翻译时后一批不知道前一批已经定了译名。Wenyi 的解法是让术语库随着翻译进度实时生长——每翻译完一批就从中提取新术语并回写入库后续批次自动带上最新的术语快照。整个流水线概览可参考 docs/pipeline.md。二、实时术语库两张表撑起零冲突2.1 术语表 冲突表的双表结构Wenyi 术语库底层由两张 SQLite 表构成定义在 store.py表作用glossary每个源词对应唯一一条已确立的译名含读音、性别、别名、类型等元数据term_conflicts记录已确立译名 vs 新提议译名的冲突等待人工裁决关键原则写在upsert_term的注释里自动提取永远不能覆盖已确认的映射见 store.py#L292-L349。当模型提出不同译法时Wenyi 不强行替换而是把旧译名保留、新译名记入冲突表——这是零冲突的第一道保险。2.2 边翻译边提取术语库实时生长翻译不是等全书读完才建术语表。在 translation.py 中每完成一个翻译批次就会调用术语提取器extractor.py用轻量模型从原文-译文配对中提取人名、地名、组织、称谓、固定表达等与已有术语比对新术语入库、相同术语合并别名、不同译法进冲突表下一个批次立刻带上最新术语快照继续翻译。这意味着第 50 章新出场的人物在下一批翻译时就已经有固定译名不会等到读者发现不一致才补救。2.3 首现对齐优先采用历史上第一次怎么译更有巧思的是首现对齐机制extractor.py#L124-L209如果一个新术语在当前章节之前已经出现过Wenyi 会回溯找到它第一次被翻译的位置以那一版译文为准而不是采用模型当下随口给出的译名。如果历史映射不确定宁可暂缓入库也不让一个没把握的译名污染后续文本。三、六类术语分类称谓和敬语绝不误伤术语不是一锅端Wenyi 将术语细分为person / term / appellation称谓/ honorific敬语/ speech口癖/ fixed_expression固定表达六类见 store.py#L22-L30。其中称谓、敬语、口癖、固定表达只按完整原文匹配不允许别名命中——否则大小姐这类带语境的称呼会因为角色本名的别名被误注入到普通称呼里。匹配时还会做 NFKC 归一化、大小写折叠并剥离振假名注音标记store.py#L98-L146英文等空格分词的脚本则启用词边界匹配避免 Ann 误中 Anna。四、冲突裁决网页一键处理命令行亦可当术语库中出现冲突网页端会以醒目的琥珀色卡片列出当前译名 vs AI 建议你可以一键选择保留当前或接受建议前端实现在 GlossaryPage.tsx#L391-L437API 在 glossary.py#L107-L135。裁决后立即生效译名更新、状态恢复、所有关联冲突关闭。偏好命令行的读者同样可以glossary list 源文件—— 查看全部术语及状态glossary conflicts 源文件—— 列出未解决冲突glossary resolve 源文件 源词 定译—— 指定最终译名并关闭冲突。实现见 resolver.py 与 glossary.py。五、实战建议三步养成零冲突术语习惯翻译前先导入既有术语。如果你的系列作品已有定译表可在网页端导入上传 CSV/JSON导入前系统会先检测冲突逐条让你选择覆盖或跳过避免污染已有映射定期处理冲突卡片。冲突表是AI 拿不准、交给你拍板的清单建议每翻译完一个卷就清理一次越早裁决后续翻译越干净善用导出。术语库支持导出 CSV/JSONglossary.py#L138-L169可作为系列续作的种子术语库让第二部、第三部从第一章起就沿用同一套译名。 小提示术语库刻意保持插入顺序而非排序存储store.py#L374-L383这是为了维持提示词前缀缓存命中、降低长篇小说翻译成本——你无需关心但请尽量在开跑前把定译术语导进去。结语Wenyi 的实时术语库用双表结构 边译边提取 首现对齐 人工裁决四件套把长篇翻译中最棘手的术语一致性问题拆解成了一条可观测、可干预的流水线AI 负责发现与提议你只负责拍板。配合其双语预览与校对工作台让被语言阻隔的作品真正走进读者的语言。【免费下载链接】wenyi将被语言阻隔的作品带到读者的语言中。Bringing literature into your language.项目地址: https://gitcode.com/BigDawnGhost/wenyi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表