英文文献怎么用AI翻译才不出错:三步流程和术语表

直接翻译 PDF 结果不能读。正确流程是 PDF 转 Markdown、清洗、结合上下文翻译。本文给出工具选择依据、可复制提示词和必须人工核对的三处。

直接”翻译这份 PDF”,结果通常不能读

如果你试过把一篇英文 PDF 丢给 AI 说”翻译成中文”,大概见过这几种结果:公式变成乱码、表格串行、术语前后不一致、段落被切断导致句子接不上。

这不是模型不行,是流程错了。PDF 是排版格式,不是文本格式——它记的是”这个字画在坐标 (x,y)”,而不是”这句话属于哪一段”。你让模型直接处理 PDF,等于让它去猜版面结构,猜错是常态。

linux.do 上有一篇讲文献翻译的帖子(EzioSweet,2026-03-24,30 赞),楼主把这个问题说得很清楚:

“直接对译为中文 PDF 在很多时候是不合适的,主要问题在于中英文表述相同意义下的字数不同,以及对公式处理不佳。考虑这一点,找到一个合适的中间格式来转可能更好。”

他选的中间格式是 Markdown。理由也实在:纯文本、结构清晰、公式和表格能保留,转完之后还能用 mdbook 这类工具生成网页,多端都能看。

所以正确的流程是三段:PDF 转 Markdown → 清洗 → 翻译。下面逐段说,重点是每一段会踩什么坑。

第一步:PDF 转 Markdown,用哪个工具

这是整条流程里最影响成败的一步。转得不好,后面全白搭。

同帖里 scrapy 给了四条结论,第一条就很明确:

“PDF 转 md 文档首选必须是 mineru,试过市面上免费的和付费的(国外的没试过)工具都没有这个转换出来的效果好。无论是数学公式还是表格方面,都很不错。”

不过楼主自己的选择不太一样,他用的是 MonkeyOCR:

“我试了好几个,最后选择的是 MonkeyOCR,相较于 Deepseek OCR、PaddleVL OCR 等几个模型,这个主要的好处是不费劲,速度和效果……”

两个人都提到 mineru 质量高,但楼主补充了一个关键差异——如果你需要自己改版面识别参数,mineru 的工作流比较难改

“mineru 2.5 的质量非常之高……mineru 的工作流设计在开源方案里是比较好的一档,但是自己部署 OCR 模型的话,mineru 的工作流相较于 MonkeyOCR 和 DeepseekOCR 的工作流有点难改。我平时读的文献有一部分是需要自己改一下 layout 识别模型的参数的,比较简单的工作流好改一点。”

这段经验很值钱,它说明选工具要看你的用法:

你的情况 建议 理由
只是读文献,不需要调参数 mineru 公式和表格的转换效果是公认最好的一档
版面特殊,需要改识别参数 MonkeyOCR 工作流简单,改起来方便
不想折腾、要省事 PDF2zh 同帖有用户反馈”挺好用的”,适合直接出结果
文献翻译全链路与常见坑
转 Markdown 的质量决定上限,术语表决定一致性,人工核对决定能不能用。

第二步:清洗,这一步没有捷径

转换工具不是万能的,转出来的 Markdown 一定有问题。scrapy 的第二条结论就是:”转换 md 文档之后还需要清洗文档,比如某些公式、表格还是有问题。”

楼主补充了两种具体的故障形态,很有代表性:

“很多 OCR 模型总会搞一点有自己特点的输出,尤其是跨页代码的情况下,比如 MonkeyOCR 3B Pro 有时候会输出连续百个 wMineru 有时会不解析表格中的公式。”

这两个例子说明清洗要有针对性:

  • 跨页的地方重点看。内容被分页切开时,最容易出重复字符或丢失。
  • 表格里的公式要单独核。表格结构复杂,公式容易漏解析,变成一个空单元格或乱码。
  • 搜一遍异常重复字符。像连续上百个 w 这种,用查找替换很快能清掉。

如果只是自己读文献,清洗不用追求完美——楼主说得很实在:”主要目的是能读懂文献而不是做翻译。”公式错了但能看懂上下文,就先往下走。

第三步:翻译,别按段落切

这是最容易做错、也最影响可读性的一步。scrapy 的第三条结论:

“翻译文本的时候不能单纯按段落分割,最好是使用 DeepSeek 和 gemini 这种上下文大的,一定要结合上下文翻译,不然中英文互译涉及专业术语会有问题。”

为什么会出问题?因为一个术语在不同段落里可能是同一个概念的不同侧面。你一段一段独立翻译,模型看不到前文怎么译的,就会换词——读到后面你会以为在讲另一个东西。

楼主也提到全篇塞进上下文有成本问题,他给的替代方案是术语表:

“直接喂整体上下文在有些情况下有点贵,同时考虑到国内用国外模型很多都带着一些上下文产生污染,可以走一些别的路子,比如利用 GalTransl 这样工具提取一个术语表带在上下文里。”

这个思路可以简化成两步操作:

先抽术语表。把文档里的专业名词整理成”英文 → 中文”对照,翻的时候一起给模型。不一定要用工具,人工扫一遍把反复出现的术语挑出来就行。

再分批翻译,但每批都带上术语表。这样既控制了上下文长度,又保证了译名统一。

另外 scrapy 还强调了一点:提示词要按文档类型分开写。“翻译的提示词要反复优化,不同类型的 PDF 文档来区分,这样翻译效果会更好,专业性更强。”论文、合同、说明书的语言习惯差别很大,用同一套提示词,效果会打折。

一份可直接用的文献翻译提示词

把上面几条合起来,可以写成这样:

你是学术文献翻译助手。把下面这段英文 Markdown 翻译成中文。

【术语表】(必须严格使用以下译名,不得替换)
- attention mechanism → 注意力机制
- fine-tuning → 微调
- ablation study → 消融实验
(此处替换为你自己整理的术语表)

【翻译要求】
1. 保持 Markdown 格式不变,标题层级、列表、公式、表格一律原样保留
2. 公式不要翻译,也不要解释,原样输出
3. 术语严格按上面的对照表
4. 学术表达要准确,但避免生硬直译;读起来像中文文献,不要像翻译腔
5. 遇到原文表述含糊的地方,按字面翻译,不要自行补充解释
6. 不确定的专业词,保留英文原文并用括号标注

【输出】
- 只输出翻译后的 Markdown,不要加任何说明
- 如果发现原文有疑似 OCR 错误(乱码、重复字符),在这一处用  标注,但不要擅自修改

第 6 条最后那句”不要擅自修改”是刻意的。模型看到乱码会忍不住”帮你修好”,但一改你就不知道原文是什么了,核对时无从下手。让它标注、不改动,比让它自作主张安全。

核对:这三处必须自己看

翻译完不等于能用。以下三处建议人工过一遍:

  1. 数字和单位。百分比、样本量、年份、剂量——这些是硬信息,错了后果最严重,而且模型翻译时不会特别标注。
  2. 公式和符号。重点看有没有在翻译过程中被改动,或者上下标丢失。
  3. 结论性句子。“显著提升””无统计学差异”这类判断,正反说反了整段意思就错了。模型偶尔会翻反,务必对照原文看一眼。

顺带说一句,这套流程和”AI 读文献”是两件不同的事。翻译解决的是”看不懂英文”,理解解决的是”读懂内容并判断可信度”。后者的坑更多——AI 在文献引用、作者、数据归属上会出错,站内《AI读文献准确吗》专门梳理过哪些环节必须自己核,建议配合这篇一起看。

如果只是想把已转成 Markdown 的长文档提炼要点,站内《AI怎么总结PDF文件》给了提炼要点用的提示词。翻译提示词的通用写法参考《AI翻译提示词怎么写》,那篇讲了术语表和双语对照的格式。工具层面如果要比较具体选择,《AI翻译工具哪个好》按论文、邮件、合同、字幕分了场景。

整体判断

这条流程里,转 Markdown 的质量决定上限,术语表决定一致性,人工核对决定能不能用。三个环节缺一个,出来的东西都会让你在某个地方卡住。

但如果你只是偶尔读一两篇文献,不必上全套。找个工具转成 Markdown 直接读,看不懂的段落单独问 AI,比搭流程快得多。这套流程值得跑的场合是:你要读的量很大,或者同一个领域的文献要持续读下去——那时候术语表会越攒越有用。

AI工坊 面向普通人的 AI 实践教程站。专注职场办公、提示词与工具选择, 每篇教程都包含可直接复制的提示词、真实输入输出示例和失败边界说明。

内容说明:本站教程中的提示词与方法均经实际测试后发布;文中不出现未标注来源的数据, 也不对使用效果做收益承诺。AI 负责辅助,涉及事实、责任与对外承诺的内容请你本人确认后再使用。

工具说明:站内在线工具完全在你的浏览器本地运行,不联网、不调用 AI 接口, 填写内容不会上传到本站或任何第三方。

联系:联系我们 | 发现内容失效或有误,欢迎告知,我们会核实后更新。

版权所有 © 2026 AI工坊 · 普通人的 AI 实践工具库 | 京ICP备2026047205号-2