ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

MinerU 多语言 OCR:37 种语言文档一次搞定(PP-OCRv5 指南)

MinerU 多语言 OCR:37 种语言文档一次搞定(PP-OCRv5 指南) MinerU 多语言 OCR37 种语言文档一次搞定PP-OCRv5 指南【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU中英混排的 PDF 丢进 OCR中文正常、英文变乱码换成一份俄语合同识别结果干脆没法用。这类问题的根源在于单语模型撑不起多语场景。MinerU 多语言 OCR 从 2.1.0 版本起在 pipeline 后端换用 PP-OCRv5 文本识别模型一次解析覆盖 37 种语言官方给出的平均精度涨幅超过 30%。⚡ MinerU 37 种语言能力速览这套能力可以概括为三句话。语言上覆盖东亚、拉丁、斯拉夫、阿拉伯、印度语系等主要语系共 37 种语言其中中英、日繁混合是精度最高的组合。效果上相比上一代识别模型平均识别精度提升超过 30%。使用上命令行和 Python 接口共用同一个lang入口不需要额外部署服务也不改变原有的输出结构。 MinerU 多语言 OCR 快速上手安装完成后一条命令就能看到结果mineru -p demo/pdfs/demo1.pdf -o output解析完成后output目录下会生成 Markdown、图片和结构化 JSON。想指定文档语言加一个--lang参数即可例如--lang korean完整的参数说明见命令行工具文档。Python 调用同样短from mineru.cli.common import do_parse do_parse( input_pathdemo/pdfs/demo1.pdf, output_diroutput, )需要指定语言时给do_parse追加lang参数即可。模型首次运行会自动下载之后都是本地推理。下图是识别阶段框出的文本行每种语言走的都是同一套框选流程 原理白话版从文本检测到分语系识别整条链路分四步。第一步版面模型先框出页面上的文本行第二步系统根据你传入的lang参数、或不传时的默认设置决定调用哪套识别模型第三步对应语系的模型把文本行逐个转成文字第四步所有语言的结果走同一套后处理包括断字合并、标点校正再和版面信息一起组装成 Markdown 或 JSON。下图展示了文本行框选之前的版面检测环节文本、公式、图表区域被分别框出多语言识别都建立在这些框之上 MinerU 支持的语言列表下表按语系列出主要语言及对应的语言代码代码与--lang/lang参数一致语系代表语言语言代码东亚中文、英文、日文、韩文、繁体中文ch、korean拉丁法、西、葡、德等主流拉丁语言及希腊语el希腊语其余走默认模型斯拉夫俄语等东斯拉夫语言east_slavic、cyrillic阿拉伯阿拉伯语arabic印度语系泰米尔语、泰卢固语、卡纳达语、天城文ta、te、ka、devanagari东南亚泰语th选型建议文档语言明确就填对应代码中英日繁混排用默认的ch系列拿不准语言时先跑一遍默认流程再抽查结果。场景配置默认流程与显式指定的取舍国际化商业报告多语言混排就保持默认流程基座模型本身已覆盖 37 种语言不要强行指定单一语言若某一语言占绝对主导再显式指定该语言。学术论文多语言引用公式解析默认开启无需额外配置手写页或外文引用较多的论文把lang指向对应语系代码更稳。纯拉丁语系文档直接跑默认流程即可不传--lang。取舍的标准很简单显式指定的作用是把识别模型收窄到目标语系字典更聚焦、小语种更稳代价是猜错语言反而降精度所以「确定才指定不确定用默认」。⚠️ MinerU 语言识别不准怎么办语言误判如把日文按中文识别出现同形字错误原因是混排页面按高频语言优先显式--lang到正确语言即可纠正。个别语言效果差小语种训练样本少生僻符号仍会出错换用该语系专用代码或把扫描件提升到 300DPI 左右再跑一次。大文档内存吃紧一次处理的页数越多内存峰值越高调小环境变量MINERU_PROCESSING_WINDOW_SIZE默认 64分批处理。更细的参数含义可以对照快速上手文档里的环境变量一节。MinerU 2.1.0 把多语言识别从「按语言挑工具」变成了同一条 pipeline 里的常规操作检测、分语系识别、后处理共用一个流程37 种语言共享同一套输出格式中英混合识别也不再需要前后两套工具。[!TIP] 本文基于 2.1.0 版本的功能与参数编写。后续版本可能调整语言代码与默认模型使用前请以对应版本的文档为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表