Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

opendatalab

MinerU-Diffusion

626+0/dayPython去 GitHub
分享
AI 中文解读
MinerU-Diffusion 是一个来自 OpenDataLab 的文档 OCR 新框架,核心思路是用扩散模型替代传统的自回归解码,实现文档文字的并行识别。简单说,以前 OCR 处理一篇满是表格、多栏和复杂排版的文档时,需要从左到右一个字一个字地“读”,速度慢且容易受上下文错误累积影响。MinerU-Diffusion 把文档 OCR 看作一个“逆渲染”过程——通过扩散解码,一次性对整块区域进行并行重建,直接输出完整文本和布局信息。这意味着它能更快、更稳定地处理高噪点、任意排版的文档,甚至在墨迹模糊、文字倾斜的场景下依然保持高准确率。 该项目最亮眼的技术创新在于“块级并行扩散解码”。传统扩散模型通常逐像素生成图像,而 MinerU-Diffusion 将文档划分为逻辑块(如段落、表格单元格),每个块内的字符信息通过少量扩散步骤并行恢复,大幅降低推理延迟。据官方披露,在同等精度下,其处理速度相比自回归模型提升数倍,同时模型仅 2.5B 参数,轻量友好。此外,它天然具备布局感知能力,能自动区分标题、正文、页眉页脚,输出的结果保留了文档的原始结构。项目还与 SGLang 推理框架做了适配,方便部署到生产环境。 适用场景非常直观:需要批量处理扫描件、PDF、拍摄文档的团队,比如档案数字化、财务报表识别、学术论文提取、合同比对等。对于中小开发者,可直接使用 HuggingFace 或 ModelScope 上预训练的 2.5B 模型,无需自己训练。上手门槛不高,Python 环境,熟悉 PyTorch 即可调用推理接口。虽然项目目前处于早期阶段(ECCV 2026 收录),但代码和模型均已开源,文档示例清晰。如果你厌倦了传统 OCR 对复杂版面的无能为力,MinerU-Diffusion 是一个值得立刻尝试的利器——它让“并行看懂”文档不再是奢望。
[ECCV 2026] A diffusion-based framework for document OCR that replaces autoregressive decoding with block-level parallel diffusion decoding.