Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

opendatalab

MinerU-Diffusion

616+0/dayPython去 GitHub
分享
AI 中文解读
MinerU-Diffusion是OpenDataLab团队在ECCV 2026上发布的一个颠覆性文档OCR框架,它彻底改变了传统OCR的底层逻辑。过去,文档识别依赖自回归解码,一个字一个字地生成,速度慢且容易在长文档中累积错误。这个项目创新性地把OCR问题重新定义为“逆渲染”,用扩散模型(Diffusion Model)来做解码,直接按“块”并行生成整个文本区域,而不是逐字翻译。简单说,它把OCR从“打字员逐字敲键盘”变成了“印刷机整版压印”,速度和鲁棒性都有了质的飞跃。 技术亮点非常硬核。首先是块级并行扩散解码,模型能同时处理多个文本块,推理速度大幅提升,配合SGLang框架部署,生产环境下的吞吐量非常可观。其次,它天然具备布局感知能力,因为扩散模型是在二维空间上操作,能直接捕捉版面结构,对表格、多栏排版、复杂公式的识别效果远超传统OCR。模型只有2.5B参数,却能在保证高精度的同时保持轻量,对硬件要求很友好。另外,它摆脱了自回归解码对顺序的依赖,单点噪声不会像多米诺骨牌一样扩散到整篇文档,抗干扰能力显著增强。 适用场景非常广泛。凡是涉及文档数字化、档案扫描、PDF转Markdown、财务报表识别、学术论文提取、古籍数字化等领域,它都能大显身手。尤其适合处理那些让传统OCR头疼的复杂版面,比如带图表的论文、多栏报纸、手写批注混排的文档。开发者可以直接用HuggingFace或ModelScope上发布的预训练模型,快速集成到自己的文档处理管线中。 上手门槛不算高。项目是纯Python实现,依赖PyTorch生态,熟悉深度学习基础就能开始。官方提供了完整的推理脚本和模型权重,普通开发者照着文档跑通demo并不难。如果你想深入改造或微调,就需要对扩散模型和Transformer架构有一定理解,但好在代码结构清晰,社区也在快速壮大。总的来说,这是OCR领域一次值得关注的技术范式革新,对文档处理效率有刚需的团队应该尽早尝试。
[ECCV 2026] A diffusion-based framework for document OCR that replaces autoregressive decoding with block-level parallel diffusion decoding.