论文与系统· 科学证据 · Frontier
化学 PDF 如何变成 AI 可用的数据?MinerU.Chem 在文档解析之后再加一层“化学解析”
MinerU.Chem 把整篇化学论文转成可追溯、可核对、还能被程序继续处理的数据:从分子结构与 SMILES,延伸到化合物编号和反应关系。
●技术报告 + 公开系统 + 模块评测
当前边界:技术报告、公开系统与模块评测;缺少整篇文档的端到端正确率
这项工作推进的是:把化学论文读成可追溯的结构化数据
- MODEL理解 / 预测
- DECIDE选择下一步
- INTERACT执行与测量
- UPDATE改变下一轮
系列导读
MinerU.Chem 系列|从化学 PDF 到机器可用的反应数据
01|发生了什么
在 PDF 解析结束的地方,化学解析才开始
上海人工智能实验室 OpenDataLab 团队发布了 MinerU.Chem 技术报告,参与作者还来自华东师范大学、同济大学、复旦大学、上海交通大学和北京大学等机构。它要回答的是一个很具体的问题:一篇有机化学论文进入系统以后,怎样才能从 PDF 变成可以搜索、计算、核对,甚至继续喂给模型的数据?[S1]
普通 PDF parser 已经可以找到标题、段落、公式和表格,但到了化学论文,事情会突然变得麻烦。一张反应路线在人眼里包含底物、产物、催化剂、温度和步骤顺序;对通用文档系统来说,它却很可能只是一个 rectangular image block。[S1]
PDF 被解析完成,不代表其中的化学知识也被解析了。MinerU.Chem 补的正是 document parsing 之后缺的那一层:chemistry parsing。
02|What Changed
从页面区域到可追溯的分子与反应记录
一篇论文要依次经过五个处理环节
MinerU.Chem 没有让一个大模型从整页 PDF 一步跳到 reaction database,而是把问题拆成一串相互依赖的模块。MinerU 先做通用页面解析;化学专用部分先判断 figure 或 table 是否真的与 chemistry 有关,避免把显微照片和普通图表继续送进昂贵的专用模型。[S1]
接下来,系统先找分子画在什么位置,再寻找附近的 1a、2b、compound 7 等化合物编号,把图中的结构与论文里的称呼连起来。到第四步才进入 OCSR:把二维结构图恢复成分子图,并导出 MolFile、SMILES 等机器可读格式。[S1]
最后一步解析反应图:判断哪些分子是反应物和产物,箭头旁的文字是试剂、溶剂还是温度,以及多条箭头属于几个连续步骤。五个环节合在一起,系统才从识别图片走到结构化化学数据。[S1][S3]
只认出 SMILES,却不知道它在论文里叫 2b 还是 7c,后面很难回到原图核验;只找出所有 molecules,却没有恢复 reaction relationships,得到的仍是一堆分子卡片,而不是 synthesis route。

论文 Fig. 1。读图重点:左侧是 PDF 经 MinerU 通用解析后的页面;中间依次经过化学相关性筛选、分子检测、编号提取、结构识别与反应图解析;右侧输出 Molecule Summary List 与 Reaction Summary List。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]
最终输出不是摘要,是一套“证据索引”
Molecule Summary List 保存每个 molecule 的来源位置、compound identifier、结构表示和 MolFile / SMILES。Reaction Summary List 再把 reactants、products 与 conditions 组织起来,并链接回已经识别出的 molecule records。[S1]
系统会为每条记录保留来源位置。若立体化学识别错了,研究人员仍能回到对应页面和原始框选区域检查。一段摘要如果错了,很难知道错在哪;带有来源位置的结构化记录,至少可以抽查、重标和修正。[S1]
不妨把它理解成:MinerU.Chem 在给 PDF 建一层 chemical evidence index。

论文 Fig. 2。左侧记录分子的 SMILES、编号、原图与识别结构;右侧把连续反应步骤整理成可回查的 reaction records。这正是本文所说的“证据索引”。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]
为什么不能只用 SMILES
真实论文里的结构远比 textbook SMILES 复杂。化学家会直接写 Ph、Et、Bu,会画 Markush fragment、polymer repeating unit、波浪键、配位键和非常规价态。如果图里明明写的是 Ph,系统为了得到标准 SMILES 直接把它展开成完整苯环,输出也许化学上合法,却已经不再忠实对应 source figure。[S2][S1]
CARBON 不只保存原子和化学键,也保留二维坐标、缩写和普通 SMILES 很难承载的复杂属性,再从这个中间表示导出常用格式。处理顺序很重要:先忠实记录论文里画了什么,再做标准化。[S2][S1]

论文 Fig. 4。左侧比较几种表示能否承载 Markush、非常规键与重复结构;右侧展示 CARBON 如何同时保存原子、键、属性与二维坐标。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]
03|关键数字
93.02% 是模块结果,不是整篇文档正确率
04|为什么重要
把沉睡在文献里的化学知识变成可用数据
93.02% 这个数字最容易被误读。它不是“整篇化学论文 93.02% 被正确解析”,只是分子结构识别这一个模块在特定 benchmark subset 上的 exact-match 结果。前面还有 detection 和 identifier matching,后面还有 reaction parsing 和 document-level linking;多模块串起来之后的 end-to-end correctness,是另一回事。[S1]
过去几十年的合成知识大量沉在论文、补充材料和专利里,其中许多关键信息只画在反应路线和分子结构图中。只要它们仍是图片,就很难直接用于反应预测、逆合成、条件建模或新的化学基础模型。MinerU.Chem 提供了一条把这些文献转成训练和检索数据的路径。
MinerU.Chem 想缩短的,是 human-readable literature 到 machine-usable scientific data 之间的距离。难点不在于批量跑模型,而在于跑的同时还要保住 extraction 和 provenance 两头。
WHAT CHANGED
- AI4S 层级
- Scientific data / Chemistry literature mining
- 原有瓶颈
- 大量化学知识困在 figure 与 reaction scheme 的像素里
- 这次改变
- 在通用文档解析之后,串联化学区域筛选、结构检测、编号识别、OCSR 和反应图解析
- 关键证据
- 可回到原文核验的 Molecule Summary List 与 Reaction Summary List
- 仍未解决
- 文档级端到端正确率、复杂 Markush / R-group、多步路线与人工复核成本
EVIDENCE IN CONTEXT
- 编辑状态
- 前沿
- 证据场景
- 回顾性或模拟
- 证据怎样产生
- 回顾性
- 来源与可检查性
- 技术报告 · 公开系统
- 证据上限
- 它证明了分模块的化学文档抽取在公开样本上可行,但没有证明整篇论文可以无需人工修改直接入库。
05|证据状态与边界
仍然缺少整篇文档的端到端正确率
这是一份技术报告和已经部署的系统,但目前最漂亮的 quantitative results 主要集中在单个模块,而不是整篇文档的 end-to-end extraction。一个 compound identifier 错配,或一条 condition 挂到相邻箭头上,都可能生成格式合法、内容却错误的数据库记录。[S1]
复杂 Markush、R-group、跨页关联和多步路线仍是明显边界。目前它更适合做大规模初步处理,再把困难样本交给人工复核。接下来需要看到的是:一篇论文能自动产生多少条正确记录,以及修好剩余错误要花多少人工时间。
06|What I Learned
可追溯性本身就是科学数据的一部分
文档解析在 OCR 结束以后才刚开始化学论文里的反应路线是图结构,材料论文可能有相图,生物论文可能有通路图。通用解析器解决页面上有什么,领域系统还要理解这些内容在相应科学问题中意味着什么。
科学数据既要准确,也要能追溯来源错误的立体化学如果安静进入训练数据库,风险与聊天机器人偶尔说错一句话不同。来源页码、原图位置和化合物编号看起来不太像 AI,却是科学数据系统的重要部分。
最现实的 automation 往往不是无人值守机器先做大规模 extraction,把人的时间集中到复杂 Markush、低置信结构和跨页关联上,可能比追求“完全自动”更有价值。
大量文献知识仍然没有被结构化模型变强以后,瓶颈未必总在网络结构。很多高价值的科学知识,可能只是还没有变成模型和程序能够使用的数据。
资料来源
文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。
- S1MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction RecognitionOpenDataLab / arXiv · 2026.08.04 · 技术报告
- S2MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure RecognitionOpenDataLab / arXiv · 2026.05.07 · 论文与数据集
- S3RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided CaptioningCVPR 2026 · 2026 · 同行评审论文
- S4MinerU 在线解析平台OpenDataLab · 2026 · 公开系统
