论文与系统· 科学证据 · Frontier

化学 PDF 如何变成 AI 可用的数据?MinerU.Chem 在文档解析之后再加一层“化学解析”

MinerU.Chem 把整篇化学论文转成可追溯、可核对、还能被程序继续处理的数据:从分子结构与 SMILES,延伸到化合物编号和反应关系。

更新于 10分钟阅读

技术报告 + 公开系统 + 模块评测

当前边界技术报告、公开系统与模块评测;缺少整篇文档的端到端正确率

这项工作推进的是把化学论文读成可追溯的结构化数据

  1. MODEL理解 / 预测
  2. DECIDE选择下一步
  3. INTERACT执行与测量
  4. UPDATE改变下一轮

系列导读

MinerU.Chem 系列|从化学 PDF 到机器可用的反应数据

PDF化学区域分子结构反应关系结构化数据

01|发生了什么

在 PDF 解析结束的地方,化学解析才开始

上海人工智能实验室 OpenDataLab 团队发布了 MinerU.Chem 技术报告,参与作者还来自华东师范大学、同济大学、复旦大学、上海交通大学和北京大学等机构。它要回答的是一个很具体的问题:一篇有机化学论文进入系统以后,怎样才能从 PDF 变成可以搜索、计算、核对,甚至继续喂给模型的数据?[S1]

普通 PDF parser 已经可以找到标题、段落、公式和表格,但到了化学论文,事情会突然变得麻烦。一张反应路线在人眼里包含底物、产物、催化剂、温度和步骤顺序;对通用文档系统来说,它却很可能只是一个 rectangular image block。[S1]

PDF 被解析完成,不代表其中的化学知识也被解析了。MinerU.Chem 补的正是 document parsing 之后缺的那一层:chemistry parsing。

02|What Changed

从页面区域到可追溯的分子与反应记录

一篇论文要依次经过五个处理环节

MinerU.Chem 没有让一个大模型从整页 PDF 一步跳到 reaction database,而是把问题拆成一串相互依赖的模块。MinerU 先做通用页面解析;化学专用部分先判断 figure 或 table 是否真的与 chemistry 有关,避免把显微照片和普通图表继续送进昂贵的专用模型。[S1]

接下来,系统先找分子画在什么位置,再寻找附近的 1a、2b、compound 7 等化合物编号,把图中的结构与论文里的称呼连起来。到第四步才进入 OCSR:把二维结构图恢复成分子图,并导出 MolFile、SMILES 等机器可读格式。[S1]

最后一步解析反应图:判断哪些分子是反应物和产物,箭头旁的文字是试剂、溶剂还是温度,以及多条箭头属于几个连续步骤。五个环节合在一起,系统才从识别图片走到结构化化学数据。[S1][S3]

只认出 SMILES,却不知道它在论文里叫 2b 还是 7c,后面很难回到原图核验;只找出所有 molecules,却没有恢复 reaction relationships,得到的仍是一堆分子卡片,而不是 synthesis route。

论文图 1:MinerU.Chem 从文档页面到结构化化学记录的整体流程
论文图 1:MinerU.Chem 从文档页面到结构化化学记录的整体流程

论文 Fig. 1。读图重点:左侧是 PDF 经 MinerU 通用解析后的页面;中间依次经过化学相关性筛选、分子检测、编号提取、结构识别与反应图解析;右侧输出 Molecule Summary List 与 Reaction Summary List。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]

最终输出不是摘要,是一套“证据索引”

Molecule Summary List 保存每个 molecule 的来源位置、compound identifier、结构表示和 MolFile / SMILES。Reaction Summary List 再把 reactants、products 与 conditions 组织起来,并链接回已经识别出的 molecule records。[S1]

系统会为每条记录保留来源位置。若立体化学识别错了,研究人员仍能回到对应页面和原始框选区域检查。一段摘要如果错了,很难知道错在哪;带有来源位置的结构化记录,至少可以抽查、重标和修正。[S1]

不妨把它理解成:MinerU.Chem 在给 PDF 建一层 chemical evidence index。

论文图 2:Molecule Summary List 与 Reaction Summary List 的实际界面示例
论文图 2:Molecule Summary List 与 Reaction Summary List 的实际界面示例

论文 Fig. 2。左侧记录分子的 SMILES、编号、原图与识别结构;右侧把连续反应步骤整理成可回查的 reaction records。这正是本文所说的“证据索引”。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]

为什么不能只用 SMILES

真实论文里的结构远比 textbook SMILES 复杂。化学家会直接写 Ph、Et、Bu,会画 Markush fragment、polymer repeating unit、波浪键、配位键和非常规价态。如果图里明明写的是 Ph,系统为了得到标准 SMILES 直接把它展开成完整苯环,输出也许化学上合法,却已经不再忠实对应 source figure。[S2][S1]

CARBON 不只保存原子和化学键,也保留二维坐标、缩写和普通 SMILES 很难承载的复杂属性,再从这个中间表示导出常用格式。处理顺序很重要:先忠实记录论文里画了什么,再做标准化。[S2][S1]

论文图 4:CARBON 与 SMILES、E-SMILES、MolFile 对复杂化学语义的表示比较
论文图 4:CARBON 与 SMILES、E-SMILES、MolFile 对复杂化学语义的表示比较

论文 Fig. 4。左侧比较几种表示能否承载 Markush、非常规键与重复结构;右侧展示 CARBON 如何同时保存原子、键、属性与二维坐标。Yang et al., arXiv (2026),CC BY-NC-SA 4.0。 [S1]

03|关键数字

93.02% 是模块结果,不是整篇文档正确率

5

chemistry-specific processing modules[S1]

5,024

修订版 MolRecBench-Wild 中带完整 graph annotation 的结构图[S1]

2,392

能够合法转换为 SMILES、进入 SMILES 评测的样本[S1]

93.02%

GTR-VL-1.4.13 在该 subset 上的 SMILES Exact Match[S1]

79.66%

在 5,024 个 graph-annotated samples 上的 Graph Accuracy[S1]

04|为什么重要

把沉睡在文献里的化学知识变成可用数据

93.02% 这个数字最容易被误读。它不是“整篇化学论文 93.02% 被正确解析”,只是分子结构识别这一个模块在特定 benchmark subset 上的 exact-match 结果。前面还有 detection 和 identifier matching,后面还有 reaction parsing 和 document-level linking;多模块串起来之后的 end-to-end correctness,是另一回事。[S1]

过去几十年的合成知识大量沉在论文、补充材料和专利里,其中许多关键信息只画在反应路线和分子结构图中。只要它们仍是图片,就很难直接用于反应预测、逆合成、条件建模或新的化学基础模型。MinerU.Chem 提供了一条把这些文献转成训练和检索数据的路径。

MinerU.Chem 想缩短的,是 human-readable literature 到 machine-usable scientific data 之间的距离。难点不在于批量跑模型,而在于跑的同时还要保住 extraction 和 provenance 两头。

WHAT CHANGED

AI4S 层级
Scientific data / Chemistry literature mining
原有瓶颈
大量化学知识困在 figure 与 reaction scheme 的像素里
这次改变
在通用文档解析之后,串联化学区域筛选、结构检测、编号识别、OCSR 和反应图解析
关键证据
可回到原文核验的 Molecule Summary List 与 Reaction Summary List
仍未解决
文档级端到端正确率、复杂 Markush / R-group、多步路线与人工复核成本

EVIDENCE IN CONTEXT

编辑状态
前沿
证据场景
回顾性或模拟
证据怎样产生
回顾性
来源与可检查性
技术报告 · 公开系统
证据上限
它证明了分模块的化学文档抽取在公开样本上可行,但没有证明整篇论文可以无需人工修改直接入库。

05|证据状态与边界

仍然缺少整篇文档的端到端正确率

这是一份技术报告和已经部署的系统,但目前最漂亮的 quantitative results 主要集中在单个模块,而不是整篇文档的 end-to-end extraction。一个 compound identifier 错配,或一条 condition 挂到相邻箭头上,都可能生成格式合法、内容却错误的数据库记录。[S1]

复杂 Markush、R-group、跨页关联和多步路线仍是明显边界。目前它更适合做大规模初步处理,再把困难样本交给人工复核。接下来需要看到的是:一篇论文能自动产生多少条正确记录,以及修好剩余错误要花多少人工时间。

06|What I Learned

可追溯性本身就是科学数据的一部分

文档解析在 OCR 结束以后才刚开始化学论文里的反应路线是图结构,材料论文可能有相图,生物论文可能有通路图。通用解析器解决页面上有什么,领域系统还要理解这些内容在相应科学问题中意味着什么。

科学数据既要准确,也要能追溯来源错误的立体化学如果安静进入训练数据库,风险与聊天机器人偶尔说错一句话不同。来源页码、原图位置和化合物编号看起来不太像 AI,却是科学数据系统的重要部分。

最现实的 automation 往往不是无人值守机器先做大规模 extraction,把人的时间集中到复杂 Markush、低置信结构和跨页关联上,可能比追求“完全自动”更有价值。

大量文献知识仍然没有被结构化模型变强以后,瓶颈未必总在网络结构。很多高价值的科学知识,可能只是还没有变成模型和程序能够使用的数据。

资料来源

文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。

  1. S1MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction RecognitionOpenDataLab / arXiv · 2026.08.04 · 技术报告
  2. S2MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure RecognitionOpenDataLab / arXiv · 2026.05.07 · 论文与数据集
  3. S3RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided CaptioningCVPR 2026 · 2026 · 同行评审论文
  4. S4MinerU 在线解析平台OpenDataLab · 2026 · 公开系统