论文与系统· 科学证据 · Frontier
AI 如何读懂整条化学反应路线?从“认出分子”到恢复反应关系
完整的反应图解析,要把识别出的分子继续组织成反应关系:谁和谁发生反应、条件属于哪一步,以及复杂 synthesis scheme 里的箭头如何连成一条路线。
●同行评审论文 + 预印本 + task evaluation
当前边界:同行评审论文、预印本与任务评测;尚无整篇论文直接入库的端到端可靠性数据
这项工作推进的是:从化学图中恢复反应关系
- MODEL理解 / 预测
- DECIDE选择下一步
- INTERACT执行与测量
- UPDATE改变下一轮
系列导读
MinerU.Chem 系列|从化学 PDF 到机器可用的反应数据
01|发生了什么
从识别分子到恢复整条反应路线
前两篇分别讲了整条化学 PDF 的解析流程,以及怎样把二维结构图恢复成分子图。现在假设图里的每个分子都已经正确框出、结构也认对了,新的麻烦才刚开始。[S4][S5]
左边两个分子是不是 reactants?右边那个一定是 product 吗?箭头上写的 H2O2、Amberlite IR 120H、solvent 和温度属于哪一步?一张图里有五六条箭头、分支和回环时,它们怎样组合成完整 synthesis route?
反应图解析需要同时识别分子、文字、空间布局和彼此关系,最后才能生成数据库可以继续使用的反应记录。[S1]
02|What Changed
把精确定位与语义推理交给不同模型
别让一个大模型同时干两种活
一种直接的方法,是把整张 reaction image 交给 VLM,同时要求它找出每个 molecule 的位置并判断角色。大型 VLM 擅长理解画面在说什么,未必擅长精确回归一长串像素坐标;框稍微偏一点,object identity 与 reaction relationship 都可能跟着乱。[S1]
RxnCaption 的处理很工程化:先用专门的 MolYOLO 找出 molecules,在图上画框并编号;VLM 不再猜 coordinates,只围绕已编号 objects 描述关系。任务从“找到产品的精确坐标并判断它是什么”变成“编号 1 和 2 是 reactants,编号 3 是 product,箭头旁文字是 condition”。[S1][S2]
作者把这叫 BIVP,Bounding-box Index as Visual Prompt。变化看似只是“先画框”,背后却是一种成熟的 scientific AI system design:specialist model 做精确 perception,foundation model 做更擅长的 semantic reasoning。[S1]
真实 reaction diagram,需要更接近 production 的数据
用于 molecule detection 的 MolDet-33k 人工标注了 219,721 个 molecular bounding boxes,清理后的数据包括 12,209 张 page-level images 与 21,155 张 figure / table-level images。在此基础上,更新后的 RxnCaption 数据覆盖 15,128 张 reaction parsing training images。[S1][S2]
数据量不是唯一变化。简单的从左到右单步反应,和一张带有多行、分支、回环和树状依赖的全合成路线,不是同一个难度等级。数据集因此专门覆盖了不同布局。模型走向实际使用以后,样本分布往往比总数量更重要。[S1]
论文里已经写了 1a 和 2b,AI 为什么还要重新编号
BIVP 解决 coordinates 问题,却人为修改了原图。RxnID 提出更自然的 IdtVP:直接把原图中的 compound identifier 当作 visual-semantic handle。化学论文正文会写“compound 1a was converted to 2b”,模型也可以直接说“1a → 2b”,而不用记“蓝色框里的第 3 个 molecule”。[S3]
1a 与 2b 本来只是化学家的排版习惯,对 multimodal model 来说,却成了天然 grounding token。论文的 zero-shot experiment 中,Gemini 3 Pro + IdtVP 在 RxnScribe-test 上报告 71.70% Hybrid Match F1 和 88.11% Soft Match F1;在历史扫描文献 ScannedRxn 上,zero-shot Soft Match F1 为 86.5%。[S3]
这些不是“86.5% 的反应图完全正确”。Soft Match 与 Hybrid Match 是 task-specific relationship metrics,会宽容部分空间或匹配差异;它们不等于数据库 record 无需修改。[S3]
现实里,很多分子根本没有编号
Identifier 很好用,却不是免费的 ground truth。intermediate 可能没有编号,同一个 7 会在不同 figure 重新出现,identifier 可能离 structure 很远;有些 compound 只在正文被称作 compound 7,图里没有文字。[S3]
RxnID 因此加入 Mid-Mapper:已有 identifier 的 molecule 尽量直接对应,没有编号的再补 virtual identifier,让 downstream model 仍然能够引用。到这里,问题已经从“读一张图”向“理解整篇 document”移动,cross-page reference resolution 会成为新的 bottleneck。[S3]
为什么还要用可验证奖励
Reaction parsing 最后常输出 JSON,但 reaction 不是有唯一顺序的字符串。两个并列 reactants 谁先写不会改变 chemistry,彼此独立的 reactions 在 JSON 里交换顺序也不代表错误。普通 next-token loss 却会因为 serialization order 不同而惩罚语义正确的答案。[S3]
RxnID 的 Re³-DAPO 在整组反应关系上计算奖励,而不是逐个 token 要求字符串完全相同。这样,两个并列反应物交换顺序时,不会因为写法不同就被判错。训练时判断的对象开始接近真正的反应关系,而不是固定格式的 JSON。[S3]
可验证奖励也有边界。如果箭头被裁掉、condition 看不清,或 identifier 跨页失联,模型仍可能生成格式漂亮的 JSON。reward 能检查输出是否符合标注规则,却不能替化学家证明反应真的发生、yield 可靠或条件可复现。
03|关键数字
高 task F1 仍不是数据库级正确率
04|为什么重要
一套模块化的化学反应提取架构正在形成
RxnCaption 和 RxnID 有意思的地方不是 leaderboard,是它们在慢慢拼出一套 scientific AI architecture:specialist perception model + foundation model reasoning + structured verification。MolYOLO 做精确 localization,VLM 理解反应关系,compound identifier 提供 grounding,reaction-level metric 检查 structured output。[S1][S3]
这套分工比把整张图直接交给一个更大的多模态模型,更接近实际的数据生产系统。与 MinerU.Chem 串起来后,它可以把论文和补充材料里的反应路线,转成逆合成、反应预测和化学知识库能够使用的数据。
WHAT CHANGED
- AI4S 层级
- Scientific data / Reaction extraction
- 原有瓶颈
- Molecules、text、spatial layout 与 reaction roles 必须同时恢复
- 这次改变
- RxnCaption 拆开“在哪里”与“是什么关系”;RxnID 利用论文原生 1a / 2b 作为视觉句柄
- 关键证据
- Specialist detector 负责 localization,VLM 负责 semantic reasoning
- 仍未解决
- 无编号结构、跨页 reference、模糊条件、复杂多步骤路线与 document-level reliability
EVIDENCE IN CONTEXT
- 编辑状态
- 前沿
- 证据场景
- 回顾性或模拟
- 证据怎样产生
- 回顾性
- 来源与可检查性
- 同行评审 · 预印本
- 证据上限
- 它证明了分工式解析能改善反应关系恢复,但没有证明上游到入库的整条链条可靠。
05|证据状态与边界
整篇论文的入库可靠性仍未被测量
这组 benchmark 证明 reaction diagram parsing 可以明显改善,但没有回答最现实的 document-level question:一整篇论文进入系统,最终有多少 reaction records 可以不经人工修改直接入库?上游 molecule detection、OCSR、OCR、image cropping 和 identifier matching 的错误都会传到这一层。[S1][S3][S4]
Hybrid / Soft Match 是 task-specific evaluation,不等于 scientific validity。Reaction Diagram Parsing 可以提取 A + B → C、condition X,却不能验证实验真的成功、yield 是否可靠、机制是否正确或结果能否复现。它解决的是 information extraction,不是 chemical validation。
06|What I Learned
科学 notation 可以成为 AI 的原生接口
Foundation model 不该包办所有任务把 precise localization 交给 detector,让 VLM 专心做 relationship reasoning,是更成熟的系统设计。
科学家几十年前定下的 notation,可能天然适合 AI1a 和 2b 本来只是论文里的编号习惯,如今却成了很好用的 multimodal grounding interface。
训练目标应该对应真正的反应关系反应更接近一张图或一组关系,不是必须按固定顺序输出的字符串。
最后应该看整条流程留下多少可用数据用户需要的不是检测器 98%、OCSR 93%,再加一个漂亮的解析 F1,而是一篇 PDF 最后能留下多少条高可信、可追溯、无需修改的记录,修好剩余错误又要花多久。
把三篇放回同一条链看通用解析器先找到化学区域,OCSR 把图片恢复成分子图,化合物编号把结构和上下文连起来,反应解析器再恢复反应物、产物、条件和关系。单独一个 93% 或 98% 说明不了整套系统好不好,最终要看文献能否稳定变成高质量、可追溯、机器可用的数据。
资料来源
文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。
- S1RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided CaptioningCVPR 2026 · 2026 · 同行评审论文
- S2RxnCaption 官方仓库与更新版数据说明OpenDataLab · 2026 · 代码与数据说明
- S3Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram ParsingarXiv · 2026.03.16 · 预印本
- S4MinerU.Chem 技术报告OpenDataLab / arXiv · 2026.08.04 · 技术报告
- S5MolRecBench-WildOpenDataLab / arXiv · 2026.05.07 · 论文与数据集
