论文解读 · 分子表征· 科学证据 · Frontier
分子进入 Transformer 之前,信息可能已经丢了
覆盖缺口在常规药物基准上不易暴露,却会在罕见元素、同位素与复杂立体信息的组合中迅速放大。Smirk 用 165 个基础 token 补上了这一缺口。
◆同行评审论文 + 公开 benchmark + 同团队后续预印本
当前边界:完整覆盖 OpenSMILES 语法,不等于覆盖三维构象与物理环境。
这项工作推进的是:让分子字符串在进入模型时保留罕见元素、同位素、电荷与几何信息
- MODEL理解 / 预测
- DECIDE选择下一步
- INTERACT执行与测量
- UPDATE改变下一轮
更新(2026-09-10)Smirk 已被用于同团队的 1.8B 参数 MIST,说明它可以进入大规模训练管线;但 MIST 仍是预印本,也没有隔离 tokenizer 对性能的独立贡献。[S3]
01|发生了什么
封闭词表会静默抹掉罕见化学信息
分子模型在 MoleculeNet 上表现很好,并不意味着 tokenizer 保留了所有输入信息。
许多化学模型使用 Atom-wise tokenization,通过正则表达式把 SMILES 切成原子和化学符号。对于常见有机分子,这种方法通常可以工作;盲区主要出现在低频元素、同位素、电荷、显式氢和复杂立体信息形成的罕见组合。遇到词表没有收录的组合时,模型可能只得到一个 [UNK],训练不会报错,但原始化学信息已经丢失。例如 [Au](金)、[Ru](钌)、[U](铀)、[13CH3](同位素标记)、[C@H](手性中心)和 [NH3+](带电基团)。[S1]
OpenSMILES 规定,任何不属于“有机子集”(B、C、N、O、S、F、Cl、Br、I)的原子,或者显式带有同位素、手性、电荷、氢数和类别信息的原子,都需要写在方括号里。现有的原子级 tokenizer 常用一套经典正则表达式切分 SMILES,其中关键部分会把整个括号原子当成一个不可分割的 token。[S1]
问题在于:把同位素、手性、电荷、氢数和类别的排列组合计算在内,OpenSMILES 语法允许的括号原子组合理论上超过 28 万亿种,而现有化学专用 tokenizer 的词表通常只有几百到三千个 token。这个数字描述的是语法组合上限,不等于现实中存在 28 万亿种可用分子,但它足以说明封闭原子词表无法实现完备覆盖。[S1]
团队评估了 35 种 tokenizer,包括 20 种化学专用 tokenizer(Atom-wise、SPE/APE、BPE、Unigram 等)和 GPT-4o、LLaMA、Gemma 等通用 NLP tokenizer,并在 REALSpace、MoleculeNet 和 tmQM 三类数据上测量实际覆盖率与信息损失。[S1]
论文 Fig. 1:封闭的原子词表会把未收录的合法组合压成 [UNK];Smirk 把括号原子继续拆成 OpenSMILES 基础字形。图片来自论文。 [S1]
02|What Changed
把括号原子拆回 165 个可组合的化学字形
方括号里为什么会出现组合爆炸
针对这个问题,团队提出 Smirk:不再把括号原子当作一个整体,而是继续拆成 OpenSMILES 中有意义的基础字形。例如,[C@@H] 被拆成 [、C、@@、H、]。结果是一个 165-token 的基础词表,通过构造性方式覆盖所有有效 OpenSMILES 表达,无需从语料学习一份封闭的括号原子清单,也不会因为遇到合法但罕见的组合而输出 [UNK]。[S1]
[同位素][元素符号][手性][氢数][电荷][类别]需要划清边界:这里的“完整覆盖”是 OpenSMILES 语法覆盖,不是完整物理世界的覆盖。SMILES 本身仍不能充分表达构象集合、环境、分子间相互作用和动力学。[S1][S4]

论文 Fig. 2:fertility、imbalance、normalized entropy 与 [UNK] 频率揭示不同 tokenizer 和数据集之间的覆盖差异。Wadell et al., arXiv:2409.15370 (v3)。 [S2]
完整覆盖以后,怎样把序列重新压短
细粒度拆分会拉长序列,而 Transformer 的注意力成本随长度快速上升。Smirk-GPE 因而在化学字形的 token ID 上学习合并规则:常见组合可以被压缩,罕见组合仍能退回基础字形,不必重新引入 [UNK]。[S1]
Smirk-GPE 在约 2.62 亿个分子上训练。目标词表设为 5 万,但可用合并在约 2,300 个 token 时已经穷尽。这是完整性、序列效率与语义边界之间的工程折中。[S1]
MoleculeNet 为什么不容易暴露这个问题
常见类药小分子里的 @ / @@ 手性并不是所有 tokenizer 的普遍失败点。风险集中在罕见元素、同位素、电荷、显式氢和复杂几何叠加后的组合。MoleculeNet 以常规药物化学空间为主,因此整体 leaderboard 可能正常;tmQM 含更多过渡金属配合物,覆盖问题便迅速放大。[S1]
论文用 [UNK] 比例与 KL divergence 衡量静默损失,并从零预训练、微调了 18 个 RoBERTa-style encoder 做外在验证。n-gram 排名与下游结果的 Spearman 相关约为 0.667–0.8,适合作为低成本筛选器,却不能替代完整训练与任务评估。[S1]

论文 Fig. 3:tmQM 上的未知 token 会显著放大部分 tokenizer 的信息损失,而 Smirk 保持可回退的基础字形覆盖。Wadell et al., arXiv:2409.15370 (v3)。 [S2]
MIST 把 Smirk 扩展到 18 亿参数,但没有完成因果归因
后续 MIST 预印本使用 Smirk 训练 28M 与 1.8B 参数的 encoder,分别使用约 2.45 亿和 20 亿个分子,并在 400 多项结构—性质任务上通过微调评估。这说明 Smirk 可以进入更大规模的实际训练管线;在 tmQM 任务上,MIST-28M 到 MIST-1.8B 的验证集 R² 从 0.76 提升到 0.80。[S3]
MIST 同时改变了模型规模、训练数据、训练预算与微调设置,因此不能把所有性能提升归因于 tokenizer。它展示的是规模兼容性和可适配性;跨化学制度的结果来自任务微调,不是 zero-shot 泛化。[S3]
WHAT CHANGED
- AI4S 层级
- Representation(表征层)——把分子编码成模型能处理的对象,是模型读取科学对象之前的入口。
- 原有瓶颈
- 主流化学 tokenizer 长期依赖“原子级”封闭词表;它们在常见类药小分子上看似够用,却没有经过系统的边界覆盖审计。
- 这次改变
- 对 35 种 tokenizer 做横向审计,量化 [UNK] 造成的信息损失,并给出一个构造性覆盖有效 OpenSMILES 的 165-token 方案。
- 关键证据
- 语法覆盖是确定的;下游收益取决于数据的化学多样性。MIST 证明 Smirk 可用于 1.8B 规模。
- 仍未解决
- 是否会被原作者之外的团队采用、性能收益中有多少能归因于 tokenizer,仍未知。
03|关键数字
覆盖差距会随化学多样性迅速放大
方括号原子的理论语法组合,不是现实分子数[S1]
正式版评估的 tokenizer 总数 / 化学专用 tokenizer[S1]
SPE、APE 在 MoleculeNet / tmQM 上发出的 token 中 [UNK] 所占比例[S1]
MoLFormer 因未知 token 造成的信息损失,从 MoleculeNet 跳升到 tmQM(nats/molecule)[S1]
tmQM 中因增强立体化学而无法转换为实验所用 SELFIES 的分子比例[S1]
原始论文从零预训练并微调的 RoBERTa-style encoders[S1]
n-gram 排名与下游排名的 Spearman 相关[S1]
使用 Smirk 的 MIST 模型参数跨度[S3]
arXiv v3 的统计口径为 34 / 19;同行评审版本更新为 35 / 20。
04|为什么重要
模型上限先取决于输入允许它看见什么
这个覆盖盲区的危险之处在于它是静默的:模型不会报错,训练不会中断,整体指标也可能正常,但某些分子的关键信息已经被换成一个没有区分度的占位符。论文用 KL 散度量化这种损失,发现严重程度与数据集的化学多样性强相关——在以类药小分子为主的 MoleculeNet 上可能很小,在含大量过渡金属和复杂立体中心的 tmQM 上则会急剧放大。[S1]
更准确地说,常见手性并不是当前 tokenizer 的普遍灾难区。更值得警惕的是手性与其他罕见维度的组合:例如同位素标记的手性中心、过渡金属配合物的配位几何,或同时带有罕见元素、电荷与显式氢的括号原子。这些组合在普通药物基准里不多,却集中出现在放射性药物、金属催化剂以及部分电池与材料体系中——相对小众,但科学和产业价值很高。[S1]
论文举了顺铂的例子:相关几何异构体的药理性质不同;如果表示管线抹去用于区分配位几何的信息,模型就失去了临床上有意义的差别。类似风险也会出现在同位素标记的放射性药物、工业催化剂和电解质材料中。这些恰恰是分子基础模型正在进入的新制度,而不是它们最初依赖的类药小分子舒适区。[S1]
这也可以和站内的反应图解析文章放在一起看:MinerU.Chem 关注论文中的反应图在转成机器可读数据时丢了什么,Smirk 关注 SMILES 在进入 Transformer 时又丢了什么。两者位于知识管线的不同位置,却共享同一个判断——在讨论模型参数、推理能力和自治程度之前,先检查输入管线是否忠实保留了科学对象。AI 如何读懂整条化学反应路线?从“认出分子”到恢复反应关系 →
论文还指出了 benchmark 本身的局限:即便相对多样的 tmQM,也没有覆盖整个元素周期表、各种同位素、带电物种和四重键等罕见结构。如果研究方向正好落在这些 benchmark 盲区里,公开排行榜可能根本无法说明模型是否看得懂那部分化学空间。[S1]
05|证据状态与边界
语法完备、下游收益与物理完备是三件事
覆盖缺口的数学判断是确定的超过 28 万亿种理论语法组合不可能被几千个原子 token 穷举;Smirk 通过拆成有限基础字形实现有效 OpenSMILES 覆盖。这是构造与组合计数层面的结论。[S1]
公开 benchmark 测量扎实,但仍由提出方案的团队完成[UNK] 频率和 KL 散度是在 REALSpace、MoleculeNet、tmQM 等公开数据上计算,代码也已开放。这属于公开 benchmark 上可复查的计算验证,不等于第三方独立复现。[S1][S4]
18 个 Transformer 模型提供了必要的外在验证团队从零预训练 RoBERTa-style encoder,再在下游任务上微调,还用固定效应模型分析 tokenizer 效应。n-gram 模型与下游排名的相关性约为 0.667–0.8,说明它适合做低成本初筛,但不能替代完整的预训练和微调。[S1]
性能收益具有明显条件论文显示,Smirk 在 MoleculeNet 上大致与 Atom-wise 相当;更清楚的正面效应出现在 tmQM 这类化学更复杂的数据上。如果任务只覆盖常规类药小分子,这项改进未必会变成可见的 leaderboard 增益。[S1]
MIST 证明可扩展使用,没有隔离 tokenizer 贡献28M–1.8B 模型同时改变规模、数据、预算和微调设置。跨制度结果来自 fine-tuning,不能写成 zero-shot,也不能把全部性能提升归因于 Smirk。[S3]
同行评审提高来源可信度,不提高物理证据层级Smirk 仍是回顾性计算与公开 benchmark 证据,没有湿实验或物理闭环验证;MIST 目前仍是预印本。[S1][S3]
SELFIES 的对照提示了另一个边界tmQM 中 54% 的分子因增强立体化学无法转成实验所用的 SELFIES。生成字符串有效性、语法覆盖和物理信息完整性是三个不同问题,不能用“100% 鲁棒”或“100% 覆盖”一笔带过。[S1]
EVIDENCE IN CONTEXT
- 编辑状态
- 前沿
- 证据场景
- 回顾性计算验证
- 证据怎样产生
- 公开 benchmark · 预训练与下游微调
- 来源与可检查性
- 同行评审 · 公开代码 · 同团队后续预印本
- 证据上限
- 它证明了有效 OpenSMILES 可以用有限基础词表无损 tokenization,并展示同团队的大模型应用;尚未证明独立性能增益、第三方复现或对完整物理化学信息的覆盖。
06|还没有解决什么
完整覆盖 OpenSMILES 之后,仍有四个问题
独立复现仍然缺失。目前的覆盖审计、信息损失测量和大模型应用都由同一核心作者群完成,尚未看到原作者之外的团队系统复现。
Tokenizer 的独立贡献没有被隔离。MIST 同时改变了模型规模、训练数据、训练预算和微调设置,因此只能证明 Smirk 可以规模化使用,不能证明模型表现主要由 Smirk 带来。
现有 benchmark 仍然覆盖不足。tmQM 比 MoleculeNet 包含更多过渡金属和复杂立体中心,但仍未系统覆盖全部元素、同位素、带电物种和罕见键型。
OpenSMILES 完备不等于物理完备。Smirk 可以保留字符串中已经编码的信息,却不能补回 SMILES 没有表达的三维构象、环境、分子间相互作用和动力学。
资料来源
本文主要依据同行评审论文、对应 arXiv 版本、MIST 预印本和 Smirk 官方代码仓库。
- S1Tokenization for Molecular Foundation ModelsJournal of Chemical Information and Modeling 66(3) · 2026.01.23 · 同行评审论文
- S2Tokenization for Molecular Foundation Models(v3)arXiv:2409.15370 · 2025.07.08 · 预印本版本记录
- S3Foundation Models for Discovery and Exploration in Chemical Space(v2)arXiv:2510.18900 · 2026.05.01 · 预印本
- S4Smirk 官方代码仓库BattModels / GitHub · 2026 · 代码与实现
