模型与数据发布· 科学证据 · Frontier

OpenBind-0:多四年的 PDB 数据,为什么没有让模型全面变强?

OpenBind-0 完整公开了模型、训练方法和新实验结构。真实药物发现项目显示,数据增加并不保证模型变强;新增结构是否落在模型陌生的区域,可能更重要。

更新于 10分钟阅读

官方模型与数据发布 + 公开基准评测

当前边界结果来自官方评测而非同行评审论文;模型在 FatA 和两个 RdRp 靶点上的表现仍然很低

这项工作推进的是用新增实验结构检验分子相互作用模型的数据盲区

  1. MODEL理解 / 预测
  2. DECIDE选择下一步
  3. INTERACT执行与测量
  4. UPDATE改变下一轮

01|发生了什么

2026 年 8 月 21 日,OpenBind 发布第一代分子结构预测模型 OpenBind-0(OB0)。它基于 OpenFold3,主要处理蛋白质与小分子的共折叠,训练数据覆盖 PDB 截至 2025 年 6 月的公开结构。[S1]

这次还公开了 717 个带配体的实验结构,来自 FatA、登革热病毒 RdRp 和寨卡病毒 RdRp 三个真实的 fragment-to-hit 项目。其中 547 个是片段结合结构,170 个是后续命中化合物的结合结构。[S1][S3]

为什么叫“0”OB0 的训练集故意没有加入 OpenBind 自己产生的结构。团队先用公开数据建立基线,等下一代模型加入这些实验结构后,就能直接比较新数据究竟带来了多少改善。[S1]

因此,这次发布同时提供了一个基线模型、一批新实验数据,以及以后衡量这些数据价值的比较起点。

02|What Changed

完整开放后,研究者可以重新训练和检查模型

OpenBind-0 使用 Apache 2.0 许可证,并公开训练数据、代码、模型权重和训练方法。使用者不仅能运行预测,也可以重新训练模型,或加入自己的内部数据继续实验。[S1][S2]

模型表现不只由网络结构决定。训练数据来自哪里、截止到哪一天、不同类型的数据怎样混合、使用哪个 checkpoint,都会影响结果。把这些环节一起公开,研究者才能检查模型为什么这样表现,也能重新训练和修改它。[S1][S2]

在标准蛋白质—配体基准上,OB0 与 AlphaFold3、Protenix 等模型表现接近。更有信息量的是后面的真实项目:同一个模型换到不同靶点,结果会从 90% 以上跌到个位数。[S1]

位置预测对了还不够,分子本身也要在化学上成立

共折叠模型可能把配体大致放到正确位置,但键长、键角或局部几何仍不合理。只看 RMSD,这类结构可能已经算预测正确;如果继续做自由能计算,或者据此修改分子,这些化学错误就会影响结果。[S1]

OpenBind 在扩散采样时加入 chemical steering,并用 PoseBusters 检查配体的化学合理性。同时满足位置正确和化学几何有效的比例,从 48% 提高到 61%。[S1]

这个改动没有换一套更大的网络,却补上了一个实际问题:位置大致正确,不等于生成结构已经适合后续计算。

OpenBind 官方图 2:chemical steering 前后,结构准确率和 PoseBusters 化学有效性的比较
OpenBind 官方图 2:chemical steering 前后,结构准确率和 PoseBusters 化学有效性的比较

OpenBind 官方博客 Fig. 2:chemical steering 对 pose accuracy 影响不大,但明显提高同时满足结构正确与化学有效的比例。图片来自 OpenBind 原文。 [S1]

多四年的 PDB 数据,为什么没有让模型全面变强?

OB0 的训练数据截止到 2025 年 6 月,OpenFold3-preview2 则截止到 2021 年。直觉上,多看近四年的 PDB 数据应该让各种测试都变简单。实际却是,在许多训练集相似度区间里,两者表现很接近。[S1]

团队进一步检查每个测试复合物与训练集中最近结构的距离。PDB 虽然增加了大量蛋白质—配体结构,但许多测试样本并没有因此获得更接近的参照。数据集变大了,这些靶点对模型来说仍然陌生。[S1]

明显提升主要出现在新增数据确实补到了相关结构的样本中。原本陌生的靶点有了更接近的训练参照,模型才变强。因此,数据价值不能只看新增多少条结构,还要看它填补了哪一块结构和化学空间。[S1]

OpenBind 官方图 5:当新 PDB 数据改变测试目标与训练集的相似度时,模型提升更明显
OpenBind 官方图 5:当新 PDB 数据改变测试目标与训练集的相似度时,模型提升更明显

OpenBind 官方博客 Fig. 5:横轴衡量 2025 年新增数据是否让目标更接近训练分布。新增结构确实补到相关空白时,模型收益更明显。图片来自 OpenBind 原文。 [S1]

三个真实项目,三种不同的失败方式

OpenBind 随后把模型放进真实的 fragment-to-hit 项目。在 EV-A71 2A protease 上,OB0 的 top-25 成功率达到 92.2%,top-1 为 73.8%。相关片段结构在训练截止日前已经进入 PDB,模型见过非常接近的结构。[S1]

换到 FatA,OB0 的 top-25 成功率降到 28.2%;表现最好的 Protenix 也只有 39.4%。模型通常能找到正确的结合口袋,也能给出较合理的蛋白构象,但经常摆不对配体。也就是说,它大致知道分子该去哪里,却不知道应该怎样放。[S1][S4]

OpenBind 官方图 7:FatA benchmark 中不同模型的 top-1 和 top-25 success,以及主要 failure mode
OpenBind 官方图 7:FatA benchmark 中不同模型的 top-1 和 top-25 success,以及主要 failure mode

OpenBind 官方博客 Fig. 7:FatA 上 pocket 往往能找到,主要困难落在 ligand pose;OB0 top-25 为 28.2%。图片来自 OpenBind 原文。 [S1]

到了 RdRp,模型常常连结合口袋都选错

在登革热与寨卡病毒的 RdRp 上,几乎所有模型一起失败。最好的 top-25 成功率分别只有 7.7% 和 6.7%。RdRp 很大,表面有多个口袋,主要结合位点附近又很灵活;这两个系统与训练集中的已知结构都很不相似。[S1][S5]

模型经常先选错口袋;即使找对,蛋白构象或配体位置也可能不正确。这三个项目虽然都叫蛋白质—配体预测,难点却不同:EV-A71 有较好的训练覆盖,FatA 主要摆不对配体,RdRp 则连口袋和蛋白构象都可能出错。[S1]

同一类模型从 90% 以上跌到个位数,比一个平均分更能说明它会在哪里失效。

OpenBind 官方图 8:Dengue 与 Zika RdRp benchmark 中各模型 top-25 success 都很低
OpenBind 官方图 8:Dengue 与 Zika RdRp benchmark 中各模型 top-25 success 都很低

OpenBind 官方博客 Fig. 8:DENV-2 与 ZIKV RdRp 上,所有模型 top-25 success 都不到 10%,并同时出现 pocket、protein conformation 与 ligand pose 错误。图片来自 OpenBind 原文。 [S1]

微调能不能补回来?取决于缺的是什么

团队又用特定靶点的片段结构微调模型。在 EV-A71 上,这些数据曾明显改善 OpenFold3-preview2;OB0 把相关结构加入预训练后,表现又超过微调版本。至少在这个靶点上,相关数据进入预训练可能更有效。[S1]

但这种改善没有普遍出现。FatA 只提高了一点,两个 RdRp 微调后仍然很差。这里不能得出“预训练一定优于微调”的结论;如果训练集缺少的是一整块相关结构,调整训练方法未必能替代新的实验数据。[S1]

03|关键数字

717

新公开的 ligand-bound experimental structures[S1][S3]

547 + 170

Fragment binding events + hit binding events[S1]

48% → 61%

Chemical steering 后,pose 正确且 chemical-valid 的 joint success[S1]

92.2%

EV-A71 2A benchmark 上的 top-25 success[S1]

28.2%

OB0 在 FatA 上的 top-25 success[S1]

7.7% / 6.7%

DENV-2 / ZIKV RdRp 中所有模型的最好 top-25 success[S1]

04|为什么重要

OB0 故意不使用 OpenBind 自己产生的数据,因此留下了一个清楚的比较起点。团队可以先看模型在哪些结构区域失败,再决定下一批实验应该补哪些结构;下一代模型加入这些数据后,也能直接测量改善来自哪里。[S1]

OpenBind 还表示,团队正在参考模型预测决定下一步做哪些实验。这与 SAPP/DMX 处理的是相邻问题:前者关心实验该补什么数据,后者关心实验怎样更快返回数据。[S1]

问题因此不再只是“怎样获得更多数据”,而是“下一项最值得做的实验是什么”。

WHAT CHANGED

AI4S 层级
分子结构预测 / 科学数据
原有瓶颈
与真实药物靶点相关的蛋白质—配体结构数据不足
这次改变
完整开放的基线模型、717 个新实验结构,以及真实 fragment-to-hit 项目评测
关键证据
多四年的 PDB 数据没有让模型全面变强;补到相关结构空白时才出现明显提升
仍未解决
怎样选择最有价值的新实验,并证明这些数据能稳定改善下一代模型

EVIDENCE IN CONTEXT

编辑状态
前沿
证据场景
湿实验验证
证据怎样产生
实体数据 · 回顾性评测
来源与可检查性
公开模型与数据 · 公司 / 联盟自述
证据上限
它证明了补到相关结构空间的数据与更好预测相关,但没有证明一套稳定选择数据并改善下一代模型的闭环。

05|证据状态与边界

证据形式OpenBind-0 目前是模型与数据发布,加上团队自己的基准评测,还不是完整的同行评审论文。本文使用的性能数字都来自 OpenBind 官方发布。[S1][S3]

92.2% 是什么92.2% 不是通用的“药物结合预测准确率”。每个结合事件会生成 25 个结构;top-25 成功指其中至少一个满足配体 RMSD ≤2 Å、LDDT-PLI ≥0.8,并通过 PoseBusters 检查。[S1]

适用范围EV-A71 是 92.2%,FatA 是 28.2%,两个 RdRp 的最好模型不到 8%。这些结果说明,表现会受到训练数据覆盖、靶点灵活性和具体失败方式的强烈影响,不能据此说共折叠问题已经普遍解决。[S1]

比较边界2021 与 2025 的比较并不是只改变训练数据截止日期的完全受控实验。OpenFold3-preview2 与 OB0 的网络结构相似,但并不完全相同,OpenBind 也明确提醒了这一点。[S1]

06|What I Learned

1|数据问题正在从“够不够多”转向“有没有补在正确的位置”多出的四年 PDB 数据没有让所有测试自动变简单。如果新增结构都落在模型已经熟悉的区域,对困难靶点的帮助可能很小。以后看一个 AI4S 数据集,除了规模,还应该问它增加了哪一块新的科学覆盖。

2|失败方式比平均分更有用EV-A71、FatA 和 RdRp 都属于蛋白质—配体预测,失败方式却完全不同:一个有较好的训练覆盖,一个主要摆不对配体,一个常常连结合口袋都选错。知道模型错了还不够,还要知道为什么错、下一笔实验预算应该花在哪里。

3|微调不能自动补上缺失的数据同一种微调方法,在不同靶点上可以从明显有效到几乎没有作用。如果训练集中缺的是一整块相关结构,几十个特定靶点样本未必能补回来,新的实验数据可能更重要。

4|完整开放后,才能研究数据怎样改变模型只开放权重,我们通常只能比较预测结果。训练数据、训练方法、代码和权重一起开放后,研究者才能继续追问:加入哪类数据最有价值?应该放进预训练还是微调?一种数据配比改善了什么,又损害了什么?

5|自动化科学最难的可能是决定下一次做什么实验主动学习不只是从 10,000 个候选中自动挑 100 个,还要判断这 100 个实验能否减少最重要的不确定性,或填补训练分布中的关键空白。若一个系统能持续回答“下一条最值得生成的数据是什么”,它的价值可能超过单个模型或单个数据集。

资料来源

文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。

  1. S1OpenBind-0:Advancing Open Molecular Structure PredictionOpenBind · 2026.08.21 · 官方模型、数据与 benchmark 发布
  2. S2OpenFold3 v0.5.0 / OpenBind-0 模型发布AQLaboratory / GitHub · 2026.08.21 · 代码与模型权重
  3. S3OpenBind-0 model release infoOpenBind Consortium / GitHub · 2026.08.21 · 评估脚本与数据说明
  4. S4FatA fragment-to-hit 数据Fragalysis / OpenBind · 2026.08.21 · 实验结构数据
  5. S5DENV-2 与 ZIKV RdRp fragment-to-hit 数据Fragalysis / OpenBind · 2026.08.21 · 实验结构数据