Frontier question · Model systems
测量、提取或编码过程中的信息损失,是科学 AI 的硬上限,还是规模可以补上?
AI4S.fyi 综述 · 当前答案
更大的模型能缓解某些数据不足,却不能保证恢复输入中缺失的信息。
关键是分清:信息没有被测到、没有被完整提取、在编码时被合并,还是参考标签本身存在偏差。不同问题,需要不同的修复办法。
更新于 2026-09-10。模型规模、训练数据规模和推理覆盖规模分别判断;不以条目数量替代证据强度。
为什么重要
信息恢复与预测改善不是一回事。两个对象被编码成同一输入时,模型不能仅凭该输入可靠区分它们;其他上下文和相关特征仍可能改善概率预测。实验标签与计算标签也可能来自不同路径,下面四个角度不是所有任务都必须依次经过的严格流程。
INTERACT → MODEL 这一段的放大图 · 共 10 条
Interact
测量
2 条承重
1 条佐证
1 条佐证
记录与提取
2 条承重
0 条佐证
0 条佐证
编码
2 条承重
1 条佐证
1 条佐证
训练标签
2 条承重
0 条佐证
0 条佐证
Model
条数不等于分量。这四道闸门不是一套并行的新框架,而是本站学习环上从世界被测量到模型开始学习之间的一段放大图。
第一道 / 共四道 · 通向 MODEL
测量
那些一开始就没有被观测到的东西。
当前判断规模扩的是覆盖范围,不是保真度。 更多算力可以铺满更大的空间,但它把基座模型看不见的地方原样铺过去,而不是把它补上。
证据边界:中等 · 2 条承重证据
关键证据
AlphaGenome Atlas
它做了什么
把全基因组范围的变异效应预先算好,做成一张可查询的预测地图。
对本问题的意义
90 亿次预计算把覆盖范围铺满了,也把基座模型的盲区一起铺了过去——这是“推理的规模”和“保真度的规模”之间最直接的一次切分。
不能证明
绝大多数记录是预测;缺少系统级的独立复现与临床验证。
CuspAI —— 把实验室当成一台处理器
立场
Max Welling 主张的不是把现有信息源做大,而是接入一个新的信息源:把实验室看成“物理计算单元”,让自然替你完成那部分计算。他给出的瓶颈是——模拟的预测精度不足以替代测量。
对本问题的意义
目前最强的硬上限论证:如果答案是继续加规模,一家材料公司根本不需要盖实验室。
不能证明
这是证词,不是演示。该平台的吞吐量和命中率均未披露。
其他相关证据
1
- 2026.08Radical AI 访谈 ——“我们不是算力受限,是实验受限”证词上限
第二道 / 共四道 · 通向 MODEL
记录与提取
曾经被记录下来,但锁在论文、图表和扫描件里。
当前判断原则上可以补回来——这是唯一一道投入真的能把信息买回来的闸门。 信息还在,取出来是工程问题,而这个问题目前还没被解决。
证据边界:对“可逆”高,对“完整”低 · 2 条承重证据
关键证据
MinerU.Chem
它做了什么
把论文里的化学对象和反应关系还原成可追溯的数据。
对本问题的意义
这道闸门上的损失是可逆的,而这恰恰说明它是最不该被用来推广的一道。对整个问题的乐观判断,通常都来自只盯着这一道看。
不能证明
在没有人工校正的前提下,尚未达到文档级、可直接入库的准确度。
OCSR / MolRecBench
对本问题的意义
还原是真的,但远不免费:缩写、绘图习惯和复杂结构依然能把它打败。投入在这道闸门上买得回信息,但既不便宜也不完整。
不能证明
样本没有覆盖所有年代、专利、扫描质量和化学子领域。
第三道 / 共四道 · 通向 MODEL
编码
进入模型输入格式的这一程中,什么活了下来。
当前判断硬上限,除非修编码器。 规模帮不上忙,因为信息压根没有进入模型。所有已知的修复,修的都是表示法,没有一个是靠加规模。
证据边界:高 · 自本问题设立以来未变 · 2 条承重证据
关键证据
Smirk
它做了什么
保住了那些会被封闭词表压成占位符的罕见 OpenSMILES 组合。
对本问题的意义
本页最干净的一个案例。损失是静默的,训练不报错,而且再加多少分子也换不回一个已经被替换掉的手性标记——把 tokenizer 修好才行。
不能证明
没有普遍的下游收益;也补不回 SMILES 本身没有表达的物理信息。MIST 在 18 亿参数上用了它,但同时改变了规模、数据和预算,因此无法隔离 tokenizer 的独立贡献。
Radical AI ——「成分不等于材料」
对本问题的意义
一个成分字符串编码不了合成路线、微观结构和加工方式,而这些才决定一个合金好不好用。这是编码闸门在一个连 SMILES 都不存在的领域里的形态。
不能证明
来自一家其商业模式依赖于该判断成立的公司的证词。
其他相关证据
1
- 2026.02CuspAI 访谈 ——材料领域根本没有一套可供修复的规范字符串表示证词上限
第四道 / 共四道 · 通向 MODEL
训练标签
老师自己已经丢掉的那部分。
当前判断硬上限。扩规模给你的是更多的老师,不是更好的老师。 要顶破它只能换老师——更高精度的方法,或者直接用实验。
证据边界:机制上高,覆盖面上低 · 2026.09 新增 · 四道闸门里最新也最薄的一道
关键证据
原子间势与 DFT 天花板
对本问题的意义
机器学习原子间势学的是 DFT 算出的能量和力,所以精度天花板就是 DFT 的天花板,包括它在范德华作用、强关联体系、能带隙和反应能垒上的系统性失灵。对照 AlphaFold——它学的是实验测定的结构:两个成功案例站在相反的地基上。
规模为何无效
扩规模产出的是更多 DFT 数据,不是更好的 DFT。
不能证明
目前没有一个“用实验标签训练”的对照版本可供比较。
Lila Sciences —— sim2real 是那个瓶颈
对本问题的意义
被问到“如果只能拿掉一个瓶颈”时,Rafa Gómez-Bombarelli 选的是 sim2real:模拟不够有预测性,基于这些数据训练的模型也弥合不了差距,因为它们训练在不够好的近似上。他随后指出 AlphaFold 用实验数据训练,而材料领域没有对应物。
不能证明
这是证词,不是演示。
不同解释与限制
规模何时仍可能改善预测
跨领域迁移可以改善预测,但不等于恢复已经丢失的信息。现有公司报告同时改变了数据、训练与任务,不能单独归因于模型规模。
Lila Sciences ——「广度带来深度」
主张
跨越更多科学领域训练,可以降低任一具体领域所需的专有数据量,某些情况下接近于零。
不能证明
没有公开的跨领域受控 benchmark。内部支撑案例包括把小分子化学推理复用到金属有机框架上。
Radical AI —— MATRIX 迁移结果
主张
一个在实验室图像上训练的视觉语言模型,在部分通用科学推理 benchmark 上提升约 5%–16%,并能迁移到生物领域。
不能证明
结果依赖具体 benchmark,而且公司报告在数学推理上没有提升。
Max Welling —— 关于归纳偏置的让步
主张
归根到底这是数据和归纳偏置之间的取舍;架构应该始终按可扩展来建。
为什么相关
这说明物理先验与数据规模之间存在可检验的权衡,但没有声称规模会恢复已经丢失的信息。
边界
它谈的是补偿稀缺的数据,不是补偿被销毁的数据——所以它收窄了硬上限主张,但没有推翻它。
AI4S.fyi 综述 · 当前缺口
本页案例分别观察到几类损失,但没有逐项证明同一对象在测量、记录、提取、编码和参考标签中的全部变化。仍需端到端审计,并把参考方法、学习、采样和实验条件误差分开。
什么证据会改变当前判断?
- 全部闸门针对同一个科学对象、跨越四道闸门的端到端可逆性测试。
- 编码在其他条件固定时,隔离下游收益里有多少来自模型规模、多少来自修复输入表示。
- 训练标签用实验标签而非计算标签训练的原子间势,与 DFT 训练的对照版本做基准比较。
- 反方由非平台售卖方完成一份公开的跨领域受控 benchmark,检验“广度带来深度”。
延伸阅读
CuspAI CTO Max Welling 谈材料搜索、物理先验,以及为什么自动化要从专家工作流开始。
Lila Sciences 谈把实验当作训练信号,以及为什么 sim2real 是他们最想拿掉的瓶颈。
Radical AI 谈为什么成分不等于材料,以及为什么真正的约束是一次实验的价格。
