Frontier question · Test
AI 能不能从"提出候选"走到"在物理世界里闭环学习"?
AI4S.fyi 综述 · 当前答案
一些系统已经能把候选生成、实验和下一轮选择接起来。更难判断的是:实验反馈究竟改善了多少决策,这种收益能否持续、能否复现。
我们需要分别检查测量质量、目标指标、反馈更新和多轮表现,而不只看流程图是否闭合。有人参与的流程仍可以形成学习闭环;闭环学习不等于完全无人化。
更新于 2026-09-10。 公司架构自述、同行评审实验和独立验证是不同层级的证据;条目数量不代表结论强度。
为什么重要
一次测量不会自动成为学习信号。噪声、仪器漂移、批次效应、未完成的实验运行、以及用起来方便的代理指标,都可能教给模型错误的东西——而一个在架构图上看起来闭合的环,中间某处可能仍然站着一个在读报告的人。"我们的实验室是一个闭环"这句话其实是四个主张,而它们的证据通常非常不均衡。
INTERACT → UPDATE → MODEL 这一段的放大图 · 共 7 条
Interact
测得准
1 条关键
1 条佐证
1 条佐证
测的是对的东西
2 条关键
0 条佐证
0 条佐证
结果是否改变模型或实验选择
2 条关键
1 条佐证
1 条佐证
下一轮变好
1 条关键
0 条佐证
0 条佐证
Model
条数不等于分量。这四道关卡放大的是本站学习环的回程——把一次观测送回模型的那一段。信息保真度那个问题覆盖的是去程。
第一关 / 共四关
测量是否可靠?
噪声、仪器漂移、批次效应、未完成的实验运行。
当前判断标准化流程可以改善特定任务的吞吐量与可比性,但不能据此推断所有仪器、材料和实验室的重复性问题已经解决。
置信度:高 · 1 条关键证据
关键证据
SAPP / DMX
它做了什么
把并行的蛋白质生产与表征流程标准化。
对本问题的意义
批量生产加 SEC 表征在约 48 小时内完成,输出标准化——说明计量这一关是一个有已知解法形状的工程问题。
不能证明
它没有展示反馈自动改进下一轮设计;过了这一关,对后面三关什么也没说。
本关的其他证据
1 条 · 佐证
- 2026.08Radical AI 访谈 —— 冶金学 PhD 标注 SEM 图像,以捕捉公司所称的"科学直觉"证词已过
第二关 / 共四关
指标是否对应研究目标?
被优化的那个量,是不是真正重要的那个量。
当前判断四关里最薄的一关,几乎没人在研究它。一个只覆盖局部指标的奖励,可以在不解决真实目标的情况下被优化掉,而且这种失败从环内部是看不见的。
置信度:低——证据不是负面的,是缺席的 · 2 条关键证据
关键证据
Lila Sciences —— 物理验证器上的 reward hacking
对本问题的意义
一个电催化剂可以在短时测量里表现优异,随后迅速腐蚀。如果奖励只覆盖局部指标,模型就会在不解决真实目标的前提下把它优化掉。这是这个失效模式最清楚的一次公开陈述——而且出自正在建这套系统的团队,不是批评者。
不能证明
这是证词,不是研究。没有任何公开工作量化过它发生的频率,或者它该怎么被检测出来。
Moderna V940
对本问题的意义
三期顶线结果支持整套治疗系统在单一适应症上的临床获益——终点毫无疑问是对的。但算法的独立贡献未知,这把两件常被混为一谈的事分开了:测的是对的东西,和能不能归因。
不能证明
可归因于算法选择的效应量,以及总生存数据,均未披露。
第三关 / 共四关
结果是否改变模型或实验选择?
环是在软件里闭合的,还是靠一个人读报告闭合的。
当前判断架构被描述过,从未被独立验证过。几家公开了架构,但没有一家公开奖励质量、校准或跨实验室可靠性。
置信度:对"存在"中等,对"质量"低 · 2 条关键证据
关键证据
Lila Sciences
它做了什么
把实验室当成可验证的奖励环境;实验室仪器以工具调用的形式出现在模型的思维链里。
对本问题的意义
目前公开的、针对这一关最明确的架构,也是唯一把这个环定义为训练机制而不是工作流的一家。
不能证明
奖励质量、校准、跨实验室可靠性和独立性能数据全部缺失。
Radical AI —— campaign 式主动学习
对本问题的意义
7 到 10 个 campaign 并行,结果每天或隔天刷新,负结果也可进入后续选择。批量更新说明反馈路径存在,但本身不证明延迟提高了信号质量。
不能证明
合成环节仍需人的判断;没有对这个环实际运行状况的独立审计。
本关的其他证据
1 条 · 佐证
- 2026.02CuspAI 访谈 —— agent 负责编排计算与实验,自述"处于不同的成熟阶段"证词已过
第四关 / 共四关
更新后的策略是否带来可重复的收益?
那次反馈,有没有可验证地让后面的决策变好。
当前判断这是目前最需要验证的一步。本页案例尚未提供观测、策略改变与多轮收益之间的完整对照;评估应比较样本效率、决策质量和累计收益,而不是要求每轮单调变好。
置信度:低 · 1 条关键证据 · 这是本页的核心发现
关键证据
HEA05
它做了什么
四轮自适应选择并制造新合金,八个新候选被前瞻性地测试。
对本问题的意义
目前公开发表的、最接近"闭环且有逐轮效果"的一个案例。四轮足以说明机制能跑起来;但不足以说明它会累积。
不能证明
只在一个合金家族内。无跨家族、跨实验室或高通量复现,也没有用其他方式选择的对照组。
不同解释与限制
人类在闭环中承担什么角色
之所以要记,是因为只有单边证据的追踪问题实际上是一项主张。下面两条挑战"闭环是否可行",第三条挑战的是"完全闭环是不是正确的目标"。
Max Welling —— 反对"关灯实验室"
主张
完全自动化的实验室——把门关上,说一句"去找点有意思的东西"——明确不是他的愿景,而且很长时间内都不会是。他预计真正的突破会在大量人在回路的状态下发生。
为什么相关
这不是在说闭环很难,而是在说用闭环程度衡量进展这个框架本身不对。如果他是对的,上面第四关应该改问"这个环有没有让专家变快",而不是"它有没有把专家拿掉"。
Lila Sciences —— 假阳性两头都说得通
主张
一个假阳性对实验人员是打击,但对模型是好事,因为它降低了不确定性。
为什么相关
这意味着人对"这一轮做砸了"的直觉,并不能可靠反映这个环有没有学到东西。第四关的任何评估都必须在模型侧做,不能在士气侧做。
AI4S.fyi 综述 · 当前缺口
我们能比以前更快、更可比地产出测量,却很少能证明这些测量可靠地改进了下一个决策。没有一家公开系统给出过反事实。
什么会改变我们的判断
- 第二关在同一批样品上,对代理指标与真实终点做一次预注册的对照,并报告两者分歧的频率。
- 第三关跨批次、跨仪器的误差与校准报告;失败实验与人工介入日志。
- 第四关一条可追溯的完整链条——观测、决策改变、下一轮改进——并配一个用其他方式选择的对照组。
- 反方一次证明"把人留在决策位上的环"优于"把人拿掉的环"的结果,那会重构这个问题而不是回答它。
延伸阅读
Lila Sciences 谈把实验当作训练信号,以及当物理奖励可以被钻空子时会发生什么。
配套问题。那一页覆盖从世界到模型的去程,这一页覆盖回程。
