Frontier question · Choose
AI Scientist 靠智能取胜,还是靠一种新的实验经济学?
AI4S.fyi 综述 · 当前答案
AI Scientist 的收益可能同时来自更好的实验选择、更快的执行和更低的成本。
现有案例常把这些变化一起报告,因此还难判断各自贡献。比较时,应看相同预算下的结果,以及达到同一目标所需的总时间和成本。
置信度:对"吞吐确实提升了"高。对归因低,四个来源全都低。这不是一个证据相互矛盾的问题,而是一个证据被混淆的问题——后者是另一种、而且更容易修复的麻烦。
为什么重要
更好的选择可以降低成本,工程与运营能力也可以积累和迁移,两者不是互斥解释。实验受限也不意味着推理质量不重要;选择能力和执行效率可能互相放大。
四个优势来源,以及各自属于哪一侧 · 共 7 条
Decide
选择质量
选择能力 · 1 条关键
吞吐量
执行效率与成本 · 1 条关键
单位结果成本
执行效率与成本 · 2 条关键
人类回避的区域
选择能力 · 2 条关键
Interact
这个分解不是按方法拆的,是按混淆项拆的:要把两种解释分开,你必须逐个固定住的正是这四样东西。目前没有任何公开结果固定住了其中任何一个。
来源一 · 归于智能
同等预算下的选择质量
给同样多的机会,模型选的实验是不是比人选的更好。
当前判断只有一次前瞻性检验,在一个合金家族里。这是"智能"叙事赖以成立的主张,也是四个来源里被检验得最少的一个。
置信度:低 · 1 条关键证据
关键证据
HEA05
对本问题的意义
四轮自适应前瞻性地测试了八个新候选——本页唯一一条"选择"是被向前检验、而不是事后宣称的证据。
不能证明
没有用其他方式选择的对照组,没有跨家族或跨实验室复现,也没有在固定预算下与资深人类选择做过比较。
本来源的其他证据
1 条 · 趣闻性质
- 2026.08Radical AI 访谈 —— 人类科学家偶尔提交竞争配方并被模型否掉;这是作为故事讲的,不是作为测量证词智能
来源二 · 归于经济学
相同时间内,是否完成更多有效实验?
单位时间更多次尝试,是否本身就足以解释结果。
当前判断约 1,200 个/五至六个月相对约 500 个/十二个月,粗略折算约 4.8–5.8 倍,不支持“已实现十倍”。两项目的测试范围和深度未必一致,因此也不是严格效率对照。
置信度:对吞吐本身中高;它不为选择能力提供任何支持 · 1 条关键证据
关键证据
Radical AI —— 合金 campaign 吞吐
对本问题的意义
五到六个月做出并表征约 1,200 个合金,对照的行业参照——DARPA 与 GE Aerospace 的项目——是 12 个月约 500 个。当前吞吐 8–20 个/天,目标 100 个/天。
为什么这是关键
日产 100 个是目标,当时披露的实际范围是 8–20 个/天。吞吐提高可以增加探索机会,但不能单独证明选择质量更高。
不能证明
对照项目的实验深度是否可比;命中率在吞吐放大后是否保持。
来源三 · 归于经济学
达到同一目标的总成本是否更低?
不是单次实验成本,而是"改变了什么的那次实验"的成本。
当前判断单次实验成本有人公开,单位有效发现的成本没有任何一家公开。吞吐上升不等于单位结果成本下降:如果命中率随规模下滑,它可能反而上升。
置信度:低 · 2 条关键证据,均无外部核实
关键证据
Radical AI —— 单次实验成本
对本问题的意义
单次合金实验约 60–300 美元,取决于所用元素。这是经济学论证分母端少见的一个公开数字。
不能证明
访谈中的口头估算,未经审计;也没有说明这个数字在实验室向目标吞吐放大时如何变化。
Lila Sciences —— "零全职员工创业"的说法
主张
两三个人加上模型与平台,可以在六个月内完成五年的生物科技工作,成本约为十分之一。
对本问题的意义
目前任何地方对"优势是经济性而非认知性"最直白的一次陈述——而说这话的公司,自述的核心资产偏偏是模型。
不能证明
无外部核实,也未披露比较基线是怎么构造的。
来源四 · 归于智能
是否探索到了有价值的新区域?
不是在常规空间里选得更好,而是选到了常规空间之外。
当前判断选择能力手上最有意思的证据,而它全部来自公司内部。两家独立公司报告了同一种形状的结果,这有分量;但两家都没做固定预算对照,这限制了分量有多重。
置信度:对现象中等,对归因低 · 2 条关键证据
关键证据
Radical AI —— 元素家族叠图
对本问题的意义
把已发表文献探索过的元素组合,与系统探索过的叠在一起,可以看到模型进入了从未被发表过的元素家族。追问为什么当初回避,公司自己的科学家给出的理由——会挥发、铸不出来、微观结构撑不住——后来被证明是错的。这是一个不属于吞吐、而且具体可查的优势机制。
不能证明
图表是内部的、未发表。而且"回避某个区域"不等于"在期望意义上回避错了":成功的案例被报告了,那些家族里失败的案例没有。
Lila Sciences —— 非铂族电催化剂
对本问题的意义
一位在该方向发表过约 40 篇论文的专家,先觉得模型的建议平庸,后来觉得离谱;它们最终成为公司表现最好的非铂族催化剂。作为独立来源,它和 Radical 那条吻合到足以说明这是一个真实现象,而不是某一家的故事。
不能证明
单一案例、公司自述、没有分母——有多少同样"看起来离谱"的建议失败了,没有披露。
一条方法论注记。这里的缺陷和信息保真度那个问题被卡住的原因是同一个:MIST 在 18 亿参数上用了修好的 tokenizer,但同时改变了模型规模、训练数据和算力预算,所以隔离不出 tokenizer 的贡献。这里,每一个被报告的胜利都同时改变了选择、吞吐和成本,所以隔离不出智能与经济学。两个问题被同一个缺失的实践卡住——固定住一个变量。
不同解释与限制
"从头到尾都是经济学"这一侧的理由
下面三条里有两条来自正在运行这类系统的人,而且都指向"不是智能"那个解释。第三条指向相反方向,也是证据最弱的一条。
Joseph Krause —— 受限于实验,不是受限于算力
主张
"We're not compute constrained in the materials industry. We're experiment constrained."
为什么相关
来自一线运营者的直接陈述:真正的约束是物理信息的价格和速度,不是对它的推理质量。
Max Welling —— 自动化是高度依赖具体领域的
主张
把一个问题完全自动化,换到下一个基本要重来:实验装置不同、表征仪器不同,平台里的模型也要重新训练和微调。
为什么相关
如果这一条成立,就不存在可跨领域累积的智能可供取胜,只有每个垂直里各自重挣一次的经济学。这是反对"智能叙事"最锋利的论证,而且来自一个如果反过来成立会对自己公司更有利的人。
Lila Sciences —— "广度带来深度"
主张
跨越更多科学领域训练,可以降低任一具体领域所需的专有数据量,某些情况下接近于零——与上一条针锋相对。
不能证明
没有公开的跨领域受控 benchmark。内部支撑案例包括把小分子化学推理复用到金属有机框架上。
AI4S.fyi 综述 · 当前缺口
机制层面的可行性,比系统层面的归因被支撑得好得多。而按这个领域的标准,缺的那个实验并不贵:同一个实验室、同一个时间窗、同样数量的实验,用两种方式选。
什么会改变我们的判断
- 选择一次固定预算的正面对照:模型选 N 次 对 资深人类选 N 次,同一实验室、同一时间窗、结果盲评。
- 成本公开一条"单位有效发现成本随吞吐变化"的曲线,看命中率是否保持。
- 覆盖那张元素家族叠图(或等价物)由非该公司的第三方复现,并且包含那些区域里的失败案例。
- 反方任何一次"在一个垂直训练的模型无需重训即可迁移到另一个垂直"的演示,那会直接裁决 Welling 与 Lila 的分歧。
延伸阅读
Radical AI 谈吞吐、单次实验成本,以及为什么真正的约束是信息的价格。
CuspAI 的 Max Welling 谈为什么自动化不能在垂直领域之间迁移。
被同一个缺失的实践卡住:在其他变量移动时固定住一个。
