返回研究地图EN
来源笔记 · 访谈

真正的材料发现,要穿过制造与认证

从自驱实验室的分层架构、主动学习闭环,一路谈到制造与合格认证这道最难跨过的最后一关

证据构成Latent Space 官方节目页 + 完整 YouTube 访谈逐字稿交叉核对

更新于2026-09-1024 分钟阅读

Latent Space · 1:16:49

本集摘要

Joseph Krause 在这期访谈里反复回到同一个论点:材料发现真正的约束不是算力,而是物理实验本身——“We're not compute constrained in the materials industry. We're experiment constrained.”合金的组合空间理论上有 10^40 种,但决定一个材料能不能用的,从来不只是成分,还有合成路线、微观结构和制造方式,这些都没法写进一个像 SMILES 那样的字符串里。

Radical 把 AI Scientist 做成一个多智能体系统,用主动学习按 campaign 把发现—合成—表征—早期测试接成闭环。但这条闭环的边界很清楚:制造放大和资格认证还没有被接入。Krause 自己给“真正的发现”设了一个很高的门槛——材料要真正出现在消费者产品里才算数。按这个标准,公司目前展示的一切都还停留在这条线之前。

采访整理

01

材料版的“信息瓶颈”:为什么小分子能用一串字符表示,合金不行

Krause 从一个对比讲起:生物和小分子领域可以用 SMILES、SELFIES 这样的字符串表示分子,因为知道元素和化学键,基本就知道了需要知道的大部分信息。但合金不是这样——供应链成本、微观结构、加工方式是增材制造还是铸造,这些都决定性能,却没法编码进一个字符串。

这也是为什么,按 Krause 的说法,“没有一个模型能一次性生成一个最终会出现在 iPhone 或 Starship 里的新材料”。模型提出的成分只是起点,材料身份还包括它如何被制备、加工和放大。

02

从成分到产品:每往前一步,都会暴露新问题

Radical 内部把材料的生命周期分成几段:假设生成(AI 提出新成分)→ 合成(把原料熔炼铸造成合金)→ 表征(SEM、EDS、XRD、XRF、TGA 等工具分析微观结构)→ 早期性能测试(氧化性能、拉伸测试、微压痕硬度)。目前 Radical 只做到了发现和测试阶段,还没有触及制造。

Krause 举了一个具体的已完成案例:铪是 C103 这类常见航空航天合金的组分,约占重量 10%。由于供应链高度集中,其价格在过去几年上涨了 10–15 倍。Radical 称已经在不使用铪的情况下维持同等性能规格——这是访谈里少数几个“已经做完”而不是“正在做”的具体成果,但配方细节与独立性能对比尚未公开。

Krause 对“真正的发现”定义很严格:设计出新成分、合成出来、完成表征都是里程碑,但都不算最终发现。“我们把‘发现’算作你拿起手机、里面装着一种新材料的那一刻。”按这个标准,公司展示的 1,200 个合金和 300 个新配方,没有一个跨过这条线。

03

“自动化实验室”和“自驱实验室”不是一回事

Krause 用 Waymo 做比喻:自动化实验室像带辅助驾驶的车,人仍要发出转弯指令;自驱实验室接收一个目的地,中间怎么走不用人逐步规定。落到实验室里,系统要能自己设计、执行、记录,并根据失败结果决定下一批实验,而不只是把既定流程做得更快。

自驱实验室由机器人执行、软件编排和工程机械系统三部分组成。高温合金样品——业内称为 button——铸造时会以 3000–4000°C 的高温粘在托盘上,团队必须为机械臂设计定制执行器,在不损伤微观结构的情况下把样品取下来。这类问题和“发现新合金”无关,却是运行自驱实验室绕不开的工程工作。

04

主动学习按 campaign 运转,AI 敢闯人类因偏见回避的区域

系统目前约有 7–10 个 campaign 同时运行,结果每天或隔天更新一次,反馈还不包括制造数据。今天所有成分假设都由 AI Scientist 生成;人类科学家偶尔提交自己的配方,却常被 AI 判定“不够强”而拒绝,Krause 把这戏称为“红队测试”。

一张内部图把文献里人类探索过的高熵合金组合,与 AI Scientist 实际探索的组合叠在一起。AI 进入了此前没有发表记录的区域。科学家此前没试过,是因为预设某些元素不兼容、会挥发或形成不了稳定微观结构。AI 没有这些心理预设,又能并行处理信息,因此更容易尝试被人类直觉提前排除的区域。

05

吞吐、成本与信息密度:为什么不需要百万级数据集

过去五到六个月,Radical 称制造并表征了约 1,200 个合金,其中约 300 个此前未见于文献,约 10 个进入下一步评估。作为访谈中的行业参照,DARPA 与 GE Aerospace 的 MACH 项目目标是在 12 个月内制造 500 个新合金;两者的测试深度是否可比仍不清楚。

理论合金组合空间约为 10^40,Krause 估算即使穷举也要约 700 万年。每个合金大约产生 50–150 个数据点。按机器学习标准仍是小数据集,但 AI 可以同时读 10 万篇文献、看 10 万张 SEM 图像并直接对照;Krause 认为这种“并行密度”比样本表的绝对行数更重要。

单次合金实验成本约为 60–300 美元,取决于元素成本。当前吞吐量为每天 8–20 个,耐熔合金更难铸造,速度更低;目标是在 2026 年年中前后做到不分体系每天 100 个。后一个数字是目标,不是已经稳定实现的结果。

06

材料版 AlphaFold 为什么不存在

Krause 认可 Heather Kulik 的判断:材料领域没有 AlphaFold。在具体子任务上可以有“AlphaFold 时刻”,例如用分割模型分析 SEM 图像中的裂纹与缺陷;但没有一个模型能把“我有一个新假设”直接带到“它已经规模化并进入产品”。

Radical 把长期数据资产类比为“材料版 Protein Data Bank”,但这比蛋白质数据库困难得多。除了属性种类更多,还有一类知识几乎无法进入数据库:一位在 3M 工作 35 年的顾问把它描述为“知道在具体哪个时刻把哪个旋钮调到什么位置”的经验判断。即使写成公式,也未必每次都适用。Radical 坦承目前还没有这部分知识的通用解法。

07

护城河是把一切拼起来的苦活,制造与认证仍是最后一环

Krause 讲了几个具体的“血泪史”。两年前,一些仪器厂商甚至不愿意在付费的情况下开放软件接口,因为它们靠出售分析自家仪器数据的软件获利;这种态度现在有所松动。团队还发现跨学科分工比预想得更细:机械工程师和机电工程师必须成为不同岗位,机器人团队对路径规划与感知的需求也更依赖计算机视觉,因为科学家的许多判断本身就是“看图凭直觉”。

Krause 现在把这些工程琐事视为公司的护城河:不是“在工具前面摆一个机器人”就能复制。制造与资格认证仍未打通,公司依赖拥有规模化制造经验的产业伙伴。即使这些伙伴对 AI 抱有怀疑,他们对供应链、成本与极端环境性能取舍的判断仍然重要。

在国家竞争层面,Krause 认为中国可以用更统一的资本与行政力量打通发现和制造,但明确表示美国不应照搬。他提出让一名科学家同时管理多个 campaign、扩大公私投资,并把国家实验室的计算、人才与数据和私营企业的系统整合能力接起来。这个构想仍是战略主张,而不是已经验证的生产率结果。

08

技术栈:多智能体系统,以及为什么“模型不是护城河”

AI Scientist 是一套多智能体系统。顶层编排 agent 生成新假设,并在送入实验室前先做一轮内部可行性检验;系统会像人类科学家一样接入 CALPHAD 等付费行业数据库;自建的文献综述 agent 则从科学文献中抽取与当前假设相关的图表和信息,其 benchmark 已公开。

MATRIX 是在 Qwen 基础上微调的视觉语言模型,用于从 SEM 等实验图像中提取科学知识;模型、benchmark 与预印本均已公开。团队报告,它在部分通用科学推理 benchmark 上提升约 5%–16%,并能迁移到生物领域;但数学推理没有观察到同样提升。这个反例说明“实验图像训练改善通用科学推理”的范围仍需界定。

Radical 开源 TorchSim、MATRIX 和 LitXBench。Krause 的逻辑是:社区反馈能改进工具,开放有助于推动用实验验证科学,而且模型会越来越商品化。公司不计划开发专有基础大模型,而会使用现成的 ChatGPT 或 Claude;真正保留的是叠加在公开数据之上的专有实验数据。用他的话说:“Models aren't the moat. Experiments are.”

关键数字

约 1,200

过去五到六个月内制造并表征的合金

公司自述;本次访谈可核实
300

其中此前未见于文献的新配方

公司自述;本次访谈可核实
约 10

表现足够好、进入下一步评估的配方

公司自述;本次访谈可核实
500 / 12 个月

DARPA–GE Aerospace MACH 项目的访谈对照吞吐

Latent Space 官方摘要可核实;测试深度是否可比未知
8–20 / 天 → 100 / 天

当前吞吐 → 2026 年年中前后的目标吞吐

当前数字为公司自述;100 / 天是目标
$60–$300

单次合金实验估算成本

访谈现场估算,未正式审计
10^40

理论合金组合空间上限

访谈说法;理论空间不是实际产量
50–150

单个合金可获得的数据点数量级

访谈估算
5%–16%

MATRIX 训练后在部分通用科学推理 benchmark 上的提升

公司预印本自述;数学推理未观察到提升
10–15×

铪因供应链集中而出现的访谈价格涨幅

访谈中的行业背景数字

重点原话

We're not compute constrained in the materials industry. We're experiment constrained.

Joseph Krause算力不是瓶颈,物理实验的速度和成本才是。

The ground truth is the material itself.

Joseph Krause模型输出必须回到真实样品接受检验。

There is no one model that can one-shot a new material.

Joseph KrauseAI Scientist 是覆盖假设、合成与表征的系统。

Models aren't the moat. Experiments are.

Joseph Krause开源模型、保留实验数据的战略逻辑。

The AI Scientist is really a multi-agentic approach.

Joseph KrauseAI Scientist 是多个 agent 与工具协同工作的系统。

In five years most models will be open source.

Joseph KrauseKrause 对模型商品化时间尺度的判断。

It's not about a robot in front of a tool.

Joseph Krause难点在软件编排、机械工程与跨学科运营。

主张与证据

把已经展示的系统、公司自述、未来目标和编辑理解分开阅读。

01

发现—合成—表征—早期测试的 campaign loop 已运行,约 7–10 个 campaign 同时进行。

公司自述;缺少独立运营审计。

公司自述
02

五到六个月内生产并表征约 1,200 个合金,约 300 个此前未见于文献。

候选表和同条件对照未公开;MACH 的 500 / 12 个月仅作行业参照,测试深度是否可比未知。

公司自述
03

当前吞吐为每天 8–20 个,目标在 2026 年年中前后达到每天 100 个。

当前数字为访谈自述;目标与当前运行状态之间没有公开进度。

目标 / 展望
04

已在合金中去除铪,同时维持性能指标。

具体成功案例;配方细节和独立性能对比未公开。

公司自述
05

MATRIX 训练后在部分通用科学推理 benchmark 上提升约 5%–16%,可迁移到生物领域,但数学推理未观察到提升。

已发预印本,方法和部分数据可检查;幅度依赖 benchmark。

公司自述
06

TorchSim 已独立为非营利组织,由社区继续维护。

治理与公开贡献记录可以核查。

公开技术产物
07

制造与资格认证尚未被接入发现闭环。

公司在采访中明确承认这一进度边界。

编辑理解

编辑笔记

01

Krause 给“真正的发现”设了一个很高的门槛

只有材料真正出现在消费者产品里才算数。按这个标准,Radical 展示的 1,200 个合金和 300 个新配方,一个都还没有跨过制造这道线。这个自我设限的定义,让整场采访的进展叙述听起来更克制。

02

“自驱实验室”目前是分环节实现的,不是全链条自主

合成仍需要冶金学家凭经验判断熔炼与浇铸状态;采访中的计划是到年中继续推进自动化。表征和部分测试的自动化,不应被读成从原料到制造的全链条自主。

03

先把一种材料体系做深,与追求跨领域广度形成对照

Radical 起初想同时覆盖多种材料体系,但客户追问能否放大到 300 磅后,公司转向先把合金这一体系的全链条做深。这与 Lila Sciences 押注跨领域广度和迁移的路线构成了一组值得追踪的对照。

04

护城河是拼起这一堆脏活,而不是模型本身

逆向控制没有接口的仪器软件、为粘在托盘上的高温合金定制机械爪、拆分机械与机电工程岗位——这些琐事难以复制。它们和“模型不是护城河”是同一个逻辑的两面:真正稀缺的是把物理系统长期可靠地运行起来。

待追踪问题

  1. 01

    8–20 个/天走向 100 个/天时,吞吐提升是否会伴随命中率下降?这决定了“材料版数据中心”是否真的可扩展。

  2. 02

    合成环节的自动化能否如期完成?这是自驱实验室从分环节自主走向全链条自主的关键一步。

  3. 03

    制造与资格认证何时能纳入同一个数据闭环?Krause 承认这部分尚未开始解决。

  4. 04

    去铪配方的具体性能数据和独立验证何时公开?这是访谈中少数明确声称已经完成的案例。

  5. 05

    MATRIX 在数学推理上没有观察到提升,这个反例的边界在哪里?

  6. 06

    “一个博士同时管理 10 个 campaign,生产率提升一个数量级”的说法能否得到更广泛验证?

资料来源

  1. S1Latent Space 官方文章与录音PRIMARY SOURCE
  2. S2原始 YouTube 访谈PRIMARY SOURCE

延伸阅读

Radical AI 公司档案与证据时间线COMPANYAI4S Learning LibraryLIBRARY

分类问答附录

信源本身采用逐题问答形式。这里保留完整索引供查阅,核心论证不在此重复展开。

A · 核心主张

01Radical AI 为什么不同?

Krause 把实验数据而非生成模型视为核心:材料必须被制造、测试和表征,物理样品才是最终 ground truth。

这定义了公司的核心 thesis,但仍是创始人对差异化的表述。
02为什么不能先让 AI 想出大构想,再晚些验证?

对结构材料,成分只是起点;合成、微观结构、加工、制造和认证都会改变最终性能。

页面应追踪 composition 之后的链条,而不只追踪候选生成。
03如何从一次发现跨到百万级商业生产?

需要记录材料整个生命周期的数据。Radical 目前公开边界到发现、合成、表征和早期性能测试;制造是后续扩展。

这是最清楚的 current boundary。
04Radical 今天实际走到了哪里?

公开摘要称六个月生产并表征约 1,200 个合金、约 300 个新材料、约 10 个被公司认为尤其有前景;制造尚未接入闭环。

运行数字来自公司采访,不等同于独立验证。
05是在优化已知组合,还是推进科学前沿?

公司称其进入过去文献未覆盖的元素和合金族,并希望最终实现材料与产品的 concurrent engineering。

新成分不等于新且有用的性能。
06哪些下游瓶颈仍会杀死一个好材料?

跨批次制造、标准化测试和资格认证可能耗时多年;下游失败需要回流到发现阶段。

qualification 必须作为独立阶段显示。
07资格认证能否被“Operation Warp Speed”式加速?

Krause 不主张降低安全门槛,而是用自主制造、传感器和更完整的过程数据重构达到门槛的路径。

这是方向性主张,尚未给出完成认证的案例。
08材料 AI 为什么不同于生物或小分子 AI?

工业材料没有像 SMILES 那样的紧凑表征;成分、微观结构、工艺、供应链、成本和可制造性共同定义材料。

这解释了 Radical 的 beyond-composition 数据模型。

B · 什么才算自动驾驶实验室

09闭环有多迭代?人在哪里?

人类专家仍标注 SEM 等实验数据并传递科学直觉;仪器软件、API 和数据访问也会限制自动化。

human-in-loop 是当前系统组成,而不是例外。
10自动化实验室和自动驾驶实验室有何区别?

自动化实验室执行人类预先定义的流程;SDL 由 AI Scientist 设计 campaign、调用实验、读取结果并决定下一轮。

自主性要在 campaign 决策层判断,不能只看机械臂。
11自主实验室最难的工程问题是什么?

既有高温样品与不规则材料的物理搬运,也有仪器控制、路径规划、感知、故障恢复和跨学科系统集成。

物理 edge cases 是基础设施护城河的一部分。
12会扩展到聚合物、陶瓷和所有材料吗?

公司最初设想多个材料系统实验室,但客户沟通暴露了 scale-up 深度;现阶段先垂直整合合金,再考虑扩展。

跨材料通用性仍是未来路线。
13新材料可能解锁哪些行业?

Krause 重点谈到航空航天、国防和半导体互连材料,并描述潜在效率提升。

行业影响是 outlook,不是已展示的客户结果。
14新材料进入 iPhone、GPU 或航空系统要多久?

半导体集成仍很慢;Krause 认为国防与航天场景也许有 3–5 年路径,但载人航空认证会更严格。

3–5 年是预测,不是承诺或已实现周期。

C · 主动学习闭环

15主动学习中的错误不会不断放大吗?

Radical 把失败作为负结果;系统按 campaign 而非单个实验更新,混合自动分析和人工复核后再设计下一批。

负结果有价值,但需要完整记录与稳健的实验 QC。
16人类科学家仍做什么?哪些已自动化?

表征、氧化和微压痕等环节自动化程度较高;合成与拉伸测试仍存在人工参与或接近自动化的状态。

应按环节记录自动化,不能用一个总百分比。
17AI 能探索哪些人类不会进入的空间?

公司称 AI 会进入文献外的元素族,并挑战人类对铸造、蒸发、微观结构或机械性能的先验偏见。

是否产生更优材料仍需由性能证据回答。
18AI 真更有创造力,还是失败只是更便宜?

采访给出的更稳健解释是实验经济学改变了:高吞吐让系统可以在低置信度区域获得更多 shots on goal。

不要把探索宽度直接写成机器创造力。
19单个合金实验成本多少?

采访转录给出约 60–300 美元,具体高度依赖元素,难熔或贵金属会更贵。

这是未经审计的采访数字,适合保留在来源页而非首页。
20实验室每天能合成多少合金?

采访描述当前约 8–20 个/天、并行运行 7–10 个 campaign;100 个/天是未来目标。

必须把 current throughput 与 target 分开。
21除了多做实验,AI 还能做人类做不到的什么?

Krause 强调跨文献、SEM 图像、假设和性能结果的并行比较,而人类研究往往是串行的。

这是计算与记忆容量主张,尚需命中率和决策质量指标。

D · 数据规模与真实瓶颈

22材料吞吐量相对生物是否太小?

公司建议与材料领域自身基线比较:公开摘要把 1,200 个/六个月与 DARPA/GE MACH 的约 500 个/年对比。

接近 10× 是跨项目比较,不是同条件 benchmark。
23发现是否需要数百万数据点?

Radical 认为在巨大设计空间中,关键是选择高信息量实验;每个合金还产生多模态测量,因此小而新颖的数据也可能有价值。

需要用样本效率和外部复现验证。
24Radical 想建立什么数据库?

愿景类似材料版 Protein Data Bank,但必须同时包含成分、合成、工艺、微观结构、性能、制造和应用语境。

这是数据基础设施愿景,当前覆盖范围仍有限。
25材料领域有“AlphaFold”吗?

Krause 认为没有一个模型能解决全链条;显微图像分析等窄任务可能出现 AlphaFold moment,但不等于解决制造与认证。

应避免把单点 benchmark 推断为端到端发现。
26什么才算真正的材料发现?

Krause 的高门槛定义是材料最终进入真实产品或系统;设计、合成和表征只是中间里程碑。

这个定义能约束网站不把候选生成写成部署。

E · 制造知识如何回到上游

27制造失败如何反向翻译回发现?

制造包含大量资深工程师的隐性知识。Radical 称已在铸造、SEM、XRD 等发现环节开始捕获直觉,但明确尚未解决制造知识闭环。

这是核心未解决边界。
28尚未解决制造,短期如何推进?

路径是与已有规模制造能力和几十年工艺经验的机构合作,由伙伴提供成本、供应链、工艺和环境约束。

伙伴关系能补能力,但是否能形成可复制闭环仍未知。

F · 护城河与时机

29实验室有哪些 war stories?

仪器无法编程控制、供应商接口封闭、机械路径与感知失败都需要工程绕行;团队横跨材料、机械、机电、软件、ML 与机器人。

这支持基础设施很难,但不直接证明科学输出更优。
30为什么是现在?

Krause 归因于基础模型和专业 ML 的提升、机器人与传感器成本下降,以及资本和产业对 SDL 的接受度改变。

这是市场时机解释。
31SDL 广泛采用还缺什么?

还需要一个无可争议的结果:客户原本要多年解决的问题,被 SDL 显著更快解决。Krause 预计未来 2–3 年可能出现拐点。

2–3 年是 CEO 展望;真正的 next proof 是客户结果。
32美国应如何与中国竞争材料与 AI4S?

Krause 主张结合国家实验室、超算、公共基础设施和私营 SDL,提高单个研究者的研究吞吐,而非复制中国的组织模式。

这是政策观点,不属于技术验证。
33如果只能移除一个 AI4S 瓶颈,会是什么?

根本问题是物理反馈慢;可工程化问题是科学工具为人而非 agent 或机器人设计。并行实验和机器可调用接口是两条路径。

这也适合作为跨公司的比较维度。

G · 团队与 AI Scientist 技术栈

34对 ML 工程师和科学家的建议是什么?

不要把自己训练成另一个学科的半吊子;ML 工程师保持 ML 深度,材料科学家学会使用 AI 工具,通过真正跨学科协作解决问题。

这是团队设计观点。
35Radical 的 AI 技术栈是什么?

AI Scientist 被描述为多智能体系统,连接文献 agent、CALPHAD 与领域数据、模拟/MLIP、历史实验、专业 ML、人类直觉和 SDL。

这是系统架构说明,不是一个可单独评分的模型。
36MATRIX 是什么?实验 grounding 为什么重要?

MATRIX/MATRIX-PT 用 SEM、XRD、EDS、TGA 等真实实验模态训练和评测科学推理,并已公开数据、模型与预印本。

这是可检查的公开技术产物;它支持实验理解能力,不直接证明新合金性能。
37为什么开源这么多工作?

Krause 认为模型会更开放,真正难复制的是持续产生物理闭环数据的实验基础设施;开源也能吸引社区和人才改进“brain”。

开源产物可验证,实验数据护城河仍主要是公司 thesis。