本集摘要
Joseph Krause 在这期访谈里反复回到同一个论点:材料发现真正的约束不是算力,而是物理实验本身——“We're not compute constrained in the materials industry. We're experiment constrained.”合金的组合空间理论上有 10^40 种,但决定一个材料能不能用的,从来不只是成分,还有合成路线、微观结构和制造方式,这些都没法写进一个像 SMILES 那样的字符串里。
Radical 把 AI Scientist 做成一个多智能体系统,用主动学习按 campaign 把发现—合成—表征—早期测试接成闭环。但这条闭环的边界很清楚:制造放大和资格认证还没有被接入。Krause 自己给“真正的发现”设了一个很高的门槛——材料要真正出现在消费者产品里才算数。按这个标准,公司目前展示的一切都还停留在这条线之前。
采访整理
材料版的“信息瓶颈”:为什么小分子能用一串字符表示,合金不行
Krause 从一个对比讲起:生物和小分子领域可以用 SMILES、SELFIES 这样的字符串表示分子,因为知道元素和化学键,基本就知道了需要知道的大部分信息。但合金不是这样——供应链成本、微观结构、加工方式是增材制造还是铸造,这些都决定性能,却没法编码进一个字符串。
这也是为什么,按 Krause 的说法,“没有一个模型能一次性生成一个最终会出现在 iPhone 或 Starship 里的新材料”。模型提出的成分只是起点,材料身份还包括它如何被制备、加工和放大。
从成分到产品:每往前一步,都会暴露新问题
Radical 内部把材料的生命周期分成几段:假设生成(AI 提出新成分)→ 合成(把原料熔炼铸造成合金)→ 表征(SEM、EDS、XRD、XRF、TGA 等工具分析微观结构)→ 早期性能测试(氧化性能、拉伸测试、微压痕硬度)。目前 Radical 只做到了发现和测试阶段,还没有触及制造。
Krause 举了一个具体的已完成案例:铪是 C103 这类常见航空航天合金的组分,约占重量 10%。由于供应链高度集中,其价格在过去几年上涨了 10–15 倍。Radical 称已经在不使用铪的情况下维持同等性能规格——这是访谈里少数几个“已经做完”而不是“正在做”的具体成果,但配方细节与独立性能对比尚未公开。
Krause 对“真正的发现”定义很严格:设计出新成分、合成出来、完成表征都是里程碑,但都不算最终发现。“我们把‘发现’算作你拿起手机、里面装着一种新材料的那一刻。”按这个标准,公司展示的 1,200 个合金和 300 个新配方,没有一个跨过这条线。
“自动化实验室”和“自驱实验室”不是一回事
Krause 用 Waymo 做比喻:自动化实验室像带辅助驾驶的车,人仍要发出转弯指令;自驱实验室接收一个目的地,中间怎么走不用人逐步规定。落到实验室里,系统要能自己设计、执行、记录,并根据失败结果决定下一批实验,而不只是把既定流程做得更快。
自驱实验室由机器人执行、软件编排和工程机械系统三部分组成。高温合金样品——业内称为 button——铸造时会以 3000–4000°C 的高温粘在托盘上,团队必须为机械臂设计定制执行器,在不损伤微观结构的情况下把样品取下来。这类问题和“发现新合金”无关,却是运行自驱实验室绕不开的工程工作。
主动学习按 campaign 运转,AI 敢闯人类因偏见回避的区域
系统目前约有 7–10 个 campaign 同时运行,结果每天或隔天更新一次,反馈还不包括制造数据。今天所有成分假设都由 AI Scientist 生成;人类科学家偶尔提交自己的配方,却常被 AI 判定“不够强”而拒绝,Krause 把这戏称为“红队测试”。
一张内部图把文献里人类探索过的高熵合金组合,与 AI Scientist 实际探索的组合叠在一起。AI 进入了此前没有发表记录的区域。科学家此前没试过,是因为预设某些元素不兼容、会挥发或形成不了稳定微观结构。AI 没有这些心理预设,又能并行处理信息,因此更容易尝试被人类直觉提前排除的区域。
吞吐、成本与信息密度:为什么不需要百万级数据集
过去五到六个月,Radical 称制造并表征了约 1,200 个合金,其中约 300 个此前未见于文献,约 10 个进入下一步评估。作为访谈中的行业参照,DARPA 与 GE Aerospace 的 MACH 项目目标是在 12 个月内制造 500 个新合金;两者的测试深度是否可比仍不清楚。
理论合金组合空间约为 10^40,Krause 估算即使穷举也要约 700 万年。每个合金大约产生 50–150 个数据点。按机器学习标准仍是小数据集,但 AI 可以同时读 10 万篇文献、看 10 万张 SEM 图像并直接对照;Krause 认为这种“并行密度”比样本表的绝对行数更重要。
单次合金实验成本约为 60–300 美元,取决于元素成本。当前吞吐量为每天 8–20 个,耐熔合金更难铸造,速度更低;目标是在 2026 年年中前后做到不分体系每天 100 个。后一个数字是目标,不是已经稳定实现的结果。
材料版 AlphaFold 为什么不存在
Krause 认可 Heather Kulik 的判断:材料领域没有 AlphaFold。在具体子任务上可以有“AlphaFold 时刻”,例如用分割模型分析 SEM 图像中的裂纹与缺陷;但没有一个模型能把“我有一个新假设”直接带到“它已经规模化并进入产品”。
Radical 把长期数据资产类比为“材料版 Protein Data Bank”,但这比蛋白质数据库困难得多。除了属性种类更多,还有一类知识几乎无法进入数据库:一位在 3M 工作 35 年的顾问把它描述为“知道在具体哪个时刻把哪个旋钮调到什么位置”的经验判断。即使写成公式,也未必每次都适用。Radical 坦承目前还没有这部分知识的通用解法。
护城河是把一切拼起来的苦活,制造与认证仍是最后一环
Krause 讲了几个具体的“血泪史”。两年前,一些仪器厂商甚至不愿意在付费的情况下开放软件接口,因为它们靠出售分析自家仪器数据的软件获利;这种态度现在有所松动。团队还发现跨学科分工比预想得更细:机械工程师和机电工程师必须成为不同岗位,机器人团队对路径规划与感知的需求也更依赖计算机视觉,因为科学家的许多判断本身就是“看图凭直觉”。
Krause 现在把这些工程琐事视为公司的护城河:不是“在工具前面摆一个机器人”就能复制。制造与资格认证仍未打通,公司依赖拥有规模化制造经验的产业伙伴。即使这些伙伴对 AI 抱有怀疑,他们对供应链、成本与极端环境性能取舍的判断仍然重要。
在国家竞争层面,Krause 认为中国可以用更统一的资本与行政力量打通发现和制造,但明确表示美国不应照搬。他提出让一名科学家同时管理多个 campaign、扩大公私投资,并把国家实验室的计算、人才与数据和私营企业的系统整合能力接起来。这个构想仍是战略主张,而不是已经验证的生产率结果。
技术栈:多智能体系统,以及为什么“模型不是护城河”
AI Scientist 是一套多智能体系统。顶层编排 agent 生成新假设,并在送入实验室前先做一轮内部可行性检验;系统会像人类科学家一样接入 CALPHAD 等付费行业数据库;自建的文献综述 agent 则从科学文献中抽取与当前假设相关的图表和信息,其 benchmark 已公开。
MATRIX 是在 Qwen 基础上微调的视觉语言模型,用于从 SEM 等实验图像中提取科学知识;模型、benchmark 与预印本均已公开。团队报告,它在部分通用科学推理 benchmark 上提升约 5%–16%,并能迁移到生物领域;但数学推理没有观察到同样提升。这个反例说明“实验图像训练改善通用科学推理”的范围仍需界定。
Radical 开源 TorchSim、MATRIX 和 LitXBench。Krause 的逻辑是:社区反馈能改进工具,开放有助于推动用实验验证科学,而且模型会越来越商品化。公司不计划开发专有基础大模型,而会使用现成的 ChatGPT 或 Claude;真正保留的是叠加在公开数据之上的专有实验数据。用他的话说:“Models aren't the moat. Experiments are.”
关键数字
过去五到六个月内制造并表征的合金
公司自述;本次访谈可核实其中此前未见于文献的新配方
公司自述;本次访谈可核实表现足够好、进入下一步评估的配方
公司自述;本次访谈可核实DARPA–GE Aerospace MACH 项目的访谈对照吞吐
Latent Space 官方摘要可核实;测试深度是否可比未知当前吞吐 → 2026 年年中前后的目标吞吐
当前数字为公司自述;100 / 天是目标单次合金实验估算成本
访谈现场估算,未正式审计理论合金组合空间上限
访谈说法;理论空间不是实际产量单个合金可获得的数据点数量级
访谈估算MATRIX 训练后在部分通用科学推理 benchmark 上的提升
公司预印本自述;数学推理未观察到提升铪因供应链集中而出现的访谈价格涨幅
访谈中的行业背景数字重点原话
“We're not compute constrained in the materials industry. We're experiment constrained.”
“The ground truth is the material itself.”
“There is no one model that can one-shot a new material.”
“Models aren't the moat. Experiments are.”
“The AI Scientist is really a multi-agentic approach.”
“In five years most models will be open source.”
“It's not about a robot in front of a tool.”
主张与证据
把已经展示的系统、公司自述、未来目标和编辑理解分开阅读。
发现—合成—表征—早期测试的 campaign loop 已运行,约 7–10 个 campaign 同时进行。
公司自述;缺少独立运营审计。
五到六个月内生产并表征约 1,200 个合金,约 300 个此前未见于文献。
候选表和同条件对照未公开;MACH 的 500 / 12 个月仅作行业参照,测试深度是否可比未知。
当前吞吐为每天 8–20 个,目标在 2026 年年中前后达到每天 100 个。
当前数字为访谈自述;目标与当前运行状态之间没有公开进度。
已在合金中去除铪,同时维持性能指标。
具体成功案例;配方细节和独立性能对比未公开。
MATRIX 训练后在部分通用科学推理 benchmark 上提升约 5%–16%,可迁移到生物领域,但数学推理未观察到提升。
已发预印本,方法和部分数据可检查;幅度依赖 benchmark。
TorchSim 已独立为非营利组织,由社区继续维护。
治理与公开贡献记录可以核查。
制造与资格认证尚未被接入发现闭环。
公司在采访中明确承认这一进度边界。
编辑笔记
Krause 给“真正的发现”设了一个很高的门槛
只有材料真正出现在消费者产品里才算数。按这个标准,Radical 展示的 1,200 个合金和 300 个新配方,一个都还没有跨过制造这道线。这个自我设限的定义,让整场采访的进展叙述听起来更克制。
“自驱实验室”目前是分环节实现的,不是全链条自主
合成仍需要冶金学家凭经验判断熔炼与浇铸状态;采访中的计划是到年中继续推进自动化。表征和部分测试的自动化,不应被读成从原料到制造的全链条自主。
先把一种材料体系做深,与追求跨领域广度形成对照
Radical 起初想同时覆盖多种材料体系,但客户追问能否放大到 300 磅后,公司转向先把合金这一体系的全链条做深。这与 Lila Sciences 押注跨领域广度和迁移的路线构成了一组值得追踪的对照。
护城河是拼起这一堆脏活,而不是模型本身
逆向控制没有接口的仪器软件、为粘在托盘上的高温合金定制机械爪、拆分机械与机电工程岗位——这些琐事难以复制。它们和“模型不是护城河”是同一个逻辑的两面:真正稀缺的是把物理系统长期可靠地运行起来。
待追踪问题
- 01
8–20 个/天走向 100 个/天时,吞吐提升是否会伴随命中率下降?这决定了“材料版数据中心”是否真的可扩展。
- 02
合成环节的自动化能否如期完成?这是自驱实验室从分环节自主走向全链条自主的关键一步。
- 03
制造与资格认证何时能纳入同一个数据闭环?Krause 承认这部分尚未开始解决。
- 04
去铪配方的具体性能数据和独立验证何时公开?这是访谈中少数明确声称已经完成的案例。
- 05
MATRIX 在数学推理上没有观察到提升,这个反例的边界在哪里?
- 06
“一个博士同时管理 10 个 campaign,生产率提升一个数量级”的说法能否得到更广泛验证?
资料来源
- S1Latent Space 官方文章与录音 ↗PRIMARY SOURCE
- S2原始 YouTube 访谈 ↗PRIMARY SOURCE
分类问答附录
信源本身采用逐题问答形式。这里保留完整索引供查阅,核心论证不在此重复展开。
A · 核心主张
01Radical AI 为什么不同?
Krause 把实验数据而非生成模型视为核心:材料必须被制造、测试和表征,物理样品才是最终 ground truth。
这定义了公司的核心 thesis,但仍是创始人对差异化的表述。02为什么不能先让 AI 想出大构想,再晚些验证?
对结构材料,成分只是起点;合成、微观结构、加工、制造和认证都会改变最终性能。
页面应追踪 composition 之后的链条,而不只追踪候选生成。03如何从一次发现跨到百万级商业生产?
需要记录材料整个生命周期的数据。Radical 目前公开边界到发现、合成、表征和早期性能测试;制造是后续扩展。
这是最清楚的 current boundary。04Radical 今天实际走到了哪里?
公开摘要称六个月生产并表征约 1,200 个合金、约 300 个新材料、约 10 个被公司认为尤其有前景;制造尚未接入闭环。
运行数字来自公司采访,不等同于独立验证。05是在优化已知组合,还是推进科学前沿?
公司称其进入过去文献未覆盖的元素和合金族,并希望最终实现材料与产品的 concurrent engineering。
新成分不等于新且有用的性能。06哪些下游瓶颈仍会杀死一个好材料?
跨批次制造、标准化测试和资格认证可能耗时多年;下游失败需要回流到发现阶段。
qualification 必须作为独立阶段显示。07资格认证能否被“Operation Warp Speed”式加速?
Krause 不主张降低安全门槛,而是用自主制造、传感器和更完整的过程数据重构达到门槛的路径。
这是方向性主张,尚未给出完成认证的案例。08材料 AI 为什么不同于生物或小分子 AI?
工业材料没有像 SMILES 那样的紧凑表征;成分、微观结构、工艺、供应链、成本和可制造性共同定义材料。
这解释了 Radical 的 beyond-composition 数据模型。B · 什么才算自动驾驶实验室
09闭环有多迭代?人在哪里?
人类专家仍标注 SEM 等实验数据并传递科学直觉;仪器软件、API 和数据访问也会限制自动化。
human-in-loop 是当前系统组成,而不是例外。10自动化实验室和自动驾驶实验室有何区别?
自动化实验室执行人类预先定义的流程;SDL 由 AI Scientist 设计 campaign、调用实验、读取结果并决定下一轮。
自主性要在 campaign 决策层判断,不能只看机械臂。11自主实验室最难的工程问题是什么?
既有高温样品与不规则材料的物理搬运,也有仪器控制、路径规划、感知、故障恢复和跨学科系统集成。
物理 edge cases 是基础设施护城河的一部分。12会扩展到聚合物、陶瓷和所有材料吗?
公司最初设想多个材料系统实验室,但客户沟通暴露了 scale-up 深度;现阶段先垂直整合合金,再考虑扩展。
跨材料通用性仍是未来路线。13新材料可能解锁哪些行业?
Krause 重点谈到航空航天、国防和半导体互连材料,并描述潜在效率提升。
行业影响是 outlook,不是已展示的客户结果。14新材料进入 iPhone、GPU 或航空系统要多久?
半导体集成仍很慢;Krause 认为国防与航天场景也许有 3–5 年路径,但载人航空认证会更严格。
3–5 年是预测,不是承诺或已实现周期。C · 主动学习闭环
15主动学习中的错误不会不断放大吗?
Radical 把失败作为负结果;系统按 campaign 而非单个实验更新,混合自动分析和人工复核后再设计下一批。
负结果有价值,但需要完整记录与稳健的实验 QC。16人类科学家仍做什么?哪些已自动化?
表征、氧化和微压痕等环节自动化程度较高;合成与拉伸测试仍存在人工参与或接近自动化的状态。
应按环节记录自动化,不能用一个总百分比。17AI 能探索哪些人类不会进入的空间?
公司称 AI 会进入文献外的元素族,并挑战人类对铸造、蒸发、微观结构或机械性能的先验偏见。
是否产生更优材料仍需由性能证据回答。18AI 真更有创造力,还是失败只是更便宜?
采访给出的更稳健解释是实验经济学改变了:高吞吐让系统可以在低置信度区域获得更多 shots on goal。
不要把探索宽度直接写成机器创造力。19单个合金实验成本多少?
采访转录给出约 60–300 美元,具体高度依赖元素,难熔或贵金属会更贵。
这是未经审计的采访数字,适合保留在来源页而非首页。20实验室每天能合成多少合金?
采访描述当前约 8–20 个/天、并行运行 7–10 个 campaign;100 个/天是未来目标。
必须把 current throughput 与 target 分开。21除了多做实验,AI 还能做人类做不到的什么?
Krause 强调跨文献、SEM 图像、假设和性能结果的并行比较,而人类研究往往是串行的。
这是计算与记忆容量主张,尚需命中率和决策质量指标。D · 数据规模与真实瓶颈
22材料吞吐量相对生物是否太小?
公司建议与材料领域自身基线比较:公开摘要把 1,200 个/六个月与 DARPA/GE MACH 的约 500 个/年对比。
接近 10× 是跨项目比较,不是同条件 benchmark。23发现是否需要数百万数据点?
Radical 认为在巨大设计空间中,关键是选择高信息量实验;每个合金还产生多模态测量,因此小而新颖的数据也可能有价值。
需要用样本效率和外部复现验证。24Radical 想建立什么数据库?
愿景类似材料版 Protein Data Bank,但必须同时包含成分、合成、工艺、微观结构、性能、制造和应用语境。
这是数据基础设施愿景,当前覆盖范围仍有限。25材料领域有“AlphaFold”吗?
Krause 认为没有一个模型能解决全链条;显微图像分析等窄任务可能出现 AlphaFold moment,但不等于解决制造与认证。
应避免把单点 benchmark 推断为端到端发现。26什么才算真正的材料发现?
Krause 的高门槛定义是材料最终进入真实产品或系统;设计、合成和表征只是中间里程碑。
这个定义能约束网站不把候选生成写成部署。E · 制造知识如何回到上游
27制造失败如何反向翻译回发现?
制造包含大量资深工程师的隐性知识。Radical 称已在铸造、SEM、XRD 等发现环节开始捕获直觉,但明确尚未解决制造知识闭环。
这是核心未解决边界。28尚未解决制造,短期如何推进?
路径是与已有规模制造能力和几十年工艺经验的机构合作,由伙伴提供成本、供应链、工艺和环境约束。
伙伴关系能补能力,但是否能形成可复制闭环仍未知。F · 护城河与时机
29实验室有哪些 war stories?
仪器无法编程控制、供应商接口封闭、机械路径与感知失败都需要工程绕行;团队横跨材料、机械、机电、软件、ML 与机器人。
这支持基础设施很难,但不直接证明科学输出更优。30为什么是现在?
Krause 归因于基础模型和专业 ML 的提升、机器人与传感器成本下降,以及资本和产业对 SDL 的接受度改变。
这是市场时机解释。31SDL 广泛采用还缺什么?
还需要一个无可争议的结果:客户原本要多年解决的问题,被 SDL 显著更快解决。Krause 预计未来 2–3 年可能出现拐点。
2–3 年是 CEO 展望;真正的 next proof 是客户结果。32美国应如何与中国竞争材料与 AI4S?
Krause 主张结合国家实验室、超算、公共基础设施和私营 SDL,提高单个研究者的研究吞吐,而非复制中国的组织模式。
这是政策观点,不属于技术验证。33如果只能移除一个 AI4S 瓶颈,会是什么?
根本问题是物理反馈慢;可工程化问题是科学工具为人而非 agent 或机器人设计。并行实验和机器可调用接口是两条路径。
这也适合作为跨公司的比较维度。G · 团队与 AI Scientist 技术栈
34对 ML 工程师和科学家的建议是什么?
不要把自己训练成另一个学科的半吊子;ML 工程师保持 ML 深度,材料科学家学会使用 AI 工具,通过真正跨学科协作解决问题。
这是团队设计观点。35Radical 的 AI 技术栈是什么?
AI Scientist 被描述为多智能体系统,连接文献 agent、CALPHAD 与领域数据、模拟/MLIP、历史实验、专业 ML、人类直觉和 SDL。
这是系统架构说明,不是一个可单独评分的模型。36MATRIX 是什么?实验 grounding 为什么重要?
MATRIX/MATRIX-PT 用 SEM、XRD、EDS、TGA 等真实实验模态训练和评测科学推理,并已公开数据、模型与预印本。
这是可检查的公开技术产物;它支持实验理解能力,不直接证明新合金性能。37为什么开源这么多工作?
Krause 认为模型会更开放,真正难复制的是持续产生物理闭环数据的实验基础设施;开源也能吸引社区和人才改进“brain”。
开源产物可验证,实验数据护城河仍主要是公司 thesis。