欧洲提出面向 2040 的材料 AI 协同战略
这项横跨 14 个国家、26 家机构的路线图,试图把材料研究、开发、放大和产业部署接成一条连续链路。
它值得关注的不是又一个模型,而是欧洲正尝试用公共协调和共享基础设施,补上私人科学工厂难以独立承担的规模化环节。

AI FOR SCIENCE · SEP 14
追踪 AI 在科学中能做什么、证据走到了哪里,以及科研回路正在如何改变。

材料科学 × 计算机科学
这项横跨 14 个国家、26 家机构的路线图,试图把材料研究、开发、放大和产业部署接成一条连续链路。
它值得关注的不是又一个模型,而是欧洲正尝试用公共协调和共享基础设施,补上私人科学工厂难以独立承担的规模化环节。
这个约 PB 级公共资源把重复的全基因组模型推理转化为可检索基础设施。
更持久的贡献可能是这层公共预测基础设施:预计算把昂贵模型变成研究者可以反复查询的资源。
一位 MIT 研究者通过 Codex 把模型接入实验室软件,使智能体能够选择参数、操作量子比特测量、分析结果并调整下一次测量。
AI 从编写实验代码进入实时测量闭环;噪声或含混信号也清楚暴露了仍需专家判断的边界。
OpenAI 称内部模型构造了平滑外力下的有限时间奇点,并给出解析证明与 Lean 形式化,以回答千禧年难题的相应表述。
如果结果经得住独立审查,目标就已从奥赛题和孤立猜想推进到千禧年难题;在这个层级,来源与验证本身就是能力主张的一部分。
OpenAI 报告智能体已能完成熟练研究人员需要数日的明确任务;截至 8 月中旬,其研究组织每个人类工作日对应使用 3.1 个智能体工作日。
关键证据不是又一项 benchmark,而是智能体已进入真实前沿研究组织的日常生产;但这些效率数据仍由 OpenAI 自行报告。
此刻值得关注

标准降低了智能体连接硬件的软件成本,但物理状态、安全操作与实验语境仍是更难的一层。

模型不只离线排序候选,也开始决定下一次稀缺的物理实验应该花在哪里。

科学价值取决于新证据落在哪里,而不只取决于收集了多少。

蛋白生产与表征开始从定制作业变成可复用的实验基础设施。
持续追踪
Radical AI · Lila Sciences · DP Technology
MinerU.Chem · OCSR · Smirk · AlphaGenome Atlas
Radical AI · Lila Sciences · FutureHouse
Radical AI · Recursion · Isomorphic Labs · Microsoft
Radical AI · Recursion · Lila Sciences
一份领域指南,而不是信息流
模型只是系统的一部分。更难的前沿,是决定下一步尝试什么、在现实中检验它,并让结果真正改变接下来的行动。
AI for Science 正在同时发生在蛋白质、基因组、材料、天气、数学和实验自动化等不同领域。单独看,每个方向都有自己的模型、数据和问题;放在一起,一些共同的模式开始出现。
THE AI4S MAP 是一份持续更新的阅读地图,用来整理这些工作之间的关系:什么已经变得可能,证据走到了哪里,以及下一步的瓶颈正在移向哪里。
理解 AI4S 最省力的方式,不是先记住一堆模型,而是先问四个问题:
MODEL → DECIDE → ITERATE → UPDATE
| 层 | 核心问题 | 典型能力 |
|---|---|---|
| MODEL | 我们能把什么表示、预测或生成出来? | 表示学习、结构/性质预测、生成模型、仿真 |
| DECIDE | 已知这些信息之后,下一步最值得做什么? | 搜索、排序、实验选择、假设生成、规划 |
| ITERATE | 能不能把答案拿去检验,并继续跑下一轮? | 高保真计算、评测、合成、assay、机器人实验 |
| UPDATE | 新证据会不会改变模型、信念或下一轮策略? | 主动学习、反馈、数据回流、闭环优化 |
这是 THE AI4S MAP 的一级坐标。把它展开,会得到更细的科学发现工作流:
知识 → 表示 → 模型 → 搜索 → 验证 → 实验 → 反馈 →(回到知识)
| # | 环节 | 做什么 | 对应一级坐标 |
|---|---|---|---|
| 1 | 知识 | 已有文献、数据与先验 | MODEL |
| 2 | 表示 | 把世界编码成模型能处理的对象 | MODEL |
| 3 | 模型 | 预测、生成或模拟 | MODEL |
| 4 | 搜索 | 在假设与候选空间里寻找 | DECIDE |
| 5 | 验证 | 高保真计算、评测、形式化证明 | ITERATE |
| 6 | 实验 | 物理世界中的测量 | ITERATE |
| 7 | 反馈 | 结果回流,改变下一轮决策或模型 | UPDATE |
不同系统打通的是不同位置。AlphaFold 主要推进 MODEL;GNoME 把模型与搜索、计算反馈连接起来;MatterGen 把目标性质转成候选生成;Co-Scientist 和 AlphaEvolve 把生成器放进显式搜索与评估循环;A-Lab 把决策接到真实仪器;Robin 则进一步把实验结果带回后续分析和假设更新。
按发现环节看,而不是只按学科看,是这张地图的组织原则。 学科分类容易把跨领域的同构性藏起来:扩散模型可以同时出现在蛋白设计与晶体生成中,主动学习也会同时出现在材料发现、实验选择和自驱动实验室里。
把 21 项代表性工作按环节铺开之后,一件事会变得刺眼:
知识 ███ 3
表示 █████ 5
模型 █████████████ 13
搜索 ██████████ 10
验证 ███████ 7
实验 ███ 3
反馈 ██ 2
在我们选取的这 21 项工作中,13 项触及「模型」,只有 3 项触及「实验」、2 项触及「反馈」。
这不是对 AI4S 文献分布的统计——这 21 项是人工挑选的,不是随机抽样。但它暴露了一个值得追踪的不对称:从模型能力往实验闭环走,候选系统会迅速变少。 完整名单与标注规则随地图一并公开,数字可自行复核。
完整的交互地图可以按 MODEL / DECIDE / ITERATE / UPDATE 与更细的发现环节筛选,并查看每项工作把哪个瓶颈往前推了一步、证据走到了哪里。
这也解释了本文反复出现的一条主线:预测不等于发现。 一个模型可以在基准上表现极好,却离产出一项新科学结果很远。生成的分子还得能合成;预测的材料还得扛得住有限温度、缺陷和加工;生物学假设还得有一个足够灵敏的实验能判断它对不对。
发现循环的可靠性,往往受最弱的评估与反馈环节约束。
如果第一次接触 AI4S,可以从这几项开始;不需要完整的专业背景,读完能建立起对这个领域的基本判断。
The Fourth Paradigm: Data-Intensive Scientific Discovery(Jim Gray, 2009):理解数据密集型科学的经典起点之一。Gray 提出,继实验、理论、计算模拟之后,数据密集型探索正在形成新的科研范式。今天很多 AI4S 讨论,都可以放回这个更长的历史里理解。
Scientific discovery in the age of artificial intelligence(Nature, 2023):Hanchen Wang 等人的综述,横跨生物、物理、化学、材料。如果只读一篇,读这篇——它把"AI 用在科研的哪一环"拆得很清楚。
AlphaFold: The making of a scientific breakthrough(DeepMind 纪录片)+ John Jumper 诺奖演讲:纪录片讲团队与竞赛,诺奖演讲讲技术选择背后的取舍。合起来是理解"什么样的问题适合被 AI 攻克"的一个很好案例——深厚的数据积累(PDB)、相对清晰的实验真值与盲测机制(CASP)、以及与领域结构对齐的架构。
AI for Science: An Emerging Agenda(2023):Dagstuhl 研讨会报告,视角比大厂博客中立得多,明确讨论了激励机制、评审制度、数据基础设施这些"非技术瓶颈"。
The Bitter Lesson(Rich Sutton, 2019):它提供了理解 AI4S 一条持续争论的重要坐标——该往模型里显式注入多少领域先验(对称性、守恒律、物理约束),又该在多大程度上依赖规模化学习。读完这篇再读下一节,会更容易看懂两种路线之间的张力。
如果用 Transformer 与 scaling laws 概括通用 AI 的一条主线,那么 AI4S 还反复面对另一组无法绕开的结构:对称性、物理约束、逆问题,以及在数据稀缺和分布外条件下如何做归纳。
原子会转动,分子会平移,晶体周期性重复,物理系统守恒某些量,测量带噪声,实验昂贵,很多科学目标压根就在历史数据的分布之外。所以核心问题变成了:
应该强迫模型学会世界的哪些结构,又该允许它自己学会哪些?
Geometric Deep Learning(Bronstein, Bruna, Cohen, Veličković, 2021):把 CNN、GNN、等变网络统一在群论视角下的"大一统"尝试。分子、晶体、蛋白质本质上都是带对称性的几何对象,这套语言是理解相关模型的前提。有免费书稿、课程录像和讲义。
e3nn 文档与教程:E(3) 等变的工程实现长什么样。做原子尺度建模绕不开。
A Hitchhiker's Guide to Geometric GNNs for 3D Atomic Systems(2023):把 SchNet、DimeNet、NequIP、MACE 的差异讲清楚了,是从"知道有等变网络"到"知道该选哪个"的桥梁。
NequIP(2022):对称性到底能买到什么,这篇给了最干净的答案——E(3) 等变表示带来的数据效率提升是数量级的。它也成为后来一批等变原子势的重要技术祖先之一。
Physics-Informed Neural Networks(Raissi et al., 2019):把 PDE 残差直接写进损失函数。PINN 的工程表现争议很大(见第八节),但它是"把物理放进神经网络"这条思路最著名的代表作。更深的原则超出 PINN 本身:科学模型不必在数据和物理之间二选一。
Fourier Neural Operator:与 PINN 不同的路线——不拟合单个解,而是学习整个解算子。一句话概括这个思路的价值:学的是模拟器,不是模拟结果。 流体、气候、地震的主流方向。
贝叶斯优化与主动学习:在普通机器学习里,数据集在训练前就有了;在科学里,选择该采集哪些数据本身就是问题。 材料发现、催化剂优化、蛋白工程、自驱动实验室里反复出现的探索–利用权衡,都从这里开始。
扩散模型:从图像生成到分子与晶体生成,是 AI4S 过去三年最重要的方法迁移之一。方法本身可读 Lilian Weng 的 What are Diffusion Models?;科学侧的迁移则直接读 RFdiffusion 与 MatterGen 两篇原文最快,它们分别是这套方法在蛋白与晶体上的落点。
AI4S 最成熟的子领域之一,也成为其他方向反复借鉴的模板。
这条线的进展可以概括成一串箭头,每个箭头都是一个独立的科学问题:
序列 → 结构 → 相互作用 → 功能 → 设计
在结构预测取得显著进步之后,一个更难的前沿是:细胞如何响应扰动。
目前 AI4S 中评测基础设施最成熟、真实世界验证最持续的领域之一——因为严格的评测标准早在 AI 进场之前就存在了。
2025–2026 年变化最剧烈的一块。
领域基础模型回答的是关于分子、基因组、材料、物理场的问题。第二类系统操作的对象不同:它们操作科研工作本身。
这里有一个值得随身携带的区分:
自动化:自动执行一个预定好的实验。 自主:决定下一个实验该做什么。
第二个才更接近科学发现。
这条线的适用边界也很清楚:评估器可靠且廉价时(代码、数学、部分仿真),AI 可以更激进地扩大搜索;当评估需要长周期合成、动物实验或稀缺大型仪器时,同样的搜索逻辑会被反馈延迟、成本与噪声强烈约束。
AI4S 有一个评测问题。语言模型可以用有已知答案的问题来测;科学发现更难,因为最有意思的那个答案可能还不存在。
在讨论具体基准之前,先建立一张证据地图。AI4S 的证据最好不要压成一个分数,因为“验证有多深”和“验证有多独立”是两件不同的事。
维度 A:Validation depth
| 深度 | 证据 | 它回答什么 |
|---|---|---|
| 1 | Benchmark | 在固定测试集或既有任务上表现如何? |
| 2 | High-fidelity computation | 能否通过更高精度计算、形式验证或强评估器? |
| 3 | Prospective prediction | 能否对尚未测量或未来发生的结果提前做对预测? |
| 4 | Physical experiment | 能否被真实物理/生物实验测到? |
| 5 | Real-world use | 是否已经进入真实科研、业务或工程流程并持续产生价值? |
维度 B:Evidence independence
| 状态 | 含义 |
|---|---|
| Internal | 同一团队、同一 pipeline 内完成验证 |
| External benchmark | 在外部数据、公开 benchmark 或第三方设定下检验 |
| Independent replication | 独立团队或实验室得到相符结果 |
这两个维度不能互相替代。通过学习到的稳定性模型不等于通过 DFT;通过 DFT 不等于可合成;原团队合成出一个样品也不等于独立实验室已经复现。
例如:MatterGen 已经跨到 Physical experiment,但实验验证主要来自原研究链路;GNoME 的百万量级候选整体主要处于 High-fidelity computation,同时论文报告有 736 个结构与之后独立实验实现相匹配;AlphaFold 则同时拥有长期外部盲测、独立使用与真实科研工作流中的广泛采用。同一项工作的不同子集可以拥有不同证据深度,这正是为什么不应该把它们硬塞进单一的 1–6 等级。
科学推理与知识
科研执行能力
领域专用
一条反复出现的教训:当某个子领域缺少 CASP 式的盲测、统一基准或独立复现机制时,对“突破”的证据门槛应该更高。 材料与天气在评测基础设施上的差异,是理解不同领域可信度差异的一个好例子。
不是完整书目,而是“为什么这一项值得留在脑子里”。年份主要用于帮助读者定位技术演进;对于预印本、online-first 与正式卷期跨年的工作,以条目所链接的主要版本为准,不把年份本身当作严格的 bibliographic metadata。
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2017 | Neural Message Passing for Quantum Chemistry | 确立了分子性质预测的 GNN 范式 |
| 2019 | Physics-Informed Neural Networks | "把物理写进损失函数"这条思路的代表作,成败都有教益 |
| 2020 | Fourier Neural Operator | 学的是模拟器而不是模拟结果,为整个学习型仿真开路 |
| 2021 | Geometric Deep Learning | 提供了图、对称性、等变性的统一概念语言 |
| 2022 | NequIP | 证明了等变性可以显著提高数据效率,成为后续等变原子势的重要技术祖先之一 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2021 | AlphaFold2 | 学习型推理第一次压垮了一个悬置数十年的科学瓶颈 |
| 2023 | ESMFold / ESM-2 | 蛋白语言模型证明了不靠 MSA 也能做结构 |
| 2023 | RFdiffusion | 从预测结构转向生成结构,蛋白设计的分水岭 |
| 2024 | AlphaFold3 | 把结构预测扩展到复合物,接上了产业需求 |
| 2024/26 | Evo → Evo 2 | 把基础模型下沉到基因组序列本身,百万碱基上下文 |
| 2025 | ESM3 | 序列、结构、功能的多模态联合建模 |
| 2025 | BindCraft | 在多种靶点上把 de novo binder 的实验命中率显著推高,并把“实验命中率”变成核心能力指标 |
| 2026 | AlphaGenome | 用统一 sequence-to-function 模型覆盖多类调控 readout,并推进非编码变异效应预测 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2021 | Open Catalyst 2020 | 用开放数据集与竞赛定义了这个子领域的评测文化 |
| 2023 | GNoME | 模型筛选 + DFT 数据飞轮,把候选搜索与昂贵计算标签连接起来(另见其“发现”争议) |
| 2023 | A-Lab | 把计算候选、实验计划、机器人合成、XRD 与主动学习接进同一闭环 |
| 2023 | Coscientist | LLM 首次直接驱动化学实验硬件 |
| 2024– | MatterSim / UMA / GRACE | 推动原子势向更广化学空间与更多体系迁移,用更低成本扩大能量/力评估与模拟 |
| 2025 | MatterGen | 从筛选转向按目标性质逆向生成 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2022/23 | FourCastNet / Pangu-Weather | 首批证明数据驱动预报可以对标业务系统 |
| 2023 | GraphCast | 在成熟业务基准上给出学习型天气预报可竞争的清晰证据 |
| 2024 | NeuralGCM | 混合路线,回应了"能否外推到未见气候态"的根本质疑 |
| 2025 | GenCast | 从确定性预报转向概率集合,抓住了问题的真实形状 |
| 2025 | Aurora | 一个模型覆盖天气、空气质量、海浪的地球系统基础模型 |
| 2026 | WeatherNext Cyclones | 在 2023–2025 气旋上平均获得约一天以上的预报提前量优势,并公开模型代码与权重 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2022 | AlphaTensor | 搜索出比人类已知更优的矩阵乘法算法 |
| 2024 | FunSearch | 让 LLM 演化程序而非答案,配一个可执行的评估器 |
| 2024 | AlphaGeometry | 神经–符号混合在奥赛几何上达到金牌边缘 |
| 2025 | AlphaProof | 强化学习 + Lean,形式化证明第一次达到奖牌水平 |
| 2025 | AlphaEvolve | 生成器 + 评估器 + 搜索的通用模式,外溢到多个学科 |
| 2026 | AlphaProof Nexus | 解决 9/353 个开放 Erdős 问题;基础的 LLM ↔ Lean 循环也复现了这些成功案例,但成本更高 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2023 | ChemCrow | 早期把化学工具链接进 LLM 的范式 |
| 2024/25 | The AI Scientist / v2 | 端到端自动化的上限探针,争议本身有价值 |
| 2025 | Kosmos | 长程连贯性,以及一套值得抄的记忆污染对照设计 |
| 2026 | Co-Scientist | 把假设生成变成显式的搜索、辩论与排序过程 |
| 2026 | Robin | 把智能体、实验策略、真实生物测量与后续分析接成连续链路 |
| 2026 | Empirical Research Assistance | 把任务收窄到可评分的 empirical software,使大规模搜索拥有更客观的反馈 |
| 年份 | 工作 | 为什么入选 |
|---|---|---|
| 2022 | Tokamak 等离子体强化学习控制 | 强化学习直接控制真实物理装置 |
| 2024 | FlyWire 果蝇全脑连接组 | AI 分割 + 人工校对的大规模协作范式 |
1. 成功高度依赖可靠、标准化、能产生明确反馈的验证器。 数学有 Lean,天气有不断到来的真实未来,蛋白质结构有几十年积累的 PDB、成熟的结构测定和 CASP 盲测。它们的成本并不相同——晶体学一点都不便宜——但共同点是:模型错没错,有相对明确的办法知道。 反过来,材料和细胞生物学的进展之所以争议缠身,正是因为反馈慢、噪声大、缺少公认的裁判。如果你在选 AI4S 的方向,先问"错了多久能知道"。
2. 数据基础设施的价值被系统性低估。 PDB 是全球结构生物学界用几十年逐步积累起来的基础设施,而 AlphaFold 的模型突破发生在更短的时间尺度上。这个时间尺度差异应该改变我们对“下一个 AlphaFold 在哪”的判断——它很可能依赖某个已经长期积累标准化数据、评测与实验真值的领域,而不只是某个新架构。
3. 领域知识正在从「写进架构」迁移到「写进工具、数据、环境与验证器」。 AlphaProof Nexus 里"朴素智能体也解出了全部 9 题、只是更贵"的消融,和材料领域从专用势函数走向通用势函数,指向同一个方向。这不意味着领域知识没用——它只是换了个位置注入。至于通用模型会不会全面取代专用模型,现有证据还撑不起这么大的结论。
4. 循环右半边的候选者明显更少。 在我们选取的 21 项工作里,13 项触及"模型",只有 3 项触及"实验"、2 项触及"反馈"。这是一张人工策展的地图而非文献抽样,但方向性的不对称很难忽略。下一阶段的难题不只在更大的模型,也越来越集中在接口:分子生成器能不能在提出候选之前就懂合成约束?原子势能不能知道自己什么时候越界了?智能体能不能区分"真的新假设"和"只是没被检索到"?自主实验能不能保留足够的溯源信息,让另一间实验室复现?
5. 本文所列的“AI 科学家”系统仍然处在人类定义目标、执行关键实验或承担最终判断的更大闭环里。 2026 年真正值得关注的成果,不是已经出现了完全自主科学家,而是"提出假设—验证—修正"循环正在明显变快。区别很重要:一个能读你数据的模型是好工具;一个能说"去合成这个化合物,我预测它热力学稳定"并且对得足够频繁、值得你押上实验台时间的模型,改变的是发现本身的经济学。后者已经开始出现,但它仍然需要一个人来签字。
长期的机会因此比"帮助科学家的 AI"更大:它是让知识、计算与实验持续互相改进的系统。
如果你有值得补充的工作,或发现文中有需要更正的地方,欢迎告诉我。