AI FOR SCIENCE · SEP 14

From better modelsto tighter scientific loops.

追踪 AI 在科学中能做什么、证据走到了哪里,以及科研回路正在如何改变。

Scientific feedback loopA closed loop connecting Model, Decide, Iterate and Update.
FILTER TIMELINE BY STAGE ↓
Sun Dekun
FOUNDER & EDITORDekun (Gloria) Sun

材料科学 × 计算机科学

时间线

查看完整时间线
回路
证据

OpenAI 报告 AI 生成的 Navier–Stokes 解答,同时出现来源争议

OpenAI 称内部模型构造了平滑外力下的有限时间奇点,并给出解析证明与 Lean 形式化,以回答千禧年难题的相应表述。

如果结果经得住独立审查,目标就已从奥赛题和孤立猜想推进到千禧年难题;在这个层级,来源与验证本身就是能力主张的一部分。

OpenAI 称编码智能体已达到自动化研究实习生里程碑

OpenAI 报告智能体已能完成熟练研究人员需要数日的明确任务;截至 8 月中旬,其研究组织每个人类工作日对应使用 3.1 个智能体工作日。

关键证据不是又一项 benchmark,而是智能体已进入真实前沿研究组织的日常生产;但这些效率数据仍由 OpenAI 自行报告。

查看完整时间线

此刻值得关注

分析

持续追踪

我正在追踪的问题

一份领域指南,而不是信息流

AI4S 地图

从模型走向发现

模型只是系统的一部分。更难的前沿,是决定下一步尝试什么、在现实中检验它,并让结果真正改变接下来的行动。

表征、预测并生成科学对象。
2026 年 9 月版

AI for Science 正在同时发生在蛋白质、基因组、材料、天气、数学和实验自动化等不同领域。单独看,每个方向都有自己的模型、数据和问题;放在一起,一些共同的模式开始出现。

THE AI4S MAP 是一份持续更新的阅读地图,用来整理这些工作之间的关系:什么已经变得可能,证据走到了哪里,以及下一步的瓶颈正在移向哪里。



MODEL · DECIDE · ITERATE · UPDATE

一个心智模型:从模型到发现

理解 AI4S 最省力的方式,不是先记住一堆模型,而是先问四个问题:

MODEL → DECIDE → ITERATE → UPDATE

核心问题 典型能力
MODEL 我们能把什么表示、预测或生成出来? 表示学习、结构/性质预测、生成模型、仿真
DECIDE 已知这些信息之后,下一步最值得做什么? 搜索、排序、实验选择、假设生成、规划
ITERATE 能不能把答案拿去检验,并继续跑下一轮? 高保真计算、评测、合成、assay、机器人实验
UPDATE 新证据会不会改变模型、信念或下一轮策略? 主动学习、反馈、数据回流、闭环优化

这是 THE AI4S MAP 的一级坐标。把它展开,会得到更细的科学发现工作流:

知识 → 表示 → 模型 → 搜索 → 验证 → 实验 → 反馈 →(回到知识)

# 环节 做什么 对应一级坐标
1 知识 已有文献、数据与先验 MODEL
2 表示 把世界编码成模型能处理的对象 MODEL
3 模型 预测、生成或模拟 MODEL
4 搜索 在假设与候选空间里寻找 DECIDE
5 验证 高保真计算、评测、形式化证明 ITERATE
6 实验 物理世界中的测量 ITERATE
7 反馈 结果回流,改变下一轮决策或模型 UPDATE

不同系统打通的是不同位置。AlphaFold 主要推进 MODEL;GNoME 把模型与搜索、计算反馈连接起来;MatterGen 把目标性质转成候选生成;Co-Scientist 和 AlphaEvolve 把生成器放进显式搜索与评估循环;A-Lab 把决策接到真实仪器;Robin 则进一步把实验结果带回后续分析和假设更新。

按发现环节看,而不是只按学科看,是这张地图的组织原则。 学科分类容易把跨领域的同构性藏起来:扩散模型可以同时出现在蛋白设计与晶体生成中,主动学习也会同时出现在材料发现、实验选择和自驱动实验室里。

把 21 项代表性工作按环节铺开之后,一件事会变得刺眼:

知识    ███            3
表示    █████          5
模型    █████████████ 13
搜索    ██████████    10
验证    ███████        7
实验    ███            3
反馈    ██             2

在我们选取的这 21 项工作中,13 项触及「模型」,只有 3 项触及「实验」、2 项触及「反馈」。

这不是对 AI4S 文献分布的统计——这 21 项是人工挑选的,不是随机抽样。但它暴露了一个值得追踪的不对称:从模型能力往实验闭环走,候选系统会迅速变少。 完整名单与标注规则随地图一并公开,数字可自行复核。

完整的交互地图可以按 MODEL / DECIDE / ITERATE / UPDATE 与更细的发现环节筛选,并查看每项工作把哪个瓶颈往前推了一步、证据走到了哪里。

这也解释了本文反复出现的一条主线:预测不等于发现。 一个模型可以在基准上表现极好,却离产出一项新科学结果很远。生成的分子还得能合成;预测的材料还得扛得住有限温度、缺陷和加工;生物学假设还得有一个足够灵敏的实验能判断它对不对。

发现循环的可靠性,往往受最弱的评估与反馈环节约束。


一、从这里开始

如果第一次接触 AI4S,可以从这几项开始;不需要完整的专业背景,读完能建立起对这个领域的基本判断。

  • The Fourth Paradigm: Data-Intensive Scientific Discovery(Jim Gray, 2009):理解数据密集型科学的经典起点之一。Gray 提出,继实验、理论、计算模拟之后,数据密集型探索正在形成新的科研范式。今天很多 AI4S 讨论,都可以放回这个更长的历史里理解。

  • Scientific discovery in the age of artificial intelligenceNature, 2023):Hanchen Wang 等人的综述,横跨生物、物理、化学、材料。如果只读一篇,读这篇——它把"AI 用在科研的哪一环"拆得很清楚。

  • AlphaFold: The making of a scientific breakthrough(DeepMind 纪录片)+ John Jumper 诺奖演讲:纪录片讲团队与竞赛,诺奖演讲讲技术选择背后的取舍。合起来是理解"什么样的问题适合被 AI 攻克"的一个很好案例——深厚的数据积累(PDB)、相对清晰的实验真值与盲测机制(CASP)、以及与领域结构对齐的架构。

  • AI for Science: An Emerging Agenda(2023):Dagstuhl 研讨会报告,视角比大厂博客中立得多,明确讨论了激励机制、评审制度、数据基础设施这些"非技术瓶颈"。

  • The Bitter Lesson(Rich Sutton, 2019):它提供了理解 AI4S 一条持续争论的重要坐标——该往模型里显式注入多少领域先验(对称性、守恒律、物理约束),又该在多大程度上依赖规模化学习。读完这篇再读下一节,会更容易看懂两种路线之间的张力。


MODEL

二、方法论基础:AI4S 与通用 AI 分岔的地方

如果用 Transformer 与 scaling laws 概括通用 AI 的一条主线,那么 AI4S 还反复面对另一组无法绕开的结构:对称性、物理约束、逆问题,以及在数据稀缺和分布外条件下如何做归纳。

原子会转动,分子会平移,晶体周期性重复,物理系统守恒某些量,测量带噪声,实验昂贵,很多科学目标压根就在历史数据的分布之外。所以核心问题变成了:

应该强迫模型学会世界的哪些结构,又该允许它自己学会哪些?

讲解与教程

  • Geometric Deep Learning(Bronstein, Bruna, Cohen, Veličković, 2021):把 CNN、GNN、等变网络统一在群论视角下的"大一统"尝试。分子、晶体、蛋白质本质上都是带对称性的几何对象,这套语言是理解相关模型的前提。有免费书稿、课程录像和讲义。

  • e3nn 文档与教程:E(3) 等变的工程实现长什么样。做原子尺度建模绕不开。

  • A Hitchhiker's Guide to Geometric GNNs for 3D Atomic Systems(2023):把 SchNet、DimeNet、NequIP、MACE 的差异讲清楚了,是从"知道有等变网络"到"知道该选哪个"的桥梁。

  • NequIP(2022):对称性到底能买到什么,这篇给了最干净的答案——E(3) 等变表示带来的数据效率提升是数量级的。它也成为后来一批等变原子势的重要技术祖先之一。

  • Physics-Informed Neural Networks(Raissi et al., 2019):把 PDE 残差直接写进损失函数。PINN 的工程表现争议很大(见第八节),但它是"把物理放进神经网络"这条思路最著名的代表作。更深的原则超出 PINN 本身:科学模型不必在数据和物理之间二选一。

  • Fourier Neural Operator:与 PINN 不同的路线——不拟合单个解,而是学习整个解算子。一句话概括这个思路的价值:学的是模拟器,不是模拟结果。 流体、气候、地震的主流方向。

  • 贝叶斯优化与主动学习:在普通机器学习里,数据集在训练前就有了;在科学里,选择该采集哪些数据本身就是问题。 材料发现、催化剂优化、蛋白工程、自驱动实验室里反复出现的探索–利用权衡,都从这里开始。

  • 扩散模型:从图像生成到分子与晶体生成,是 AI4S 过去三年最重要的方法迁移之一。方法本身可读 Lilian Weng 的 What are Diffusion Models?;科学侧的迁移则直接读 RFdiffusion 与 MatterGen 两篇原文最快,它们分别是这套方法在蛋白与晶体上的落点。

课程


MODEL · DECIDE

三、分学科深潜

3.1 结构生物学与蛋白质设计

AI4S 最成熟的子领域之一,也成为其他方向反复借鉴的模板。

  • AlphaFold2Nature, 2021)与 AlphaFold3Nature, 2024):前者解决单链蛋白结构预测,后者扩展到蛋白-配体、蛋白-核酸、抗体-抗原复合物。AlphaFold3 初期没有同时开放代码与模型,引发了明显的开放性争议;随后 Boltz、Chai 等开源替代路线也迅速发展。
  • Boltz-2(2025,预印本):开源的结构 + 结合亲和力联合预测模型,是目前较容易自行部署与实验的一类选择。
  • ESM3Science, 2025):EvolutionaryScale 的多模态蛋白语言模型,同时建模序列、结构、功能,并用它生成了 esmGFP:与最接近的已知荧光蛋白只有 58% 序列同一性,相差约 96 个残基。
  • RFdiffusionNature, 2023):Baker 实验室的从头蛋白设计扩散模型。AlphaFold 是「读」结构,RFdiffusion 是「写」结构。 Baker 因这条线与 Hassabis、Jumper 共享 2024 年诺贝尔化学奖。
  • BindCraft(2025):开放的一次性 de novo binder 设计流程,在论文测试的不同靶点上报告了 10–100% 的实验命中率(平均 46.3%)。它把一个关键问题摆到台前:判断一个 AI4S 方向是否成熟,不能只看能不能生成,还要看生成的东西在实验台上有多大比例成立。

这条线的进展可以概括成一串箭头,每个箭头都是一个独立的科学问题:

序列 → 结构 → 相互作用 → 功能 → 设计

3.2 基因组学与"虚拟细胞"

在结构预测取得显著进步之后,一个更难的前沿是:细胞如何响应扰动。

  • Evo 2Nature, 2026):Arc Institute 与 NVIDIA 合作的基因组基础模型,400 亿参数、100 万 token 上下文、9 万亿碱基,覆盖真核与原核全域,不做任务微调即可预测包括 BRCA1 临床变异在内的功能影响。配套的稀疏自编码器可解释性分析同样值得读。
  • AlphaGenomeNature, 2026):DeepMind 的统一 DNA sequence-to-function 模型,重点推进调控活动与变异效应预测——这是基因组学里非常重要、也很难的一块,因为大量疾病相关变异位于非编码区域。
  • Arc Virtual Cell Initiative(State、Stack 与 Virtual Cell Challenge):把"预测细胞对扰动的响应"设成一个可竞赛、可评测的公开问题,是当前虚拟细胞方向最重要的公开基础设施之一。
  • Perturb-seq00597-9):虚拟细胞模型的重要数据基础之一。读它是为了明白一件事:模型架构之外,扰动数据如何生成、覆盖什么生物状态,同样可能成为决定性瓶颈。

3.3 化学与材料

  • GNoMENature, 2023):报告约 220 万个预测候选,其中约 38 万个落在更新后的稳定集合中。真正值得记住的是数据飞轮:模型筛选候选、DFT 产生高成本标签,再把结果用于改进下一轮模型。请务必配套读 Cheetham & Seshadri 的批评Chem. Mater., 2024)。这一组对照阅读,是理解 AI4S 里"发现"一词有多滑的最好教材。
  • MatterGenNature, 2025):微软研究院的条件生成模型,按目标性质反向生成晶体结构,并有实验合成验证。筛选问「哪个候选更好」,逆向设计问「什么候选应该存在」。 这个区别是根本性的。
  • MACE-MP-0 / MatterSim / UMA / GRACE:通用机器学习原子间势(uMLIP)。它们的重要价值位于 MODEL ↔ ITERATE 的接口:用远低于第一性原理计算的成本近似能量和力,从而扩大模拟与候选评估的规模。但它们不能被默认视为 DFT 的等价替代,尤其在有限温度、表面、缺陷、界面和分布外体系上——这正是 MOFSimBench、CHIPS-FF、UniFFBench 等新基准不断追问的问题。
  • Six Open Questions in MLIP Foundation Models(2026):读完成功故事之后读这篇。它追问的是"基础模型"这个词在这个领域到底该怎么定义、迁移性该怎么评估、模型在哪里失效、还缺哪些证据。
  • Open Catalyst Project(OC20 / OC22 / OMat24):Meta 主导的开放数据集与竞赛,几乎定义了这个子领域的评测文化。
  • A-LabNature, 2023;2026 年更正):伯克利的自主合成实验室,17 天完成 353 次实验,并在 57 个目标中实现 36 个。GNoME 问「什么材料可能存在」,A-Lab 问「我们能不能真做出来」。 计算可能性与物理可实现性之间的这道鸿沟,是 AI4S 的定义性问题之一。同样建议配套读社区对其表征结论的质疑。

3.4 地球系统与气候

目前 AI4S 中评测基础设施最成熟、真实世界验证最持续的领域之一——因为严格的评测标准早在 AI 进场之前就存在了。

  • GraphCastScience, 2023):图神经网络中期预报,在 1,380 个检验目标中约 90% 上优于当时 ECMWF 的 HRES 确定性系统,单次 10 天预报可在不到一分钟内完成。它给出了学习型天气模型可以在成熟业务基线上竞争的一组非常清晰的硬指标。
  • GenCastNature, 2025):从确定性预报转向扩散式集合预报,在 1,320 个检验目标中的 97.2% 上超过 ECMWF 集合。我们要的从来不是一个未来,而是一族可能的未来。 这一步比 GraphCast 更重要。
  • WeatherNext 2WeatherNext Cyclones(2025–2026):工程化落地阶段。2026 年 8 月发表于 Nature 的热带气旋模型把三天预报做到原来两天的精度(多出一整天预警时间),与国家飓风中心、英国气象局合作;代码以 Apache 2.0 发布,模型等其他材料以 CC BY 4.0 发布。
  • NeuralGCMNature, 2024):混合路线——保留可微分的动力核心,用神经网络学习部分物理参数化。对于"纯数据驱动模型能否外推到未见气候态"的质疑,它提供了一条很重要的混合建模路线。
  • AuroraNature, 2025):微软的大气基础模型,一个模型同时做天气、空气质量和海浪。
  • WeatherBench 2:这个领域的重要公共基准。它说明了成熟、标准化、可重复的评测基础设施如何提高跨模型比较的可信度。

3.5 数学与算法发现

2025–2026 年变化最剧烈的一块。

  • AlphaProofNature, 2025):将强化学习式证明搜索与 Lean 形式化验证结合,在 IMO 2024 题目上达到银牌级表现。关键不只是生成答案,而是让候选证明接受机器可检验的形式化反馈。
  • AlphaProof Nexus(2026):前沿 LLM + Lean 验证 + 搜索系统,在 353 个开放 Erdős 问题中解决 9 个,并证明 44/492 个 OEIS 猜想;最强系统的单题成本为数百美元量级。值得注意的是,一个更基础的“LLM 生成 ↔ Lean 验证”循环也复现了这 9 个 Erdős 成功案例,只是在最难问题上成本更高——这提示我们重新思考专用搜索系统与通用模型之间的边界,但还不足以证明通用模型会取代专用方法。
  • FunSearchNature, 2024)与 AlphaEvolve(2025):不生成证明,而是让 LLM 演化程序。AlphaEvolve 改进了 4×4 矩阵乘法算法(56 年来首次)并优化了 Google 的数据中心调度。关键在于存在一个强的机器可读评估器:不必问另一个模型"这想法听起来对吗",直接跑一遍看它成不成立。
  • Terence Tao 的博客与访谈:值得长期跟踪的顶尖数学家视角之一。他对 AI 数学结果的逐项讨论,特别适合用来区分“形式上通过验证”与“数学上真正有意义”的贡献。
  • Lean 与 mathlib:为什么数学特别适合出现可验证的 AI 搜索?因为一旦问题被形式化,Lean 可以提供廉价、确定性的逐步检查。形式化本身并不免费,但“候选答案能不能被严格判错”这件事,比很多实验科学便宜得多。这个差异值得推广到其他领域去思考。

3.6 其他值得跟踪的方向

  • 核聚变控制Magnetic control of tokamak plasmas through deep RLNature, 2022),强化学习直接控制真实等离子体。
  • 天文学:引力波检测、系外行星筛选、星系形态分类——数据体量大、标签相对干净,是深度学习最早渗透的自然科学领域之一。
  • 神经科学与连接组学FlyWire 果蝇全脑连接组Nature, 2024),AI 分割 + 人工校对的大规模协作范式。

四、智能体、自主实验室与"AI 科学家"

领域基础模型回答的是关于分子、基因组、材料、物理场的问题。第二类系统操作的对象不同:它们操作科研工作本身。

  • Co-Scientist(DeepMind, Nature 2026)与 Robin(FutureHouse, Nature 2026):两个独立的多智能体系统,同日发表。Co-Scientist 把假设生成从"单次输出"重构成"在想法空间里搜索"——生成、批评、排序、演化。最有说服力的验证来自帝国理工:研究组用它分析一个刚解决但未发表的细菌遗传学问题,它独立给出了正确假设。Robin 则把文献、假设、实验策略、数据分析与后续假设更新串成连续链路;关键物理实验仍由人类执行,结果再回流给系统。
  • Kosmos(Edison Scientific, 2025):攻长程连贯性。Kosmos 单次运行可持续最多 12 小时,通过结构化 world model 协调文献搜索与数据分析;论文报告每次运行可累计约 200 个 agent rollouts、约 4.2 万行代码与约 1,500 篇论文阅读。更值得学的是它如何处理“是不是只是在复述已见结论”的问题:论文报告的七项发现中,有三项独立重现了 Kosmos 运行时未访问的预印本或未发表结果,作者把这类案例用作对记忆与检索泄漏的关键检查。
  • Empirical Research Assistance(DeepMind, Nature 2026):把目标收窄到可评分的 empirical software,通过 LLM 重写代码、tree search 与自动评估迭代寻找更好的科学计算方案。它不是完整的“假设 → 实验”科学家,而是一个更容易客观评分的科研执行系统。
  • The AI Scientistv2(Sakana AI, 2024–2025):端到端自动写论文。争议极大,但作为"完全自动化的上限在哪"的探针有价值。
  • CoscientistNature, 2023)与 ChemCrow:更早的 LLM + 化学工具/机械臂集成,这条线的起点。
  • 自驱动实验室(SDL):优先读 2026 年 Nature Reviews ChemistryThe past, present and future of self-driving laboratories,再回看 2023 年的 Self-Driving Labs 综述 与加拿大 Acceleration Consortium。最新综述把下一阶段的问题归结为三个词:scalability、generalizability、provenance-complete experimentation——硬件可靠性、跨实验室可迁移性和完整实验溯源,正在变成与算法同等重要的瓶颈。

这里有一个值得随身携带的区分:

自动化:自动执行一个预定好的实验。 自主:决定下一个实验该做什么。

第二个才更接近科学发现。

这条线的适用边界也很清楚:评估器可靠且廉价时(代码、数学、部分仿真),AI 可以更激进地扩大搜索;当评估需要长周期合成、动物实验或稀缺大型仪器时,同样的搜索逻辑会被反馈延迟、成本与噪声强烈约束。


五、实践指南:怎么真正做起来

  • Hugging Face 模型生态:ESM、Boltz、部分原子模型与生物基础模型常在 Hugging Face 或各项目官方仓库发布。注意这些模型分布在不同 task / organization 下,并不存在一个完整覆盖 AI4S 的单一筛选标签。
  • DeepChem / ASE / PyTorch Geometric / JAX MD:分别覆盖化学工作流、原子模拟接口、图神经网络、可微分分子动力学。
  • Materials Project / PDB / ERA5 / UniProt:四类非常典型的公共科学数据基础设施。AI4S 的标志性成功往往出现在长期积累、标准较统一的数据已经存在的领域:PDB 对 AlphaFold、ERA5 对学习型天气预报都不是偶然的背景条件。
  • 微调 uMLIP 的实践教程:通用模型在你的具体体系上多半不够准,如何在不灾难性遗忘的前提下微调,是实际项目里最常遇到的工程问题。
  • 工具协议与仪器集成MCP(2024 年 11 月发布)代表了一类让模型以标准接口调用外部数据与工具的开放协议。它可以启发科研软件与仪器的工具层设计,但并不是专门为实验硬件构建的安全协议——真实设备还需要权限、状态、故障恢复、审计与安全联锁等更严格的工程层。

ITERATE

六、评测与基准

AI4S 有一个评测问题。语言模型可以用有已知答案的问题来测;科学发现更难,因为最有意思的那个答案可能还不存在。

在讨论具体基准之前,先建立一张证据地图。AI4S 的证据最好不要压成一个分数,因为“验证有多深”和“验证有多独立”是两件不同的事。

维度 A:Validation depth

深度 证据 它回答什么
1 Benchmark 在固定测试集或既有任务上表现如何?
2 High-fidelity computation 能否通过更高精度计算、形式验证或强评估器?
3 Prospective prediction 能否对尚未测量或未来发生的结果提前做对预测?
4 Physical experiment 能否被真实物理/生物实验测到?
5 Real-world use 是否已经进入真实科研、业务或工程流程并持续产生价值?

维度 B:Evidence independence

状态 含义
Internal 同一团队、同一 pipeline 内完成验证
External benchmark 在外部数据、公开 benchmark 或第三方设定下检验
Independent replication 独立团队或实验室得到相符结果

这两个维度不能互相替代。通过学习到的稳定性模型不等于通过 DFT;通过 DFT 不等于可合成;原团队合成出一个样品也不等于独立实验室已经复现。

例如:MatterGen 已经跨到 Physical experiment,但实验验证主要来自原研究链路;GNoME 的百万量级候选整体主要处于 High-fidelity computation,同时论文报告有 736 个结构与之后独立实验实现相匹配;AlphaFold 则同时拥有长期外部盲测、独立使用与真实科研工作流中的广泛采用。同一项工作的不同子集可以拥有不同证据深度,这正是为什么不应该把它们硬塞进单一的 1–6 等级。

科学推理与知识

  • FrontierScience(2025):面向物理、化学、生物的专家级科学推理 benchmark,包含 Olympiad 与 Research 两个 track。Research 部分刻意采用更接近博士研究工作的多步任务,但官方也明确强调:它仍不覆盖新假设产生、多模态实验和真实物理系统。
  • GPQA:博士级别的物理、化学、生物问答,"Google-proof"设计。Diamond 子集是当前前沿模型的常用标尺。
  • Humanity's Last Exam:跨学科的极难封闭式问答,专为对抗基准饱和而建。
  • FrontierMath:研究级数学问题,题目未公开以防污染。

科研执行能力

  • LAB-BenchBixBench:生物学实际研究任务(文献推理、序列操作、协议排错、数据分析)。
  • MLE-bench / PaperBench / CORE-Bench:分别测试机器学习工程、论文复现、计算复现性。
  • SciCode:从真实论文中提取的科学计算编程任务。

领域专用

  • CASP:蛋白质结构预测的双年盲测,AlphaFold 的成名舞台,也是 AI4S 评测文化的黄金标准。
  • Matbench Discovery:材料稳定性预测,专门设计来暴露 uMLIP 在真实发现流程中的失效模式。
  • WeatherBench 2:天气预报。
  • Virtual Cell Challenge:面向细胞扰动响应预测的公开竞赛与评测任务。

一条反复出现的教训:当某个子领域缺少 CASP 式的盲测、统一基准或独立复现机制时,对“突破”的证据门槛应该更高。 材料与天气在评测基础设施上的差异,是理解不同领域可信度差异的一个好例子。


七、产业与市场分析

  • Isomorphic Labs:Alphabet 旗下、由 Demis Hassabis 创立的 AI-first 药物研发公司,2026 年完成 21 亿美元 B 轮,是“AI4S 能否形成大规模研发与商业价值”最值得跟踪的资本与产业案例之一。
  • Periodic LabsLila SciencesRadical AIOrbital Materials:一批把 AI 与自动化实验、材料/生物数据生成或闭环发现结合起来的新公司。一个正在形成的产业 thesis 是:随着基础模型能力扩散,专有实验数据、实验吞吐量与闭环执行能力可能成为更重要的差异化资产;这仍然是需要时间验证的商业判断。
  • Edison Scientific × Incyte 合作(2026):Incyte 宣布把 Kosmos 用于 discovery 与 development 工作流,首批聚焦 target discovery / validation 与 translational biology。它是值得跟踪的真实企业部署案例,但现在还太早,不宜仅凭合作公告判断实际科研产出。
  • MIT Technology Review: AI for science needs reasoning, not just data(2026):从实验数据质量出发讨论 AI4S 的结构性障碍——很多生物与化学实验会受到细胞系漂移、试剂差异、环境变化等因素影响,难以获得像结构数据库或天气再分析数据那样统一的训练信号。它是理解“为什么 AlphaFold 式成功难以直接复制到所有实验科学”的一个很好视角。
  • Stanford HAI AI IndexState of AI Report:年度数据,都有专门的科学章节。
  • 投入产出的宏观质疑:值得同时读关于"科研生产率长期下降"的经济学文献(如 Bloom et al., Are Ideas Getting Harder to Find?)。AI4S 的一个宏大论证是它能改善这条长期曲线,而目前仍缺乏足够成熟的总量证据来判断这个效果是否已经发生。

八、批评、争议与失败案例

  • GNoME 的"220 万新材料"之争Cheetham & Seshadri(2024)对“新材料”这一表述提出了系统性质疑,重点追问生成结构的化学新颖性、可实现性与“发现”应如何定义。同期围绕 A-Lab 表征结论也出现了类似讨论。核心问题:计算上的“新”不自动等于科学上的“新”。
  • MIT 材料 AI 预印本撤回事件(2025):一篇被广泛引用、声称 AI 工具大幅提升材料科学家生产率的工作,因 MIT 对其数据与结论失去信心而被要求从 arXiv 撤下、并从 QJE 撤回投稿。注意它并非经同行评审发表后的期刊撤稿,而是预印本/投稿阶段的撤回。它一度是"AI 提升科研生产率"最好的实证证据。关于 AI4S 效果的证据本身,也需要接受和科学证据同等的审查。
  • PINN 的性能落差Can Physics-Informed Neural Networks beat the Finite Element Method?(2023)——在很多标准 PDE 问题上,答案是否定的。一个方法在概念上优雅,不等于在工程上有竞争力。
  • 基准污染与记忆:随着训练数据覆盖越来越多的预印本,"模型解决了 X"和"模型读过 X 的答案"越来越难区分。Kosmos 的对照设计和 FrontierMath 的题目保密,都是对这个问题的直接回应。
  • 生物安全微软等团队 2025 年在 Science 的工作显示,生成式蛋白设计可以产生序列变化很大的 proteins of concern 变体,使部分基于序列同源性的核酸合成筛查漏检;研究随后推动了筛查补丁。需要区分:这是筛查逃逸与潜在功能保留风险的证据,不等于这些设计已在实验上被证明具有与原毒素等价的功能。
  • 可复现性与开放性Open and Sustainable AI in the life sciences(2025)系统梳理了 AI4S 论文中权重不公开、数据不可得、环境不可重建导致的信任侵蚀。AlphaFold3 初期不开源引发的风波是这个结构性问题的缩影。

九、里程碑研究结果

不是完整书目,而是“为什么这一项值得留在脑子里”。年份主要用于帮助读者定位技术演进;对于预印本、online-first 与正式卷期跨年的工作,以条目所链接的主要版本为准,不把年份本身当作严格的 bibliographic metadata。

基础与方法

年份 工作 为什么入选
2017 Neural Message Passing for Quantum Chemistry 确立了分子性质预测的 GNN 范式
2019 Physics-Informed Neural Networks "把物理写进损失函数"这条思路的代表作,成败都有教益
2020 Fourier Neural Operator 学的是模拟器而不是模拟结果,为整个学习型仿真开路
2021 Geometric Deep Learning 提供了图、对称性、等变性的统一概念语言
2022 NequIP 证明了等变性可以显著提高数据效率,成为后续等变原子势的重要技术祖先之一

生命科学

年份 工作 为什么入选
2021 AlphaFold2 学习型推理第一次压垮了一个悬置数十年的科学瓶颈
2023 ESMFold / ESM-2 蛋白语言模型证明了不靠 MSA 也能做结构
2023 RFdiffusion 从预测结构转向生成结构,蛋白设计的分水岭
2024 AlphaFold3 把结构预测扩展到复合物,接上了产业需求
2024/26 Evo → Evo 2 把基础模型下沉到基因组序列本身,百万碱基上下文
2025 ESM3 序列、结构、功能的多模态联合建模
2025 BindCraft 在多种靶点上把 de novo binder 的实验命中率显著推高,并把“实验命中率”变成核心能力指标
2026 AlphaGenome 用统一 sequence-to-function 模型覆盖多类调控 readout,并推进非编码变异效应预测

化学与材料

年份 工作 为什么入选
2021 Open Catalyst 2020 用开放数据集与竞赛定义了这个子领域的评测文化
2023 GNoME 模型筛选 + DFT 数据飞轮,把候选搜索与昂贵计算标签连接起来(另见其“发现”争议)
2023 A-Lab 把计算候选、实验计划、机器人合成、XRD 与主动学习接进同一闭环
2023 Coscientist LLM 首次直接驱动化学实验硬件
2024– MatterSim / UMA / GRACE 推动原子势向更广化学空间与更多体系迁移,用更低成本扩大能量/力评估与模拟
2025 MatterGen 从筛选转向按目标性质逆向生成

地球系统

年份 工作 为什么入选
2022/23 FourCastNet / Pangu-Weather 首批证明数据驱动预报可以对标业务系统
2023 GraphCast 在成熟业务基准上给出学习型天气预报可竞争的清晰证据
2024 NeuralGCM 混合路线,回应了"能否外推到未见气候态"的根本质疑
2025 GenCast 从确定性预报转向概率集合,抓住了问题的真实形状
2025 Aurora 一个模型覆盖天气、空气质量、海浪的地球系统基础模型
2026 WeatherNext Cyclones 在 2023–2025 气旋上平均获得约一天以上的预报提前量优势,并公开模型代码与权重

数学与算法

年份 工作 为什么入选
2022 AlphaTensor 搜索出比人类已知更优的矩阵乘法算法
2024 FunSearch 让 LLM 演化程序而非答案,配一个可执行的评估器
2024 AlphaGeometry 神经–符号混合在奥赛几何上达到金牌边缘
2025 AlphaProof 强化学习 + Lean,形式化证明第一次达到奖牌水平
2025 AlphaEvolve 生成器 + 评估器 + 搜索的通用模式,外溢到多个学科
2026 AlphaProof Nexus 解决 9/353 个开放 Erdős 问题;基础的 LLM ↔ Lean 循环也复现了这些成功案例,但成本更高

智能体与自动化

年份 工作 为什么入选
2023 ChemCrow 早期把化学工具链接进 LLM 的范式
2024/25 The AI Scientist / v2 端到端自动化的上限探针,争议本身有价值
2025 Kosmos 长程连贯性,以及一套值得抄的记忆污染对照设计
2026 Co-Scientist 把假设生成变成显式的搜索、辩论与排序过程
2026 Robin 把智能体、实验策略、真实生物测量与后续分析接成连续链路
2026 Empirical Research Assistance 把任务收窄到可评分的 empirical software,使大规模搜索拥有更客观的反馈

物理与其他

年份 工作 为什么入选
2022 Tokamak 等离子体强化学习控制 强化学习直接控制真实物理装置
2024 FlyWire 果蝇全脑连接组 AI 分割 + 人工校对的大规模协作范式

UPDATE

结语:这张地图里的模式

1. 成功高度依赖可靠、标准化、能产生明确反馈的验证器。 数学有 Lean,天气有不断到来的真实未来,蛋白质结构有几十年积累的 PDB、成熟的结构测定和 CASP 盲测。它们的成本并不相同——晶体学一点都不便宜——但共同点是:模型错没错,有相对明确的办法知道。 反过来,材料和细胞生物学的进展之所以争议缠身,正是因为反馈慢、噪声大、缺少公认的裁判。如果你在选 AI4S 的方向,先问"错了多久能知道"。

2. 数据基础设施的价值被系统性低估。 PDB 是全球结构生物学界用几十年逐步积累起来的基础设施,而 AlphaFold 的模型突破发生在更短的时间尺度上。这个时间尺度差异应该改变我们对“下一个 AlphaFold 在哪”的判断——它很可能依赖某个已经长期积累标准化数据、评测与实验真值的领域,而不只是某个新架构。

3. 领域知识正在从「写进架构」迁移到「写进工具、数据、环境与验证器」。 AlphaProof Nexus 里"朴素智能体也解出了全部 9 题、只是更贵"的消融,和材料领域从专用势函数走向通用势函数,指向同一个方向。这不意味着领域知识没用——它只是换了个位置注入。至于通用模型会不会全面取代专用模型,现有证据还撑不起这么大的结论。

4. 循环右半边的候选者明显更少。 在我们选取的 21 项工作里,13 项触及"模型",只有 3 项触及"实验"、2 项触及"反馈"。这是一张人工策展的地图而非文献抽样,但方向性的不对称很难忽略。下一阶段的难题不只在更大的模型,也越来越集中在接口:分子生成器能不能在提出候选之前就懂合成约束?原子势能不能知道自己什么时候越界了?智能体能不能区分"真的新假设"和"只是没被检索到"?自主实验能不能保留足够的溯源信息,让另一间实验室复现?

5. 本文所列的“AI 科学家”系统仍然处在人类定义目标、执行关键实验或承担最终判断的更大闭环里。 2026 年真正值得关注的成果,不是已经出现了完全自主科学家,而是"提出假设—验证—修正"循环正在明显变快。区别很重要:一个能读你数据的模型是好工具;一个能说"去合成这个化合物,我预测它热力学稳定"并且对得足够频繁、值得你押上实验台时间的模型,改变的是发现本身的经济学。后者已经开始出现,但它仍然需要一个人来签字。

长期的机会因此比"帮助科学家的 AI"更大:它是让知识、计算与实验持续互相改进的系统。


如果你有值得补充的工作,或发现文中有需要更正的地方,欢迎告诉我。