AI4S 时间线

一份结构化记录,追踪 AI 如何进入科学工作:从模型与基准,到实验、基础设施、修正与部署。

回路
证据
领域
类型

2026

欧洲提出面向 2040 的材料 AI 协同战略

这项横跨 14 个国家、26 家机构的路线图,试图把材料研究、开发、放大和产业部署接成一条连续链路。

它值得关注的不是又一个模型,而是欧洲正尝试用公共协调和共享基础设施,补上私人科学工厂难以独立承担的规模化环节。

Vision 2040阅读 AI4S Brief →

AlphaGenome Atlas 预计算 90 亿种 DNA 变异效应

这个约 PB 级公共资源把重复的全基因组模型推理转化为可检索基础设施。

更持久的贡献可能是这层公共预测基础设施:预计算把昂贵模型变成研究者可以反复查询的资源。

Google DeepMind阅读 AI4S Brief →

GPT-5.6 Sol 在超导量子芯片上运行实验

一位 MIT 研究者通过 Codex 把模型接入实验室软件,使智能体能够选择参数、操作量子比特测量、分析结果并调整下一次测量。

AI 从编写实验代码进入实时测量闭环;噪声或含混信号也清楚暴露了仍需专家判断的边界。

OpenAI

OpenAI 报告 AI 生成的 Navier–Stokes 解答,同时出现来源争议

OpenAI 称内部模型构造了平滑外力下的有限时间奇点,并给出解析证明与 Lean 形式化,以回答千禧年难题的相应表述。

如果结果经得住独立审查,目标就已从奥赛题和孤立猜想推进到千禧年难题;在这个层级,来源与验证本身就是能力主张的一部分。

OpenAI

OpenAI 称编码智能体已达到自动化研究实习生里程碑

OpenAI 报告智能体已能完成熟练研究人员需要数日的明确任务;截至 8 月中旬,其研究组织每个人类工作日对应使用 3.1 个智能体工作日。

关键证据不是又一项 benchmark,而是智能体已进入真实前沿研究组织的日常生产;但这些效率数据仍由 OpenAI 自行报告。

OpenAI

Claude 完成费马大定理的计算机可检查形式化

Anthropic 报告 Claude 在 11 天内基本自主完成端到端 Lean 形式化,写下 1300 万行代码,并证明最终证明使用的 29500 个中间定理。

这不是新的数学结论;进步在于把庞大的既有证明变成机器可检查对象,并可能降低未来 AI 生成数学结果的核验成本。

Anthropic

Anthropic 扩大科学家优惠使用 Claude 的计划

优惠使用计划从生物学扩展到数学等更多领域。

前沿模型正在成为科研基础设施,其获取与分配开始面对和算力、数据、仪器相似的问题。

Anthropic

Anthropic 预览连接智能体与实验室硬件的通用接口

Model Hardware Standard 提议为仪器控制、状态、测量与错误建立共享接口层。

统一接口有望把一次性的仪器接入变成可复用基础设施,这是自主实验室走向规模化的前提。

Anthropic阅读 AI4S Brief →

Co-Scientist 从假设生成跨入实体实验

这一面向执行的扩展把 Gemini 智能体接入真实实验,包括二维材料的 CVD 流程和生物学预测的湿实验验证。

关键变化是从计算机内提出假设,走向根据实验室约束、实际执行与经验反馈调整研究计划。

arXiv

Google 将 AI Responsibility 团队移出 DeepMind

约 90 人的团队于 9 月初转入 Google Global Affairs,职责覆盖前沿模型风险、CBRN 能力评估、用户行为与聊天机器人心理影响。

这不是裁员,而是一项治理结构实验:把前沿模型风险研究移近政策与政府关系部门,会加强全公司协调,还是削弱独立性与对最新模型的可见度?Google 表示原有任务、人员、算力和 DeepMind 访问将保留,模型行为、隐私与安全团队仍留在实验室。

WSJ

Benchmark 显示智能体只能完成少数完整科学工作流

在六个领域的 97 项任务中,较高的局部得分往往不能转化为完整工作流的完成。

结果提醒我们不能把局部流畅当成完成:有用的科研智能体必须把整条工作流真正做完。

arXiv

Anthropic 报告 Claude 设计的蛋白结合物通过湿实验

外部湿实验合作方在模型辅助设计流程中验证了 15 个靶点中的 14 个。

外部湿实验让它不只是模型演示,也开始检验通用系统能否进入专业蛋白设计流程。

Anthropic

ASI-Bench 测试缺少逐步指导时的自主科研能力

当智能体必须自行选择研究方法,而不是遵循规定步骤时,平均表现大幅下降。

它分离出科学智能体的核心弱点:执行方法相对容易,选择正确方法并判断何时改道更难。

arXiv

Inherent 发布面向论文复现训练的 Faraday 智能体

这家创业公司用 Replica 评测模型完成端到端论文复现任务的能力。

复现是一个有价值的中间目标:比总结论文更难,又比宣称开放式发现更容易检验。

arXiv

Claude 改进黎曼猜想相关的长期数学界限

一款尚未发布的 Claude 研究模型,将黎曼 ζ 函数临界线上零点比例的已知下界从 41.6% 提高到 67.2%,并给出可形式化检查的证明。

与奥赛成绩不同,这是一项在探索未解决问题时产生的新数学结果,但并不等于解决黎曼猜想本身。

Anthropic

WeatherNext Cyclones 将气旋预报提前约一天

Nature 论文报告其气旋路径、强度与风场结构预报达到领先水平,平均获得至少一天的提前量,并可生成最多 1000 个集合成员。

这是少见的强 AI4S 证据:模型既与成熟业务系统比较,预报结果也会持续接受真实天气检验。

Nature

Jeff Dean 离开 Google,创立 Discovery Loop

Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 成立公益公司,目标是自动化科学与工程循环。

这次人才流动把稀缺的系统、模型与科学能力集中到一家以闭合发现循环为目标的独立公司。

Discovery Loop

Demis Hassabis 从 DeepMind CEO 转任 Alphabet 首席科学家

Koray Kavukcuoglu 接手 Google DeepMind 的运营领导,Hassabis 转向更长期的科学方向。

它之所以重要,是因为这家创造多项 AI4S 里程碑的实验室,正把长期科学方向与日常经营权拆开。

Google

FrontierMath 加入 50 道真正未解决的研究问题

Epoch AI 将 benchmark 从答案保密的问题扩展到发布时没有已知解答的研究问题。

它改变了评测问题:不再问模型能否找出隐藏答案,而是能否推进一个尚无答案的问题。

Epoch AI

Flex-Cat 闭合催化剂优化循环,并把结果放大十倍

这座自主实验室在三轮催化剂优化中完成 680 次实验,并把选中的结果从 2 mL 发现尺度转移到 20 mL 反应器。

重要的不只是自主搜索,而是从微型发现实验向更接近工艺条件的尺度转移。

Nature Communications

AlphaProof Nexus 解决开放的 Erdős 问题

语言模型与 Lean 搜索系统报告解决九个开放问题,并给出机器可检查证明。

机器可检查证明使它成为重要一步:目标不再是找回已知答案,而是产生真正的新数学结果。

arXiv

Robin 把假设、实验与下一轮假设连接起来

系统整合文献检索、假设生成、实验策略与数据分析;人类研究者执行实体实验,再把数据交回系统。

它与一次性假设生成器的关键区别在于:实验结果会回到系统中,并改变下一轮提出的假设。

FutureHouse

Evo 2 把百万碱基基因组上下文带入开放基础模型

Evo 2 在 Nature 正式发表,以覆盖所有生命域的约 9 万亿 DNA 碱基对训练,并支持 100 万 token 的上下文窗口。

基因组建模从局部序列效应走向染色体尺度的上下文;可复用的模型与资源,也让这项工作不只是一篇论文。

Nature

Gemini Deep Think 将奥赛能力扩展到多门科学

Google 报告系统在物理、化学奥赛中达到金牌水平,同时提升通用推理成绩。

能力覆盖面扩大值得关注,但边界同样清楚:奥赛成绩证明推理能力,还不能证明自主研究能力。

Google DeepMind

上海人工智能实验室开源 Intern-S1-Pro

这款万亿参数混合专家科学模型每次推理激活 220 亿参数,聚焦科学推理。

它把科学基础模型推进到开放生态竞争中,让能力主张不再只能由单一实验室自证。

Shanghai AI Laboratory

OpenAI 发布科学写作平台 Prism

这套 LaTeX 工作区整合写作、引用与模型辅助,并向 ChatGPT 用户免费开放。

更重要的变化发生在日常科研界面:模型开始影响证据如何被写作、引用和传播。

OpenAI

2025

FrontierScience 暴露考试能力与研究能力之间的差距

OpenAI 报告模型在奥赛式问题上表现很强,但在开放研究任务上的得分明显更低。

真正值得记录的是能力落差:擅长边界清楚的问题,还没有稳定转化为开放式研究能力。

OpenAI

美国启动 Genesis Mission

行政命令要求能源部围绕 AI 驱动的科研挑战连接联邦科学数据、算力与设施。

AI4S 从实验室和公司战略上升为国家基础设施与竞争力项目。

White House

Edison Scientific 从 FutureHouse 商业化拆分

营利性公司被建立用于商业化科学智能体,FutureHouse 继续作为非营利研究机构。

领域开始尝试把公共利益研究与商业部署拆分为不同组织。

FutureHouse

Lila Sciences 完成 3.5 亿美元 A 轮融资

融资使其公布的总资金达到 5.5 亿美元,用于扩大 AI Science Factories 和外部合作。

资本开始围绕闭环实验这一新的算力—数据栈快速聚集。

Lila Sciences

Periodic Labs 以 3 亿美元种子轮融资亮相

来自 OpenAI 与 DeepMind 的研究者成立公司,聚焦 AI 驱动的实体实验和材料发现。

超大规模种子轮显示,投资者开始相信实验基础设施本身可以成为独立 AI 平台。

Periodic Labs

AI 系统达到国际数学奥林匹克金牌水平

OpenAI 与 Google DeepMind 报告其自然语言解题系统达到 IMO 金牌分数线。

数学推理从专用几何和纯形式化流程扩展到更广泛的问题求解。

Google DeepMind

AlphaGenome 预测长 DNA 序列中的调控效应

DeepMind 的模型直接从 DNA 序列预测调控活性与变异效应,把基础模型从结构问题推进到非编码功能。

更难的问题不再只是能否大规模建模序列,而是这些预测在不同生物学背景和前瞻性应用中能否保持可靠。

Google DeepMind

Google 发布 Weather Lab 与实验性气旋模型

系统在业务预报人员参与下,生成最长约两周的 50 条可能气旋路径。

AI 天气预报从回顾性论文走向由真实预报机构共同塑造的实时界面。

Google DeepMind

AI 发现的药物进入随机对照 IIa 期证据

一项随机、双盲 IIa 期试验报告了 rentosertib 的安全性与疗效结果;它是一种由生成式 AI 发现、用于特发性肺纤维化的 TNIK 抑制剂。

当 AI 发现的分子进入人体对照试验,真正关键的证据就变成临床安全性与疗效,而不再是发现模型有多复杂。

Nature Medicine

AlphaEvolve 将生成器—评价器发现循环推广到多类问题

Gemini 生成程序,自动评价器在算法、芯片设计和数据中心调度问题中筛选并演化方案。

只要结果能够低成本自动评价,就可以复用同一种发现模式。

Google DeepMind

FutureHouse 向公众开放科学智能体平台

用于文献检索和科学推理的专用智能体从内部研究进入公共平台。

科学智能体能力从论文结果变成可实际使用的服务。

FutureHouse

Isomorphic Labs 融资 6 亿美元

公司首次外部融资将用于内部肿瘤和免疫项目以及合作药物研发。

从 AlphaFold 走向药物的商业命题在临床验证前就获得大规模外部资本。

Isomorphic Labs

Lila Sciences 获 2 亿美元种子资金,建设 AI Science Factories

Flagship Pioneering 推出一家结合科学模型、自主实验室与新实验数据生成的公司。

资本开始直接投资实验循环本身,而不只是软件模型或药物管线。

Flagship Pioneering

MatterGen 按目标属性生成晶体材料

微软的扩散模型生成稳定无机材料,并对一个生成候选进行了实体合成。

材料 AI 从筛选固定候选转向逆向设计:直接询问什么材料应该存在。

Nature

2024

GenCast 将天气预测推进到概率集合预报

扩散模型生成最长 15 天的集合预报,并在 97.2% 的评测目标上超过 ECMWF ENS。

领域从单一最佳预报转向可用于不确定性决策的未来概率分布。

Google DeepMind

Recursion 完成与 Exscientia 的合并

Exscientia 成为 Recursion 的全资子公司,自动化生物学、化学和临床管线被整合。

AI 原生药物发现进入整合阶段,并开始检验规模能否改善转化经济学。

Recursion

AlphaQubit 改进量子纠错解码

基于 Transformer 的解码器降低 Google Sycamore 实验中的错误,但仍不足以实时运行。

强结果与明确的系统瓶颈同时出现,展示 benchmark 提升与实际部署之间的距离。

Nature

诺贝尔化学奖认可蛋白质设计与 AlphaFold

David Baker 因计算蛋白质设计获得一半奖项;Demis Hassabis 与 John Jumper 因结构预测分享另一半。

AI 驱动的预测与设计获得科学界最高级别的制度认可。

Nobel Prize

诺贝尔物理学奖认可神经网络基础工作

John Hopfield 与 Geoffrey Hinton 因奠定神经网络机器学习基础的工作获奖。

科学制度正式把机器学习基础纳入物理学史。

Nobel Prize

PaperQA2 报告超过专家的科学文献检索表现

FutureHouse 的智能体在特定文献检索任务上超过博士和博士后生物学家,并开放代码。

科学智能体首先处理信息瓶颈,把带引用的检索变成可测量任务。

FutureHouse

AlphaProteo 设计出经实验验证的蛋白结合物

DeepMind 报告在七个靶点上得到成功结合物,包括 VEGF-A,同时第八个靶点未成功。

蛋白生成开始用湿实验命中率和亲和力衡量,而不只是结构是否看起来合理。

Google DeepMind

Recursion 与 Exscientia 宣布合并

两家最受关注的上市 AI 药物发现公司同意进行全股票交易。

当平台承诺面对临床开发的资本强度和漫长周期时,行业开始整合。

Recursion

AlphaProof 与 AlphaGeometry 2 达到 IMO 银牌水平

两套系统取得 42 分中的 28 分,距金牌一分,但部分解答耗时数天而非竞赛规定的数小时。

形式化验证为大规模数学搜索提供了低成本且严格的反馈。

Google DeepMind

AlphaFold 3 将预测扩展到多类生物分子相互作用

模型从蛋白质扩展到包含 DNA、RNA、配体和修饰残基的复合物。

结构预测更接近药物发现所需的相互作用问题,同时受限开放引发科研开放性争议。

Nature

AlphaGeometry 接近奥数金牌水平

神经符号系统在竞赛时间限制内解决 30 道历史奥数几何题中的 25 道。

语言模型生成与符号推理组成了可验证的数学搜索闭环。

Nature

Isomorphic Labs 与礼来、诺华达成研发合作

两项多靶点药物发现合作的潜在总价值接近 30 亿美元,尚不包括版税。

大型药企开始以高额里程碑付款押注 AI-first 药物设计。

Isomorphic Labs

2023

Coscientist 规划并执行化学实验

基于 GPT-4 的多智能体系统检索资料、规划反应、编写控制代码并操作云实验室。

大语言模型从科学文本界面变成真实实验工作流的编排器。

Nature

FunSearch 把语言模型生成与可执行评价器连接起来

系统用自动评价器筛选并演化语言模型生成的程序,既找到新的 cap-set 构造,也改进了装箱启发式算法。

一种可复用的发现模式开始成形:当错误想法能被执行过程低成本、客观地淘汰,模型就可以更大规模地搜索。

Google DeepMind

GNoME 扩大计算预测的稳定材料空间

DeepMind 报告 220 万个候选晶体结构,其中 38 万个进入被认为最稳定的集合。

材料筛选进入工业级规模,同时也让“什么才算发现一种材料”的争论更加尖锐。

Nature

A-Lab 闭合材料合成实验循环

自主实验室在 17 天内运行 353 次实验,实现 57 个目标无机材料中的 36 个。

预测、文献配方、机器人、测量与主动学习第一次被连接成一个物理闭环。

Nature

GraphCast 在大部分指标上超过领先物理天气系统

图神经网络在 1380 个验证目标中的九成以上超过 ECMWF HRES,并在一分钟内生成十日预报。

学习式预报在成熟且持续接受现实检验的评测体系中证明了竞争力。

Science

FutureHouse 成立,目标是构建 AI Scientist

这家由 Schmidt 支持的非营利研究机构开始构建科学智能体,初期聚焦生物学和科学文献。

科学智能体从附属项目变成一家专门研究机构的核心使命。

FutureHouse

AlphaMissense 绘制 7100 万种人类错义变异

模型将大多数可能的错义变异分类为可能良性或致病,远超此前经实验解释的有限集合。

源自 AlphaFold 的表示能力从结构预测进入基因组解释和疾病研究。

Science

RFdiffusion 将蛋白质结构预测推进到蛋白质设计

扩散模型生成新的蛋白质骨架,并对数百个设计进行实验表征。

核心问题从“这段序列是什么结构”转向“我们希望什么样的序列和结构存在”。

Nature

盘古气象大模型挑战传统全球天气预报

华为的三维神经网络在测试中优于 ECMWF 业务系统的确定性预报,运行速度提高一万倍以上。

一个拥有成熟业务评测体系的科学领域,成为生命科学之外最清晰的 AI4S 试验场。

Nature

AlphaDev 发现的排序算法进入 C++ 标准库

强化学习找到更快的底层排序程序,并被加入 LLVM 的 libc++ 实现。

AI 发现的算法从论文进入被大规模开发者使用的基础设施。

Nature

Google 将 Brain 与 DeepMind 合并为 Google DeepMind

Demis Hassabis 领导合并后的部门,Jeff Dean 出任 Google 首席科学家。

人才、算力和模型研发被集中到同一组织,其中也包括多条关键 AI4S 项目线。

Google

2022

Meta 撤下科学语言模型 Galactica 的公开演示

系统生成外观可信的错误论断和虚假引用,公开演示上线三天后被撤下。

它清楚表明:科学语言的流畅,不等于科学上的可靠。

Galactica

ESMFold 绘制超过 6 亿个宏基因组蛋白结构

Meta 使用蛋白质语言模型预测结构,不再依赖 AlphaFold 所需的多序列比对。

蛋白质语言模型提供了速度更快、规模更大的互补结构预测路线。

Science

AlphaTensor 发现新的矩阵乘法算法

强化学习在特定矩阵规模上找到优于长期人类方案的新算法。

科学搜索被转换成带有可执行评价器的游戏,这一模式后来延伸至 AlphaDev 和 AlphaEvolve。

Nature

AlphaFold DB 扩展至超过 2 亿个结构

数据库从约一百万个结构扩展到几乎覆盖所有已编目的蛋白质。

行星级预测规模让蛋白质结构从稀缺结果变成可查询的生物学底层资源。

Google DeepMind

强化学习系统开始控制托卡马克等离子体

一个神经网络控制瑞士 TCV 反应堆的磁场线圈,并维持复杂等离子体形态。

AI 从离线预测跨入对真实科学装置的直接控制。

Nature

2021

Alphabet 成立 Isomorphic Labs

由 Demis Hassabis 领导的新公司成立,尝试以 AI-first 方式重构药物发现。

AlphaFold 的科学成功开始转化为面向治疗研发的独立商业组织。

Isomorphic Labs

AlphaFold 蛋白质结构数据库上线

首个版本提供约 35 万个可检索的预测结构,包括人类蛋白质组。

模型推理被预先计算成公共资源,研究者无需自行运行模型即可使用。

EMBL-EBI

AlphaFold 2 论文发表并开放源代码

CASP14 结果背后的架构、代码和方法正式向科研社区开放。

这项突破开始从一次演示变成可共享的科研基础设施。

Nature

2020

AlphaFold 2 在 CASP14 改写蛋白质结构预测

DeepMind 在 CASP 盲测中报告了接近实验结构精度的预测结果。

一个延续数十年的科学瓶颈,开始变成可处理的学习推理问题。

Google DeepMind