欧洲提出面向 2040 的材料 AI 协同战略
这项横跨 14 个国家、26 家机构的路线图,试图把材料研究、开发、放大和产业部署接成一条连续链路。
它值得关注的不是又一个模型,而是欧洲正尝试用公共协调和共享基础设施,补上私人科学工厂难以独立承担的规模化环节。
AI FOR SCIENCE · EVENTS
一份结构化记录,追踪 AI 如何进入科学工作:从模型与基准,到实验、基础设施、修正与部署。
这项横跨 14 个国家、26 家机构的路线图,试图把材料研究、开发、放大和产业部署接成一条连续链路。
它值得关注的不是又一个模型,而是欧洲正尝试用公共协调和共享基础设施,补上私人科学工厂难以独立承担的规模化环节。
这个约 PB 级公共资源把重复的全基因组模型推理转化为可检索基础设施。
更持久的贡献可能是这层公共预测基础设施:预计算把昂贵模型变成研究者可以反复查询的资源。
一位 MIT 研究者通过 Codex 把模型接入实验室软件,使智能体能够选择参数、操作量子比特测量、分析结果并调整下一次测量。
AI 从编写实验代码进入实时测量闭环;噪声或含混信号也清楚暴露了仍需专家判断的边界。
OpenAI 称内部模型构造了平滑外力下的有限时间奇点,并给出解析证明与 Lean 形式化,以回答千禧年难题的相应表述。
如果结果经得住独立审查,目标就已从奥赛题和孤立猜想推进到千禧年难题;在这个层级,来源与验证本身就是能力主张的一部分。
OpenAI 报告智能体已能完成熟练研究人员需要数日的明确任务;截至 8 月中旬,其研究组织每个人类工作日对应使用 3.1 个智能体工作日。
关键证据不是又一项 benchmark,而是智能体已进入真实前沿研究组织的日常生产;但这些效率数据仍由 OpenAI 自行报告。
Anthropic 报告 Claude 在 11 天内基本自主完成端到端 Lean 形式化,写下 1300 万行代码,并证明最终证明使用的 29500 个中间定理。
这不是新的数学结论;进步在于把庞大的既有证明变成机器可检查对象,并可能降低未来 AI 生成数学结果的核验成本。
优惠使用计划从生物学扩展到数学等更多领域。
前沿模型正在成为科研基础设施,其获取与分配开始面对和算力、数据、仪器相似的问题。
Model Hardware Standard 提议为仪器控制、状态、测量与错误建立共享接口层。
统一接口有望把一次性的仪器接入变成可复用基础设施,这是自主实验室走向规模化的前提。
这一面向执行的扩展把 Gemini 智能体接入真实实验,包括二维材料的 CVD 流程和生物学预测的湿实验验证。
关键变化是从计算机内提出假设,走向根据实验室约束、实际执行与经验反馈调整研究计划。
约 90 人的团队于 9 月初转入 Google Global Affairs,职责覆盖前沿模型风险、CBRN 能力评估、用户行为与聊天机器人心理影响。
这不是裁员,而是一项治理结构实验:把前沿模型风险研究移近政策与政府关系部门,会加强全公司协调,还是削弱独立性与对最新模型的可见度?Google 表示原有任务、人员、算力和 DeepMind 访问将保留,模型行为、隐私与安全团队仍留在实验室。
在六个领域的 97 项任务中,较高的局部得分往往不能转化为完整工作流的完成。
结果提醒我们不能把局部流畅当成完成:有用的科研智能体必须把整条工作流真正做完。
外部湿实验合作方在模型辅助设计流程中验证了 15 个靶点中的 14 个。
外部湿实验让它不只是模型演示,也开始检验通用系统能否进入专业蛋白设计流程。
当智能体必须自行选择研究方法,而不是遵循规定步骤时,平均表现大幅下降。
它分离出科学智能体的核心弱点:执行方法相对容易,选择正确方法并判断何时改道更难。
这家创业公司用 Replica 评测模型完成端到端论文复现任务的能力。
复现是一个有价值的中间目标:比总结论文更难,又比宣称开放式发现更容易检验。
一款尚未发布的 Claude 研究模型,将黎曼 ζ 函数临界线上零点比例的已知下界从 41.6% 提高到 67.2%,并给出可形式化检查的证明。
与奥赛成绩不同,这是一项在探索未解决问题时产生的新数学结果,但并不等于解决黎曼猜想本身。
Nature 论文报告其气旋路径、强度与风场结构预报达到领先水平,平均获得至少一天的提前量,并可生成最多 1000 个集合成员。
这是少见的强 AI4S 证据:模型既与成熟业务系统比较,预报结果也会持续接受真实天气检验。
Dean 与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 成立公益公司,目标是自动化科学与工程循环。
这次人才流动把稀缺的系统、模型与科学能力集中到一家以闭合发现循环为目标的独立公司。
Koray Kavukcuoglu 接手 Google DeepMind 的运营领导,Hassabis 转向更长期的科学方向。
它之所以重要,是因为这家创造多项 AI4S 里程碑的实验室,正把长期科学方向与日常经营权拆开。
Epoch AI 将 benchmark 从答案保密的问题扩展到发布时没有已知解答的研究问题。
它改变了评测问题:不再问模型能否找出隐藏答案,而是能否推进一个尚无答案的问题。
这座自主实验室在三轮催化剂优化中完成 680 次实验,并把选中的结果从 2 mL 发现尺度转移到 20 mL 反应器。
重要的不只是自主搜索,而是从微型发现实验向更接近工艺条件的尺度转移。
语言模型与 Lean 搜索系统报告解决九个开放问题,并给出机器可检查证明。
机器可检查证明使它成为重要一步:目标不再是找回已知答案,而是产生真正的新数学结果。
系统整合文献检索、假设生成、实验策略与数据分析;人类研究者执行实体实验,再把数据交回系统。
它与一次性假设生成器的关键区别在于:实验结果会回到系统中,并改变下一轮提出的假设。
Nature 论文报告多项生物医学案例,并对多智能体系统生成的假设进行实验跟进。
同行评审和实验跟进让最初的产品预览变得更可检查,但仍不足以证明广泛的自主科研能力。
Evo 2 在 Nature 正式发表,以覆盖所有生命域的约 9 万亿 DNA 碱基对训练,并支持 100 万 token 的上下文窗口。
基因组建模从局部序列效应走向染色体尺度的上下文;可复用的模型与资源,也让这项工作不只是一篇论文。
Google 报告系统在物理、化学奥赛中达到金牌水平,同时提升通用推理成绩。
能力覆盖面扩大值得关注,但边界同样清楚:奥赛成绩证明推理能力,还不能证明自主研究能力。
这款万亿参数混合专家科学模型每次推理激活 220 亿参数,聚焦科学推理。
它把科学基础模型推进到开放生态竞争中,让能力主张不再只能由单一实验室自证。
这套 LaTeX 工作区整合写作、引用与模型辅助,并向 ChatGPT 用户免费开放。
更重要的变化发生在日常科研界面:模型开始影响证据如何被写作、引用和传播。
OpenAI 报告模型在奥赛式问题上表现很强,但在开放研究任务上的得分明显更低。
真正值得记录的是能力落差:擅长边界清楚的问题,还没有稳定转化为开放式研究能力。
行政命令要求能源部围绕 AI 驱动的科研挑战连接联邦科学数据、算力与设施。
AI4S 从实验室和公司战略上升为国家基础设施与竞争力项目。
营利性公司被建立用于商业化科学智能体,FutureHouse 继续作为非营利研究机构。
领域开始尝试把公共利益研究与商业部署拆分为不同组织。
融资使其公布的总资金达到 5.5 亿美元,用于扩大 AI Science Factories 和外部合作。
资本开始围绕闭环实验这一新的算力—数据栈快速聚集。
来自 OpenAI 与 DeepMind 的研究者成立公司,聚焦 AI 驱动的实体实验和材料发现。
超大规模种子轮显示,投资者开始相信实验基础设施本身可以成为独立 AI 平台。
OpenAI 与 Google DeepMind 报告其自然语言解题系统达到 IMO 金牌分数线。
数学推理从专用几何和纯形式化流程扩展到更广泛的问题求解。
DeepMind 的模型直接从 DNA 序列预测调控活性与变异效应,把基础模型从结构问题推进到非编码功能。
更难的问题不再只是能否大规模建模序列,而是这些预测在不同生物学背景和前瞻性应用中能否保持可靠。
系统在业务预报人员参与下,生成最长约两周的 50 条可能气旋路径。
AI 天气预报从回顾性论文走向由真实预报机构共同塑造的实时界面。
一项随机、双盲 IIa 期试验报告了 rentosertib 的安全性与疗效结果;它是一种由生成式 AI 发现、用于特发性肺纤维化的 TNIK 抑制剂。
当 AI 发现的分子进入人体对照试验,真正关键的证据就变成临床安全性与疗效,而不再是发现模型有多复杂。
Gemini 生成程序,自动评价器在算法、芯片设计和数据中心调度问题中筛选并演化方案。
只要结果能够低成本自动评价,就可以复用同一种发现模式。
用于文献检索和科学推理的专用智能体从内部研究进入公共平台。
科学智能体能力从论文结果变成可实际使用的服务。
公司首次外部融资将用于内部肿瘤和免疫项目以及合作药物研发。
从 AlphaFold 走向药物的商业命题在临床验证前就获得大规模外部资本。
Flagship Pioneering 推出一家结合科学模型、自主实验室与新实验数据生成的公司。
资本开始直接投资实验循环本身,而不只是软件模型或药物管线。
基于 Gemini 的多智能体系统生成、批评、排名和演化假设,合作团队对部分生物医学提议进行实验。
假设生成从一次语言模型回答变成显式搜索过程。
微软的扩散模型生成稳定无机材料,并对一个生成候选进行了实体合成。
材料 AI 从筛选固定候选转向逆向设计:直接询问什么材料应该存在。
扩散模型生成最长 15 天的集合预报,并在 97.2% 的评测目标上超过 ECMWF ENS。
领域从单一最佳预报转向可用于不确定性决策的未来概率分布。
Exscientia 成为 Recursion 的全资子公司,自动化生物学、化学和临床管线被整合。
AI 原生药物发现进入整合阶段,并开始检验规模能否改善转化经济学。
基于 Transformer 的解码器降低 Google Sycamore 实验中的错误,但仍不足以实时运行。
强结果与明确的系统瓶颈同时出现,展示 benchmark 提升与实际部署之间的距离。
David Baker 因计算蛋白质设计获得一半奖项;Demis Hassabis 与 John Jumper 因结构预测分享另一半。
AI 驱动的预测与设计获得科学界最高级别的制度认可。
John Hopfield 与 Geoffrey Hinton 因奠定神经网络机器学习基础的工作获奖。
科学制度正式把机器学习基础纳入物理学史。
FutureHouse 的智能体在特定文献检索任务上超过博士和博士后生物学家,并开放代码。
科学智能体首先处理信息瓶颈,把带引用的检索变成可测量任务。
DeepMind 报告在七个靶点上得到成功结合物,包括 VEGF-A,同时第八个靶点未成功。
蛋白生成开始用湿实验命中率和亲和力衡量,而不只是结构是否看起来合理。
两家最受关注的上市 AI 药物发现公司同意进行全股票交易。
当平台承诺面对临床开发的资本强度和漫长周期时,行业开始整合。
两套系统取得 42 分中的 28 分,距金牌一分,但部分解答耗时数天而非竞赛规定的数小时。
形式化验证为大规模数学搜索提供了低成本且严格的反馈。
模型从蛋白质扩展到包含 DNA、RNA、配体和修饰残基的复合物。
结构预测更接近药物发现所需的相互作用问题,同时受限开放引发科研开放性争议。
神经符号系统在竞赛时间限制内解决 30 道历史奥数几何题中的 25 道。
语言模型生成与符号推理组成了可验证的数学搜索闭环。
两项多靶点药物发现合作的潜在总价值接近 30 亿美元,尚不包括版税。
大型药企开始以高额里程碑付款押注 AI-first 药物设计。
基于 GPT-4 的多智能体系统检索资料、规划反应、编写控制代码并操作云实验室。
大语言模型从科学文本界面变成真实实验工作流的编排器。
系统用自动评价器筛选并演化语言模型生成的程序,既找到新的 cap-set 构造,也改进了装箱启发式算法。
一种可复用的发现模式开始成形:当错误想法能被执行过程低成本、客观地淘汰,模型就可以更大规模地搜索。
DeepMind 报告 220 万个候选晶体结构,其中 38 万个进入被认为最稳定的集合。
材料筛选进入工业级规模,同时也让“什么才算发现一种材料”的争论更加尖锐。
自主实验室在 17 天内运行 353 次实验,实现 57 个目标无机材料中的 36 个。
预测、文献配方、机器人、测量与主动学习第一次被连接成一个物理闭环。
图神经网络在 1380 个验证目标中的九成以上超过 ECMWF HRES,并在一分钟内生成十日预报。
学习式预报在成熟且持续接受现实检验的评测体系中证明了竞争力。
这家由 Schmidt 支持的非营利研究机构开始构建科学智能体,初期聚焦生物学和科学文献。
科学智能体从附属项目变成一家专门研究机构的核心使命。
模型将大多数可能的错义变异分类为可能良性或致病,远超此前经实验解释的有限集合。
源自 AlphaFold 的表示能力从结构预测进入基因组解释和疾病研究。
扩散模型生成新的蛋白质骨架,并对数百个设计进行实验表征。
核心问题从“这段序列是什么结构”转向“我们希望什么样的序列和结构存在”。
华为的三维神经网络在测试中优于 ECMWF 业务系统的确定性预报,运行速度提高一万倍以上。
一个拥有成熟业务评测体系的科学领域,成为生命科学之外最清晰的 AI4S 试验场。
强化学习找到更快的底层排序程序,并被加入 LLVM 的 libc++ 实现。
AI 发现的算法从论文进入被大规模开发者使用的基础设施。
Demis Hassabis 领导合并后的部门,Jeff Dean 出任 Google 首席科学家。
人才、算力和模型研发被集中到同一组织,其中也包括多条关键 AI4S 项目线。
系统生成外观可信的错误论断和虚假引用,公开演示上线三天后被撤下。
它清楚表明:科学语言的流畅,不等于科学上的可靠。
Meta 使用蛋白质语言模型预测结构,不再依赖 AlphaFold 所需的多序列比对。
蛋白质语言模型提供了速度更快、规模更大的互补结构预测路线。
强化学习在特定矩阵规模上找到优于长期人类方案的新算法。
科学搜索被转换成带有可执行评价器的游戏,这一模式后来延伸至 AlphaDev 和 AlphaEvolve。
数据库从约一百万个结构扩展到几乎覆盖所有已编目的蛋白质。
行星级预测规模让蛋白质结构从稀缺结果变成可查询的生物学底层资源。
一个神经网络控制瑞士 TCV 反应堆的磁场线圈,并维持复杂等离子体形态。
AI 从离线预测跨入对真实科学装置的直接控制。
由 Demis Hassabis 领导的新公司成立,尝试以 AI-first 方式重构药物发现。
AlphaFold 的科学成功开始转化为面向治疗研发的独立商业组织。
首个版本提供约 35 万个可检索的预测结构,包括人类蛋白质组。
模型推理被预先计算成公共资源,研究者无需自行运行模型即可使用。
CASP14 结果背后的架构、代码和方法正式向科研社区开放。
这项突破开始从一次演示变成可共享的科研基础设施。
DeepMind 在 CASP 盲测中报告了接近实验结构精度的预测结果。
一个延续数十年的科学瓶颈,开始变成可处理的学习推理问题。