AI FOR SCIENCE · ARGUMENTS

AI4S Commentary

追踪 AI for Science 中值得持续阅读的论证:从第一现场,到技术质疑与正式的科学交锋。

视图
领域
回路
议题
声音

近期论证

按日期更新,收录此刻值得追踪的主张、解释与质疑。

36 / 36

2026

Anthropic Just Gave AI Agents a Driver for Your Lab Instruments

主张标准化实验室接口会显著降低 agent 操作仪器的门槛,但 API access 不会自动赋予它对物理状态与安全操作的理解。

为什么读推荐从 Genentech 的泡沫故障读起:软件调用完全正确,实验在物理世界里却出了错。它把下一道瓶颈说得非常具体。

Scientific Creativity through Analogical Reasoning, Virtual Labs, and the Physics of Agents

主张真正有用的 AI scientist 需要非显然类比、有效分歧和对环境动力学的建模,而不只是语言空间里的流畅推理。

为什么读Zou 把问题从 agent 能否执行流程,推进到它能否产生让新科学真正开始的那种分歧。

Measuring the Frontier of Scientific Capability in the Age of AI

主张AI scientist 应该在可交互的隐藏世界里接受评测,观察证据能否改变假设,而不是只做静态问答。

为什么读这是最清楚的下一步建设提案之一:有限预算、真实反馈,以及能看见 agent 是否真的更新判断的完整轨迹。

AI & CBRN Risks

主张AI 风险取决于它改变了威胁路径中的哪一步,因此 CBRN 评估必须画出具体流程与物理瓶颈,而不能只计算信息增量。

为什么读建议在 Olvera 之后读。前者说物理门槛仍高,这篇追问 AI 会降低哪一道具体门槛;争论的其实是干预点在哪里。

与这篇对读 · 阅读顺序 2/2 AI Can Help Plan a Bioweapon. Building One Is Still Hard.

为什么一起读: 两篇从同一个事实出发:把想法变成物理现实很难。对读才能看见,同一道瓶颈如何同时限制科学收益与危害能力。

本期交锋全部交锋

AI Agents Can’t Yet Do Open-Ended AI Research

主张很强的 benchmark 分数还没有迁移到开放式研究,因为选题、判断和改变方向本身就是任务的一部分。

为什么读两位作者的方法比结论更值得学:逐条追问亮眼数字怎样得到、脚手架贡献了多少、agent 到底独立选择了什么。

Conjecture Machines

主张如果 agent 让假设变得廉价,验证、agent-ready data 与 peer review 就会成为新的科学瓶颈。

为什么读少数具体回答“下一步该建什么”的文章:当想法不再稀缺,资助者与科研机构该如何重新配置能力。

Why I Left Google DeepMind

主张当内部激励让异议代价高昂、外部问责又很弱时,公开的负责任 AI 承诺可能失去实际作用。

为什么读它的价值不在中立,而在具体。Turner 明确区分了公开证据与读者无法独立核实的私人交流。

AI Can Help Plan a Bioweapon. Building One Is Still Hard.

主张信息获取不是生物武器的决定性瓶颈;湿实验隐性知识与物理执行仍主导从想法到危害的路径。

为什么读这个论证与 AI4S 乐观论证互为镜像:把想法变成物理现实的困难,同时限制危害与科学收益。

与这篇对读 · 阅读顺序 1/2 AI & CBRN Risks

为什么一起读: 两篇从同一个事实出发:把想法变成物理现实很难。对读才能看见,同一道瓶颈如何同时限制科学收益与危害能力。

RLVR Might Be Disproportionately Bad at Science

主张RLVR 在数学与代码上奏效,是因为 verifier 廉价且可靠;大多数重要科学问题并不具备这个条件。

为什么读这是对“数学和代码行,所以科学也行”最直接的反驳。决定成败的可能不是规模,而是评估器是否存在。

Science Needs AI Data Stocktakes

主张如果不先盘点有哪些科学数据、由谁控制、机器能否真正使用,政府就无法有效规划 AI for science。

为什么读它没有模型发布那么显眼,却非常具体地指出了许多能力主张所依赖、但尚未建设的公共基础设施。

2025

2024

Machines of Loving Grace

主张强大的 AI 可能把五十到一百年的生物医学进展压缩到五到十年。

为什么读这是被引用最多的乐观主张,也把赌注押在了可检验的位置:瓶颈究竟在想法,还是实验吞吐、试验周期与监管?

Open Letter on AlphaFold 3 Reproducibility

主张一篇高影响力方法论文若不提供可运行代码,就难以满足科学发表应有的可复现标准,尤其当成果来自企业实验室时。

为什么读它检验的是期刊规范还能否约束前沿企业研究。AlphaFold 3 后来公开代码,让这场争论产生了实质后果,而不只是象征性抗议。

Response to ‘The Perpetual Motion Machine of AI-Generated Data…’

主张全基因组测序的成本曲线可能很快产生巨大规模的数据,从而削弱“生物数据会持续稀缺”这个前提。

为什么读建议第二篇读。它接受 Listgarten 的大部分论证,却直接攻击其中一个前提;两篇短文构成了一场干净的争论。

为什么一起读: Listgarten 认为科学受限于经验数据;Noble 接受这个框架,却质疑基因组学是否会持续缺数据。两篇应当对读,因为分歧最终落在一条未来可以测量的数据增长曲线上。

Artificial Intelligence Driving Materials Discovery?

主张如果缺少合成专长与验证,GNoME 提议的结构很少能同时满足新颖、可信与有用。

为什么读核心争点是计算语境与实验语境里的“发现”根本不是一回事;后来自动化实验室的更正又回到了同一条边界。

Challenges in High-Throughput Inorganic Materials Prediction and Autonomous Synthesis

主张对 A-Lab 全部产物的重新检查发现了系统性的衍射分析与新颖性问题,因此原始证据并未证明发现了 43 种科学意义上的新材料。

为什么读这是整份档案里最硬的一次外部核查:依据的是原作者的衍射数据,而不是立场或预测。后来的更正采用了同一个区分,即“对平台新”不等于“对科学新”。

The Perpetual Motion Machine of AI-Generated Data and the Distraction of ChatGPT as a ‘Scientist’

主张科学的根本瓶颈是数据而不是模型,用 AI 生成合成数据不能创造缺失的经验信息。

为什么读建议第一篇读。这是整页最精炼的怀疑论,也解释了为什么蛋白折叠可能是异类,而不是其他学科的模板。

为什么一起读: Listgarten 认为科学受限于经验数据;Noble 接受这个框架,却质疑基因组学是否会持续缺数据。两篇应当对读,因为分歧最终落在一条未来可以测量的数据增长曲线上。

2023

2022

A Vision of Metascience

主张科研制度可以被主动设计与检验,从而让发现生态学会改进自身的社会过程。

为什么读它回答了廉价假设带来的问题:注意力、资金与实验产能会变成分配难题,而模型本身无法解决。

2021

2020

AlphaFold2 @ CASP14: ‘It Feels Like One’s Child Has Left Home.’

主张AlphaFold2 不是一次常规增量,它实际上终结了单链蛋白结构预测作为竞赛问题的时代。

为什么读整份档案最值得先读的一篇。作者自己的部分研究方向因此被淘汰,却仍是最早不打折扣承认其分量的人之一。

与这篇对读 · 阅读顺序 2/2 AlphaFold @ CASP13: ‘What Just Happened?’

为什么一起读: 第一篇记录 AlphaFold2 之前,AlphaFold 看起来仍无法解决什么;第二篇则记录 CASP14 之后,这个判断需要多快地被改写。

Transparency and Reproducibility in Artificial Intelligence

主张临床 AI 的结果再漂亮,如果缺少代码与方法细节、无法接受独立检验与学习,其科学价值就会受损。

为什么读这是 AI4S 时代第一场按期刊规则打完全程的对质。质疑、答辩与补充方法说明:争论的终点应该是可检查的材料,而不是各自表态。

为什么一起读: 质疑追问不可检查的结果还剩多少科学价值;回应与同日 Addendum 则让读者判断,期刊压力能否把异议转化为新增材料。

Reply to: Transparency and Reproducibility in Artificial Intelligence

主张临床限制与受保护数据可能阻止完全公开,但模型仍可接受评估,方法也可以变得显著更可检查。

为什么读建议第二篇读,并同时查看同日 Addendum。它的价值不是让所有异议消失,而是让交锋真正补出了更多实验细节。

与这篇对读 · 阅读顺序 2/2 Transparency and Reproducibility in Artificial Intelligence

为什么一起读: 质疑追问不可检查的结果还剩多少科学价值;回应与同日 Addendum 则让读者判断,期刊压力能否把异议转化为新增材料。

2019

The Bitter Lesson

主张能随算力扩展的通用方法,长期会胜过围绕人类知识与手工结构构建的路线。

为什么读AI4S 的架构争论总会回到这里,但要看清适用边界:Sutton 的历史证据来自数据充足的领域,而科学往往最缺数据。

2018

AlphaFold @ CASP13: ‘What Just Happened?’

主张AlphaFold 在 CASP13 的第一次突破令人印象深刻,但仍可理解为既有学术轨迹里的正常进展。

为什么读建议在 2020 那篇之前读。观察同一个人在两年内如何修正自己的判断,比任何回顾性叙述都更有说服力。

为什么一起读: 第一篇记录 AlphaFold2 之前,AlphaFold 看起来仍无法解决什么;第二篇则记录 CASP14 之后,这个判断需要多快地被改写。