AI4S.fyi Evidence Framework
我们怎样理解 AI for Science
最难的问题,不是 AI 能不能做出一次预测,而是一个科学系统能不能从现实世界中学习。
THE LOOP
一轮科学学习,需要完成四个动作
理解我们已经知道什么
这里包含两种不同的能力。读懂已有科学记录,是从论文、图表与数据库中恢复原意;建模真实系统,则是根据已有观测,对还没发生或没见过的状态作出预测。
选择下一步
候选通常远多于实验预算。好的决策系统不只给出一个高分答案,还要说明为什么下一美元、下一小时或下一次实验应该花在这里。
测试现实
模拟和代理指标可以筛选候选,但新的科学证据往往要等到合成、执行与测量之后才出现。测量本身也可能带来噪声、漂移和失败。
从结果学习
闭环只有在新观测真正改变了模型或下一次选择时才成立。更严格的要求是:系统还要证明这种改变让下一轮变得更好。
STRESS TESTS
一个看起来不错的结果,可能怎样失效
It works—until the setting changes.
Generalization换一种材料、分子、实验室或数据分布,结果还成立吗?
It looks convincing—but the evidence may be weak.
Trust预测是否对应现实?测量能否校准、复查和重复?
It works once—but not at useful scale.
Scale吞吐量、失败率、时间与单位成本,是否允许系统持续运行?
Every component works—but the system does not.
Integration模型、软件、仪器、自动化与人工例外,能否真的连成一条稳定流程?
EVIDENCE
并不是所有证据,都以同样方式接触现实
- 01
回顾性或模拟
使用已有数据或模拟环境。适合比较方法,但容易把数据集本身当成现实。
- 02
前瞻性计算
答案还未知时先作预测,随后再揭晓结果。它减少了事后挑选,但仍可能只依赖计算代理指标。
- 03
实体实验
真实制备、测量或临床观察,让主张直接接受物理世界检验。
- 04
闭环实验
实验结果返回系统,并改变下一轮模型或实验选择。
- 05
现场与生产使用
系统进入真实科研、临床或工业流程,面对长期运行、失败恢复与实际成本。
更接近现实,不自动意味着结论就正确;它只是让系统面对了不同、通常更难的失败方式。
AGENCY
真正完成工作的是谁?
“AI 发现了”常常把多种角色压成一句话。区分它们,才能判断自主性究竟走到了哪里。
人设定问题、约束与成功标准,并处理模糊结果。
模型提出假设、预测结果或选择下一步。
机器人和软件按既定流程执行任务。
人、模型与自动化共同完成决策和执行。
CLAIMS
科学主张会随着证据改变
我们不会把整篇论文简单标成“正确”或“错误”。重要主张需要单独追踪,并在新证据出现时更新。
CANON
Canon 不等于“最好的论文”
一项工作之所以成为 Canon,可能是因为今天的研究者无法绕过它来解释方法、验证标准、失败或争议。它不是荣誉榜;一个 Canon 主张以后仍然可能被修正,甚至被推翻。
THE LIBRARY
这个资料库会怎样变化
值得继续观察。
正在改变领域。
理解证据链时绕不过去。
不再活跃,但保留历史。
CONTEXT
科学从来不发生在真空里
资金、机构、政策与基础设施,决定了哪些科学问题会被追问、哪些系统能被建成。我们同时记录这些背景,也把它们与“某项科学能力是否真的有效”的证据分开阅读。
我们最终想看到什么?
AI 能否从理解已知知识,走到选择下一次实验,再从现实反馈中学习——并且可靠到足以真正改变科学研究的方式?
查看最新证据 →