Frontier question · Model systems
实验数据能不能成为比模型更持久的护城河?
AI4S.fyi 综述 · 当前答案
实验数据可能形成长期优势,但“独家拥有”不等于“难以替代”。
它是否改善关键任务、竞争者能否重新获取,以及平台能否持续产生有用的新数据,比现有数据量更重要。模型、数据、平台和团队经验也可能相互增强。
更新于 2026-09-10。 本页横向比较四类资产,不预设固定的衰减顺序。受访者观点和开源选择说明战略判断,但不等于独立验证长期商业结果。
为什么重要
真正持久的资产究竟是模型、数据、仪器平台还是运营经验,决定了这些公司应该把资本投向哪里——也决定了一个外部观察者该如何解读一次开源发布。当一家公司把模型送出去时,它要么是慷慨,要么是在告诉你它认为价值不在那里。
四类候选资产的横向比较 · 共 9 条
最快
模型本身
2 条关键
1 条佐证
1 条佐证
专有数据
2 条关键
1 条佐证
1 条佐证
物理平台
2 条关键
1 条佐证
1 条佐证
运营经验
1 条关键
0 条佐证
0 条佐证
最慢
条数不等于分量。这个排序是从访谈里提炼出的一个假设,不是被测量出来的结果——而这个排序本身,正是分歧所在。
资产一 · 最快商品化
模型本身
权重、架构,以及它们所编码的能力。
当前判断Radical 的开源行动证明其战略选择,不证明模型必然最快商品化;Lila 对模型价值的强调也仍是公司自述。
置信度:中等 · 2 条直接互相矛盾的关键证据
关键证据
Radical AI ——「模型不是护城河,实验才是」
对本问题的意义
Krause 预计模型会商品化,并据此开源了 TorchSim、MATRIX 和 LitXBench——TorchSim 后来被独立成了一个非营利组织。这是本页最强的一条证据,恰恰因为它是一个有代价的信号:公司把本可以留着的东西送了出去。
不能证明
按一个信念行动,不等于那个信念正确。叠加在公开模型之上的专有实验数据并未释出,所以这个主张无法从外部检验。
Lila Sciences ——「模型本身才是有价值的东西」
对本问题的意义
正面矛盾,而且来自三家里估值最高的一家。Lila 把实验平台描述为喂养模型的"token 生成器",也就是让数据成为手段、模型成为目的——这与 Radical 的立场正好互为倒置。
不能证明
没有任何公开材料检验过其中任一立场。两家描述的都是赌注,不是结果。
本资产的其他证据
1 条 · 佐证
- 2026.02CuspAI 访谈 —— Welling 预计五年内多数模型会开源,可能留下一两个专有例外证词数据
资产二
专有实验数据
公司自己拥有、别人没有的测量。
当前判断OpenBind-0 支持数据覆盖的科学价值,但不能直接证明专有数据的商业护城河。复制成本、持续供给、使用权和替代性也很重要。
置信度:低到中等 · 2 条关键证据
关键证据
OpenBind-0
对本问题的意义
717 个新实验结构,收益集中在那些改变了训练覆盖的地方。这是最干净的一次公开演示:数据资产的价值在于它覆盖了哪些区域,而不在于它有多大——这意味着数据护城河可以又深又窄,而一个覆盖不同区域的竞争者不是落后,只是在别处。
不能证明
2021–2025 的模型对比并非完全受控,而且"识别缺口 → 采下一批数据"这个回路没有闭合。
Lila Sciences —— 10 万亿条验证过的推理轨迹
对本问题的意义
这个领域里被宣称的最大数据资产,也是最无法被检查的一个:真实物理实验、模拟、模型生成的工具轨迹三者的占比未披露,去重方式也未披露。如果数据护城河真的存在,这就是最大的一条——而外部没有任何办法估算它的尺寸。
不能证明
没有任何公开材料把这个语料的任何部分与任何一次被测量的模型改进联系起来。
本资产的其他证据
1 条 · 为该主张划界
- 2026.06MinerU.Chem —— 提取已有记录补不了从未被记录的区域;这是"靠文献建数据护城河"能有多大的一条硬上限公开系统细化
资产三
物理平台
产生数据的能力本身:仪器、集成、编排。
当前判断平台集成中的工程积累本身也是技术能力。接口更开放会降低部分摩擦,但不能据此推断整个平台优势已经消失。
置信度:中等 · 2 条关键证据
关键证据
CuspAI ——「设计不是火箭科学,难的是真把它造出来」
对本问题的意义
Welling 说他最初写下的架构基本就是今天的架构;护城河在于你能拿到什么数据,以及真正把它建起来的工程。一个完全有动机把自家平台描述成技术深水区的人,却选择把它描述成"只是很难",这个选择本身就有信息量。
不能证明
吞吐量、命中率、运行时长均未披露,所以这个优势有多大无法评估。
Radical AI —— 那些血泪史
对本问题的意义
逆向控制没有开放接口的仪器软件、为粘在托盘上的高温合金样品定制机械爪、发现机械工程师和机电工程师是两种不同的招聘。Krause 现在把这些累积起来的、不性感的工作称为公司真正的护城河——"关键不是在工具前面摆一个机器人"。
不能证明
"难"不等于"持久"。这里没有任何东西能说明下一个进场者会面对同样的难度。
本资产的其他证据
1 条 · 侵蚀该资产
- 2026.08Radical AI 访谈 —— 两年前仪器厂商拒绝开放接口,如今已开始提供支持;这条壁垒正在变薄的直接证据证词侵蚀
资产四 · 最慢转移
隐性运营经验
跑这套系统的人知道、但写不下来的东西。
当前判断运营经验可能属于组织,也可能高度依赖具体人员和领域。跨领域需要适配,不等于既有经验没有价值。
置信度:对其重要性高,对其能否累积低 · 1 条关键证据
关键证据
Radical AI —— 那位 3M 顾问
对本问题的意义
一位在 3M 工作了 35 年的顾问告诉团队:制造环节最难捕捉的,是知道在哪个时刻把哪个旋钮调到什么位置——而且把它写成公式也不会让它变可靠,因为正确设定每次都不一样。这是关于为什么这类资产同时抗拒复制和抗拒验证最清楚的一次陈述。
不能证明
这类经验究竟会沉淀为机构资产,还是只住在个人身上、随人离开而消失。
不同解释与限制
上面那个排序可能错在哪里
Lila 的立场已经作为关键证据放在资产一里了——因为在这个问题上,反方论证不是一条脚注,它就是两个主要主张之一。
Radical AI —— 开源是在建立位置,而不是让渡位置
主张
把模型放出去,换回了比公司内部能产生的更多的社区反馈和想法,而 TorchSim 长成了一个独立组织。
为什么相关
这说明"模型 vs 数据"这个二分太干净了:把模型送出去,可能是一种获取别的东西的方式。一个假定资产是被持有而非被交换的护城河框架,可能整个就是错的框架。
Max Welling —— 经验可能同样无法累积
主张
自动化是高度依赖具体领域的:把一个问题解决透了,也带不到下一个,因为仪器和模型都变了。
为什么相关
如果运营经验和自动化一样被垂直绑定,那么衰减最慢的资产同时也是最不可移植的——在一个领域内持久,出了这个领域一文不值。那会让本页上每个立场在局部都对、作为普遍主张都错。
AI4S.fyi 综述 · 当前缺口
没有任何一个公开案例,把某一批专有数据和某一次可测量的模型改进连起来。在这样的案例出现之前,数据护城河这个论题完全建立在那些已经押注了的人的信心之上。
什么会改变我们的判断
- 数据任何一家公司公开一条因果链条:某一批专有数据 → 某一次可测量的模型改进,并给出反事实。
- 经验一个自然实验:某平台在核心技术人员离开之后产出的变化。这是检验隐性经验属于机构还是属于个人的唯一低成本办法。
- 模型开源模型在某个科学领域追平专有模型的具体时间点——这直接检验那个"五年"预测,也是本页上最干净的一个证伪条件。
- 平台仪器厂商把可用的 API 做成标配,那会移除目前构成平台护城河的很大一部分集成壁垒。
延伸阅读
Radical AI 谈为什么模型不是护城河,以及它开源了什么来兑现这个判断。
Lila Sciences 押的是相反的注:平台是 token 生成器,模型才是资产。
CuspAI 的 Max Welling 谈为什么设计不是难的部分,以及他预计什么会最先商品化。
