研究基础设施与实验自动化· 科学证据 · Frontier

Anthropic 发布 MHS:为 AI Agent 建立统一的实验室硬件接口

MHS 试图为 AI4S 闭环建立共享的 Interact 层:让不同 agent 通过统一接口发现、控制和协调真实仪器,并把设备状态、测量结果与错误返回上层系统。

更新于 10分钟阅读

官方研究预览 + 真实设备前瞻性演示

当前边界真实设备上已经展示多仪器编排、参数调整、自动重试和控制优化,但尚未证明完整的自主科学发现;标准仍处于研究预览,结果主要来自 Anthropic 与首批合作伙伴公布的案例

这项工作推进的是让 AI agent 通过统一接口操作并协调真实仪器

  1. MODEL理解 / 预测
  2. DECIDE选择下一步
  3. INTERACT执行与测量
  4. UPDATE改变下一轮

01|发生了什么

MHS 如何工作

2026 年 8 月 27 日,Anthropic 发布 MHS(Model Hardware Standard,模型硬件标准)的研究预览。它是一套供 AI agent 操作物理设备的共享规范,首批案例覆盖显微镜、液体工作站、plate reader、机械臂和量子计算机中的激光控制系统。[S1]

MHS 的基本路径是:scientific agent → MHS interface → device driver → instrument / robot,再把设备状态、测量结果和错误沿原路返回。每台设备通过驱动暴露相对统一的 read、write 等操作,并生成机器可读的 reference file,描述设备能测量什么、哪些参数可以调整、当前状态和安全限制。[S1]

可以把它理解成 MCP 在物理世界的一次延伸:MCP 让模型用相对统一的方式发现和调用软件工具,MHS 则把同样的接口思路带到实验仪器与机器人。类比只到这里为止——物理设备还必须处理实时状态、运动边界、硬件故障和安全联锁。[S1]

Agent 可以通过 MCP、命令行或代码调用设备。需要低延迟或长时间运行时,它可以把探索中形成的操作顺序写成确定性代码,让设备直接执行,而不是让语言模型在每一个时间步持续在线推理。[S1]

MHS 是 model-agnostic 的,并不要求使用 Claude;任何兼容标准协议的 agent harness 理论上都可以接入。它目前只向首批实验室和制造伙伴开放,Anthropic 计划在补充物理安全评估和部署规范后再开源。[S1]

Anthropic Model Hardware Standard 官方发布配图
Anthropic Model Hardware Standard 官方发布配图

Anthropic 发布 MHS 研究预览时使用的官方配图。图片来自 Anthropic。 [S1]

02|What Changed

MHS 推进了科学闭环的哪一步?

主要推进的是 Interact:当上层系统已经决定下一步做什么,MHS 负责把决定转成跨仪器操作,读取状态,并返回测量与运行错误。它没有提供新的科学模型,也不直接生成假设或选择最值得做的实验。[S1]

一些案例已经在限定目标和参数空间内形成“执行—测量—调整—重做”的小型闭环。但持续科学学习仍需要外部模型解释结果、决策模块选择下一项实验、更新模块改变模型或策略,并由安全和异常处理机制支撑长期运行。[S1]

更准确的判断是:MHS 降低了 Interact → Update 之间的集成成本,使自主闭环更容易构建,但不等于已经完成自主科学发现。
Genentech 使用 Claude 与 MHS 编排液体工作站、机械臂和酶标仪的实验流程
Genentech 使用 Claude 与 MHS 编排液体工作站、机械臂和酶标仪的实验流程

Anthropic / Genentech:Claude 通过 MHS 协调三台设备并读取状态;橙色环标出流速优化的限定闭环。图片来自 Anthropic 官方发布。 [S1]

为什么统一接口仍然需要设备驱动

把 MHS 理解成实验室硬件的 USB 接口有帮助,却不完全准确。它不会消除设备驱动,也不能让完全手动的仪器凭空变得可编程。设备仍要有 API、SDK、CLI、COM、文件投递系统或可自动操作的 GUI,底层差异仍需驱动封装。[S1]

MHS 标准化的是 agent 发现和调用设备的方式,而不是把所有设备内部实现变成同一种东西。它把设备能力、实时状态、操作方法和安全限制转换成上层系统可以发现的接口。

从一次性 glue code 到可复用的设备接口

许多仪器本来就能被软件控制,真正的困难是厂商软件、编程语言、数据格式和状态表示彼此不同。新增设备常要重写 glue code、处理协议、同步状态,再定义失败时如何停止和恢复。Anthropic 与合作伙伴称,这种集成通常需要数周甚至数月。[S1]

MHS 试图把“每个 agent × 每台仪器的一次性集成”改成“每台仪器接入一次,多个兼容 agent 与工作流复用”。核心推进首先是 interoperability,而不是更强的科学推理。

传统学术实验室、集中自动化实验室与 MHS 实验室的比较
传统学术实验室、集中自动化实验室与 MHS 实验室的比较

Anthropic / UW Baker 与 Pinglay 实验室 Fig. 1:MHS 将分散仪器接入统一调度与监控层,同时保留研究实验所需的灵活性。图片来自 Anthropic 官方发布。 [S1]

模型探索,确定性代码执行

MHS 展示了一个适合物理系统的分工:模型先探索设备、观察反馈并修改控制策略,再把有效策略写成可以检查和测试的确定性代码。QuEra 的激光案例采用了这种方式,最终脚本不需要 agent 持续在线。[S1]

语言模型负责开放式探索与改进,确定性代码负责速度、稳定性和可审计执行。这比让 LLM 永久留在毫秒级控制回路里更现实。

但这套分工解决的是执行效率和可审计性,不会自动补上物理理解。模型可以把有效操作固化成代码;如果它误判了失败原因,确定性执行只会更稳定地重复错误。后面的 Genentech 案例正好暴露了这条边界。[S1]

03|关键数字

从数周集成到 99.3% 激光恢复率

7 → 1

Janelia 显微成像从依次启动七套程序,变成统一 dashboard 一次启动[S1]

数周 → 8 小时

CMU 从原始设备编写驱动、完成编排并跑通一次自主重做[S1]

R² < 0.9 → > 0.98

CMU agent 拒绝饱和曲线、调整浓度范围并在新 plate 上重做[S1]

58% → 99.3%

QuEra laser-relock 脚本在 700 次盲测中的恢复成功率变化[S1]

363 / 16 h / ≈10×

QuEra 无人运行的真实实验次数、持续时间与残余误差降低幅度[S1]

6 台 / 一周内

UW Baker / Pinglay 实验室接入六台设备(含驱动开发);一轮筛选约有 1,000 个候选蛋白,单个实体测试约需 100 美元与一周人力[S1]

以上均为 Anthropic 发布文章中的合作伙伴报告,尚未经过统一基准或独立复现。

04|为什么重要

真正的瓶颈不是仪器不能编程,而是它们无法协同

真正的瓶颈往往不是单台仪器不能编程,而是不同仪器无法共享状态、处理依赖和组成同一条研究流程。如果研究人员仍要在厂商软件之间手动搬运结果,再好的实验计划也很难连续变成新的物理证据。[S1]

传统自动化工作站擅长把固定 protocol 重复运行成千上万次。研究实验则经常更换样本、设备组合和条件,下一步还取决于刚刚得到的结果。MHS 想在确定性设备和不断变化的研究目标之间放置一个可复用接口,而不是用 agent 取代已经成熟的设备控制。

UW Baker / Pinglay 实验室的经济账让这个瓶颈更具体:模型生成一个蛋白设计只需约 0.01 美元,而一个候选进入实验台测试约需 100 美元和一周人力;一轮计算筛选又可能产生约 1,000 个候选。团队用不到一周接入六台设备(包括编写驱动),要缩短的正是计算候选与实体反馈之间越来越宽的时间和成本差。[S1]

在 design–build–test–learn 循环里,MHS 当前主要覆盖 Build 和 Test,以及设备协调和数据交接。Design 仍来自科学模型或研究人员,Learn 仍需要外部模型解释结果、更新策略并选择下一轮。[S1]

Tetsuwan 的案例进一步展示了大规模设备表征:系统完成 9,143 次 dispense 测试,训练出的精度模型在 held-out 条件下比厂商规格高 12%。这说明统一接口不仅能发指令,也能把真实运行数据送回校准与控制流程。[S1]

发布时公布支持、试点或集成计划的伙伴包括 AWS(Strands Robots)、Automata(LINQ)、Danaher、Doosan Robotics、MBF Bioscience(ScanImage)、QIAGEN(QIAsymphony Connect)、Tecan(Fluent)、Universal Robots、Hugging Face(LeRobot)和 Raspberry Pi。这说明供给侧愿意围绕标准试验接口;它与“同一驱动已经能跨实验室、跨项目安全复用”仍是两件不同的事,后者要由真实部署来证明。[S1]

WHAT CHANGED

AI4S 层级
实体交互 / 实验室硬件接口 / 实验自动化
原有瓶颈
仪器可分别自动运行,却使用不同接口、状态与数据格式;每个新工作流都要重复编写 glue code
这次改变
MHS 用统一驱动、设备描述与 MCP / CLI / code 控制方式连接 agent 和真实设备
关键证据
真实设备上已展示多仪器编排、自主重做、错误恢复和通过数百轮实验改进控制脚本
仍未解决
跨实验室驱动复用、复杂物理故障理解、长期安全运行、广泛标准采用与完整自主科学发现

EVIDENCE IN CONTEXT

编辑状态
前沿
证据场景
闭环或机器人实验室
证据怎样产生
前瞻性 · 实体设备 · 局部闭环
来源与可检查性
公司与合作伙伴自述
证据上限
它证明了统一接口可以在真实设备上支持编排、重做与控制优化,但没有证明可迁移、长期运行的自主科学发现。
谁做了什么
人类定义目标与安全边界;agent 编排设备并在限定任务中调整参数;外部系统负责科学更新

05|证据状态与边界

现有案例真正证明了什么?

这些不是纯软件模拟。MHS 已用于液体工作站、机械臂、plate reader、显微镜、激光器和量子设备。CMU 与 QuEra 包含前瞻性的真实设备运行,证据强于普通产品 demo 或只在仿真中完成的 agent workflow。[S1]

来源仍主要是首方与合作伙伴报告。现有结果集中在 Anthropic 官方发布中,不是统一基准下的独立评测或同行评审研究。设备、任务、安全边界和成功指标各不相同,单个案例的数字不能直接外推到其他实验室。[S1]

CMU 展示的是 bounded closed-loop execution。系统检查第一条曲线、拒绝不合格结果、修改浓度范围并重做实验,已经跨过单纯自动执行。团队还人为制造了缺少孔板、孔板旋转、读板机忙碌、相机断开、设备不可达和急停触发六种故障场景,系统都在机械臂运动前正确拦截。但实验使用显色染料代替真实药物,证明的是操作、安全与决策结构,不是自主药物发现。[S1]

UW 展示的是低成本、快速的实验室集成。Baker / Pinglay 实验室在一周内连接六台分散设备,时间包含驱动开发,并把 dashboard、qPCR 停止建议和多设备流程接在一起。这是对集成速度与现实需求的有力演示,但同一套驱动还没有在独立实验室和不同蛋白工作流中复现。[S1]

QuEra 展示的是设备控制优化。Agent 通过数百次真实实验改善控制策略,并用盲测和长期运行验证脚本;任务已有明确目标、状态与成功标准,没有提出新的量子物理假设。[S1]

物理接口不等于物理理解。Genentech 的泡沫案例里,Claude 起初把物理问题当成软件错误并反复重试,研究人员解释原因后才改用干净孔位并减少混合。接口能说明“可以执行什么”和“设备报告什么”,不会自动解释物理上为什么失败。[S1]

执行自主性不等于完整科学自主性。人通常仍定义目标、候选空间、成功指标和异常边界。MHS 支持较高程度的自动执行与局部参数更新,但科学模型更新和下一轮研究方向仍依赖外部系统与专家。

完全手动的旧设备仍需改造。MHS 要求设备具有可被软件操作的入口。依赖手工旋钮、人工装样或无法数字化读取状态的设备,仍需要厂商驱动、附加传感器、机器人或硬件改造。

06|What I Learned

物理接口不等于物理理解

Interact 是 AI4S 中长期被低估的一层模型生成实验计划不代表实验能够发生。计划要变成设备指令,设备状态要能被观察,测量还要以可用格式返回。MHS 把这层单独定义成可以标准化的基础设施问题。

瓶颈不只是设备能否编程许多设备已经可以被软件控制,问题是无法共享状态和灵活组合。对研究实验来说,降低跨设备与 agent—设备的集成成本,可能比增加另一台单点自动化设备更重要。

执行自主性不等于决策自主性Agent 可以高度自动地运行仪器,但实验目标、候选空间、成功标准和风险边界通常由人定义。看到“无人运行”时,仍要继续问谁决定了要运行什么,以及结果如何改变下一步。

模型探索、确定性代码执行可能更现实QuEra 的模式兼顾了模型的开放式探索与物理控制需要的速度、稳定性和可检查性。模型不必永远留在控制回路里,重要的是它能否产生更好的、可以部署的控制策略。

自动重做不等于科学 Update参数调整可以形成控制闭环,但科学闭环还需要判断结果意味着什么,并让新证据改变模型、假设或下一轮实验选择。MHS 打通返回通道,真正的学习仍由上层系统完成。

资料来源

文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。

  1. S1Previewing the Model Hardware StandardAnthropic · 2026.08.27 · 官方研究预览与合作伙伴案例