研究基础设施与实验自动化· 科学证据 · Frontier
Anthropic 发布 MHS:为 AI Agent 建立统一的实验室硬件接口
MHS 试图为 AI4S 闭环建立共享的 Interact 层:让不同 agent 通过统一接口发现、控制和协调真实仪器,并把设备状态、测量结果与错误返回上层系统。
◐官方研究预览 + 真实设备前瞻性演示
当前边界:真实设备上已经展示多仪器编排、参数调整、自动重试和控制优化,但尚未证明完整的自主科学发现;标准仍处于研究预览,结果主要来自 Anthropic 与首批合作伙伴公布的案例
这项工作推进的是:让 AI agent 通过统一接口操作并协调真实仪器
- MODEL理解 / 预测
- DECIDE选择下一步
- INTERACT执行与测量
- UPDATE改变下一轮
01|发生了什么
MHS 如何工作
2026 年 8 月 27 日,Anthropic 发布 MHS(Model Hardware Standard,模型硬件标准)的研究预览。它是一套供 AI agent 操作物理设备的共享规范,首批案例覆盖显微镜、液体工作站、plate reader、机械臂和量子计算机中的激光控制系统。[S1]
MHS 的基本路径是:scientific agent → MHS interface → device driver → instrument / robot,再把设备状态、测量结果和错误沿原路返回。每台设备通过驱动暴露相对统一的 read、write 等操作,并生成机器可读的 reference file,描述设备能测量什么、哪些参数可以调整、当前状态和安全限制。[S1]
可以把它理解成 MCP 在物理世界的一次延伸:MCP 让模型用相对统一的方式发现和调用软件工具,MHS 则把同样的接口思路带到实验仪器与机器人。类比只到这里为止——物理设备还必须处理实时状态、运动边界、硬件故障和安全联锁。[S1]
Agent 可以通过 MCP、命令行或代码调用设备。需要低延迟或长时间运行时,它可以把探索中形成的操作顺序写成确定性代码,让设备直接执行,而不是让语言模型在每一个时间步持续在线推理。[S1]
MHS 是 model-agnostic 的,并不要求使用 Claude;任何兼容标准协议的 agent harness 理论上都可以接入。它目前只向首批实验室和制造伙伴开放,Anthropic 计划在补充物理安全评估和部署规范后再开源。[S1]

Anthropic 发布 MHS 研究预览时使用的官方配图。图片来自 Anthropic。 [S1]
02|What Changed
MHS 推进了科学闭环的哪一步?
主要推进的是 Interact:当上层系统已经决定下一步做什么,MHS 负责把决定转成跨仪器操作,读取状态,并返回测量与运行错误。它没有提供新的科学模型,也不直接生成假设或选择最值得做的实验。[S1]
一些案例已经在限定目标和参数空间内形成“执行—测量—调整—重做”的小型闭环。但持续科学学习仍需要外部模型解释结果、决策模块选择下一项实验、更新模块改变模型或策略,并由安全和异常处理机制支撑长期运行。[S1]
更准确的判断是:MHS 降低了 Interact → Update 之间的集成成本,使自主闭环更容易构建,但不等于已经完成自主科学发现。

Anthropic / Genentech:Claude 通过 MHS 协调三台设备并读取状态;橙色环标出流速优化的限定闭环。图片来自 Anthropic 官方发布。 [S1]
为什么统一接口仍然需要设备驱动
把 MHS 理解成实验室硬件的 USB 接口有帮助,却不完全准确。它不会消除设备驱动,也不能让完全手动的仪器凭空变得可编程。设备仍要有 API、SDK、CLI、COM、文件投递系统或可自动操作的 GUI,底层差异仍需驱动封装。[S1]
MHS 标准化的是 agent 发现和调用设备的方式,而不是把所有设备内部实现变成同一种东西。它把设备能力、实时状态、操作方法和安全限制转换成上层系统可以发现的接口。
从一次性 glue code 到可复用的设备接口
许多仪器本来就能被软件控制,真正的困难是厂商软件、编程语言、数据格式和状态表示彼此不同。新增设备常要重写 glue code、处理协议、同步状态,再定义失败时如何停止和恢复。Anthropic 与合作伙伴称,这种集成通常需要数周甚至数月。[S1]
MHS 试图把“每个 agent × 每台仪器的一次性集成”改成“每台仪器接入一次,多个兼容 agent 与工作流复用”。核心推进首先是 interoperability,而不是更强的科学推理。

Anthropic / UW Baker 与 Pinglay 实验室 Fig. 1:MHS 将分散仪器接入统一调度与监控层,同时保留研究实验所需的灵活性。图片来自 Anthropic 官方发布。 [S1]
03|关键数字
从数周集成到 99.3% 激光恢复率
Janelia 显微成像从依次启动七套程序,变成统一 dashboard 一次启动[S1]
CMU 从原始设备编写驱动、完成编排并跑通一次自主重做[S1]
CMU agent 拒绝饱和曲线、调整浓度范围并在新 plate 上重做[S1]
QuEra laser-relock 脚本在 700 次盲测中的恢复成功率变化[S1]
QuEra 无人运行的真实实验次数、持续时间与残余误差降低幅度[S1]
UW Baker / Pinglay 实验室接入六台设备(含驱动开发);一轮筛选约有 1,000 个候选蛋白,单个实体测试约需 100 美元与一周人力[S1]
以上均为 Anthropic 发布文章中的合作伙伴报告,尚未经过统一基准或独立复现。
04|为什么重要
真正的瓶颈不是仪器不能编程,而是它们无法协同
真正的瓶颈往往不是单台仪器不能编程,而是不同仪器无法共享状态、处理依赖和组成同一条研究流程。如果研究人员仍要在厂商软件之间手动搬运结果,再好的实验计划也很难连续变成新的物理证据。[S1]
传统自动化工作站擅长把固定 protocol 重复运行成千上万次。研究实验则经常更换样本、设备组合和条件,下一步还取决于刚刚得到的结果。MHS 想在确定性设备和不断变化的研究目标之间放置一个可复用接口,而不是用 agent 取代已经成熟的设备控制。
UW Baker / Pinglay 实验室的经济账让这个瓶颈更具体:模型生成一个蛋白设计只需约 0.01 美元,而一个候选进入实验台测试约需 100 美元和一周人力;一轮计算筛选又可能产生约 1,000 个候选。团队用不到一周接入六台设备(包括编写驱动),要缩短的正是计算候选与实体反馈之间越来越宽的时间和成本差。[S1]
在 design–build–test–learn 循环里,MHS 当前主要覆盖 Build 和 Test,以及设备协调和数据交接。Design 仍来自科学模型或研究人员,Learn 仍需要外部模型解释结果、更新策略并选择下一轮。[S1]
Tetsuwan 的案例进一步展示了大规模设备表征:系统完成 9,143 次 dispense 测试,训练出的精度模型在 held-out 条件下比厂商规格高 12%。这说明统一接口不仅能发指令,也能把真实运行数据送回校准与控制流程。[S1]
发布时公布支持、试点或集成计划的伙伴包括 AWS(Strands Robots)、Automata(LINQ)、Danaher、Doosan Robotics、MBF Bioscience(ScanImage)、QIAGEN(QIAsymphony Connect)、Tecan(Fluent)、Universal Robots、Hugging Face(LeRobot)和 Raspberry Pi。这说明供给侧愿意围绕标准试验接口;它与“同一驱动已经能跨实验室、跨项目安全复用”仍是两件不同的事,后者要由真实部署来证明。[S1]
WHAT CHANGED
- AI4S 层级
- 实体交互 / 实验室硬件接口 / 实验自动化
- 原有瓶颈
- 仪器可分别自动运行,却使用不同接口、状态与数据格式;每个新工作流都要重复编写 glue code
- 这次改变
- MHS 用统一驱动、设备描述与 MCP / CLI / code 控制方式连接 agent 和真实设备
- 关键证据
- 真实设备上已展示多仪器编排、自主重做、错误恢复和通过数百轮实验改进控制脚本
- 仍未解决
- 跨实验室驱动复用、复杂物理故障理解、长期安全运行、广泛标准采用与完整自主科学发现
EVIDENCE IN CONTEXT
- 编辑状态
- 前沿
- 证据场景
- 闭环或机器人实验室
- 证据怎样产生
- 前瞻性 · 实体设备 · 局部闭环
- 来源与可检查性
- 公司与合作伙伴自述
- 证据上限
- 它证明了统一接口可以在真实设备上支持编排、重做与控制优化,但没有证明可迁移、长期运行的自主科学发现。
- 谁做了什么
- 人类定义目标与安全边界;agent 编排设备并在限定任务中调整参数;外部系统负责科学更新
05|证据状态与边界
现有案例真正证明了什么?
这些不是纯软件模拟。MHS 已用于液体工作站、机械臂、plate reader、显微镜、激光器和量子设备。CMU 与 QuEra 包含前瞻性的真实设备运行,证据强于普通产品 demo 或只在仿真中完成的 agent workflow。[S1]
来源仍主要是首方与合作伙伴报告。现有结果集中在 Anthropic 官方发布中,不是统一基准下的独立评测或同行评审研究。设备、任务、安全边界和成功指标各不相同,单个案例的数字不能直接外推到其他实验室。[S1]
CMU 展示的是 bounded closed-loop execution。系统检查第一条曲线、拒绝不合格结果、修改浓度范围并重做实验,已经跨过单纯自动执行。团队还人为制造了缺少孔板、孔板旋转、读板机忙碌、相机断开、设备不可达和急停触发六种故障场景,系统都在机械臂运动前正确拦截。但实验使用显色染料代替真实药物,证明的是操作、安全与决策结构,不是自主药物发现。[S1]
UW 展示的是低成本、快速的实验室集成。Baker / Pinglay 实验室在一周内连接六台分散设备,时间包含驱动开发,并把 dashboard、qPCR 停止建议和多设备流程接在一起。这是对集成速度与现实需求的有力演示,但同一套驱动还没有在独立实验室和不同蛋白工作流中复现。[S1]
QuEra 展示的是设备控制优化。Agent 通过数百次真实实验改善控制策略,并用盲测和长期运行验证脚本;任务已有明确目标、状态与成功标准,没有提出新的量子物理假设。[S1]
物理接口不等于物理理解。Genentech 的泡沫案例里,Claude 起初把物理问题当成软件错误并反复重试,研究人员解释原因后才改用干净孔位并减少混合。接口能说明“可以执行什么”和“设备报告什么”,不会自动解释物理上为什么失败。[S1]
执行自主性不等于完整科学自主性。人通常仍定义目标、候选空间、成功指标和异常边界。MHS 支持较高程度的自动执行与局部参数更新,但科学模型更新和下一轮研究方向仍依赖外部系统与专家。
完全手动的旧设备仍需改造。MHS 要求设备具有可被软件操作的入口。依赖手工旋钮、人工装样或无法数字化读取状态的设备,仍需要厂商驱动、附加传感器、机器人或硬件改造。
06|What I Learned
物理接口不等于物理理解
Interact 是 AI4S 中长期被低估的一层模型生成实验计划不代表实验能够发生。计划要变成设备指令,设备状态要能被观察,测量还要以可用格式返回。MHS 把这层单独定义成可以标准化的基础设施问题。
瓶颈不只是设备能否编程许多设备已经可以被软件控制,问题是无法共享状态和灵活组合。对研究实验来说,降低跨设备与 agent—设备的集成成本,可能比增加另一台单点自动化设备更重要。
执行自主性不等于决策自主性Agent 可以高度自动地运行仪器,但实验目标、候选空间、成功标准和风险边界通常由人定义。看到“无人运行”时,仍要继续问谁决定了要运行什么,以及结果如何改变下一步。
模型探索、确定性代码执行可能更现实QuEra 的模式兼顾了模型的开放式探索与物理控制需要的速度、稳定性和可检查性。模型不必永远留在控制回路里,重要的是它能否产生更好的、可以部署的控制策略。
自动重做不等于科学 Update参数调整可以形成控制闭环,但科学闭环还需要判断结果意味着什么,并让新证据改变模型、假设或下一轮实验选择。MHS 打通返回通道,真正的学习仍由上层系统完成。
资料来源
文中事实尽量链接至原始公告、项目清单、试验登记或同行评审论文;研究计划与已完成结果分开记录。
