Anthropic 的模型硬件标准是接口,而不是安全认证

Anthropic 的模型硬件标准为代理提供了通用设备接口,但物理联锁、身份、时序、观测和恢复仍然是外部控制。

分享这篇文章

Anthropic 于 8 月 27 日开启了 模型硬件标准(MHS) 的有限研究预览。该提议中的规范为 AI 代理提供了一种通用方式,用于发现、读取可编程设备的数据并向其发出命令,例如显微镜、液体处理器、机械臂和激光控制系统。

这一接口可能消除大量一次性集成工作,但也会让更少的软件操作获得更多的物理权限。因此,MHS 是一个有用的控制界面,而不是安全裁决:标准命令仍可能错误、时机不当、未经授权,或建立在模型误解物理世界的基础上。

一个驱动程序将许多设备 API 变成共享控制界面

实验室和制造设备通常各自带有编程接口、数据模型和运行假设。连接多台仪器往往意味着为每台设备编写一个转换器,再增加一层编排逻辑,以理解一台机器何时完成、下一台何时可以开始。

Anthropic 的预览介绍了一个 MHS 驱动程序,它将这些差异简化为读取温度或写入温度设定值等基本操作。设备会以标准格式变得可发现。自然语言标签可以描述代码可能无法捕捉的特征,而驱动程序会生成一个参考文件,说明设备测量什么、哪些内容可以改变,以及它应当执行哪些限制。

代理可以通过模型上下文协议(MCP)、命令行界面或代码文件触达这一层。MCP 是代理工具链与暴露出来的工具之间的通信路径;MHS 描述的是面向设备的那一层。较长或较快的操作可以封装成确定性代码,而不是让语言模型推理每一个控制循环。

这种分离很重要。语言模型可以提出目标或在有界选项中作出选择,而普通软件执行经过检查的序列。不过,MHS 并不会消除设备特定的工程工作。仍然需要有人编写并验证驱动程序、准确描述设备、将它连接到真实控制器,并决定代理可以看到哪些状态和操作。

路透社独立确认了预览版的发布及其范围,包括与合作伙伴在开源发布前开发安全评估的计划。路透社没有独立测试该接口或演示。发布时可获得的性能和可靠性示例来自 Anthropic 及参与组织。

发布演示展现了潜力,也划出了清晰边界

Anthropic 的公告包含多个合作伙伴案例。在卡内基梅隆大学的一次演示中,研究人员称,系统在设备移动前阻止了六种被诱发的状态,包括缺少托盘、设备无法到达和紧急停止处于激活状态。在另一个例子中,HHMI Janelia 的一位研究人员表示,设备级限制阻止了代理施加过大的激光功率。

同一份公告提供了一个对试点而言更重要的反例。在 Genentech 进行液体处理工作期间,Claude 反复把气泡造成的错误当成另一次软件重试就能解决的问题。研究人员必须解释物理故障,并将更温和的处理方式编码进去。Anthropic 表示,Claude 的空间和物理推理仍需要专家监督,其官方预览访问页面称当前项目范围有限且需要申请。

这些是概念验证,而不是跨地点评估。示例使用了特定的仪器、驱动程序、模型、工具链、防护措施和专家团队。它们没有证明独立编写的驱动程序会如何运行,也没有证明安全标签与机器实际限制相符,或系统会如何应对每一种传感器故障、网络延迟、过时状态、恶意指令或设备之间意外的交互。

WIRED 的发布报道直接描述了更广泛的风险:当工具是机器人或机器时,软件代理的错误可能变成物理损害或人身伤害。标准可以让限制更容易一致地表达,但它无法让模型级护栏、自然语言标签或表现良好的演示替代设备经过工程设计的安全系统。

六项关键控制仍在模型之外

最安全的架构会将 MHS 视为现有机器安全和运营控制系统中的一层。代理不应能够重写约束自己的边界。

控制边界MHS 可以贡献什么必须独立执行的内容
设备能力对可读状态和可调用操作提供一致的清单与确切驱动程序和设备版本绑定、经过审查的允许列表
物理限制声明范围和设备级限制现有联锁、受保护的运行限制和紧急停止行为
身份与权限为代理工具链提供通用工具界面命名的人类和服务身份、最小权限、短期授权和网络分段
时序状态共享和确定性命令链在语言模型之下验证的前置条件、互斥、超时行为和安全状态转换
观测通用遥测和代理可见状态独立传感器、只追加事件记录、时钟同步,以及代理无法抑制的告警
恢复经过检查的重置或回滚操作路径由人负责、经过测试的停止、隔离、检查和恢复程序

该表区分了_描述_和_执行_。一份参考文件写着机械臂不得进入某个空间,并不能证明控制器会阻止它。驱动程序拒绝超出范围的数值,并不能证明两个分别有效的设备命令组合起来仍然安全。模型在聊天测试中拒绝危险请求,并不能证明另一个提示词、工具结果或过时记忆不会间接产生同样的效果。

这对应于测试软件代理工具链的完整生命周期(中文)。部署单元是模型、工具链、驱动程序、网络、控制器、设备、环境和人类操作流程的整体。模型基准或接口一致性检查只覆盖了这个单元的一部分。

什么会让 MHS 证据更有力

计划中的开源发布将让外部团队检查规范和驱动程序。但代码可用本身无法验证 Anthropic 更广泛的可靠性主张。更有力的证据应明确确切的驱动程序和控制器版本,发布有代表性的故障测试套件,分别衡量危险命令接受率和安全任务完成率,测试传感器矛盾与跨设备时序,并展示恢复到已验证物理状态的过程。

独立复现还应报告人类团队提供了什么。Anthropic 的案例包括专家定义的运行范围、诱发的故障状态、物理解释,以及手写或模型编写的确定性脚本。这些贡献是系统的一部分,而不是可以从自主性主张中消失的偶然设置。

目前,MHS 是一个可信的提案,可以减少代理与可编程设备之间的转换工作。它最重要的特征,并不是模型可以通过同一个接口调用显微镜和机器人,而是工程师可以在模型推理与物理行动之间放置一个一致且可检查的边界,然后测试当演示不再按预期运行时,这个边界是否仍然有效。

资料来源

  1. Anthropic Model Hardware Standard research preview
  2. Official Model Hardware Standard preview page
  3. Reuters report on the Model Hardware Standard launch
  4. WIRED report on MHS and physical-agent risk