Google 代理评估已正式可用,但离线和线上分数仍需版本控制

Google 现在可以连接代理测试和生产监测。在比较分数之前,了解哪些版本、样本、评审者、轨迹、成本和控制措施必须保持可见。

分享这篇文章

Google 已让 Gemini Enterprise Agent Platform 中的 Agent 和 Model Evaluations 正式可用。团队现在可以在离线实验和线上监测之间复用已注册指标,检查失败背后的轨迹,生成合成案例,模拟用户和工具环境,并观察抽样的生产分数是否发生漂移。

这个共享引擎消除了大量评估管线工作,但它本身不会让两个分数变得可比。离线套件和实时流量可以使用同名指标,却测试不同的代理修订版、案例群体、轨迹字段、评审模型或抽样规则。图表下降可能反映的是产品、评估器或流量构成。

Google 现在正式提供了什么

Google 7 月 31 日的公告描述了 20 多个预置指标,覆盖任务成功、工具使用、轨迹质量、落地性、安全性和基于参考的语言任务。团队也可以注册 Python 指标和自定义大型语言模型评审者。服务器端实验会将工件保存在 Cloud Storage 中,而线上监测器可以为收集到的生产轨迹评分并发送漂移告警。

当前的代理评估文档于 8 月 26 日更新,将流程分为案例、推理、轨迹、评分、分析和优化。它同时支持本地开发和已部署代理的评估。这一生命周期比模型基准更广,因为轨迹可以包含工具选择、参数、中间事件和多轮状态,而不只是最终答案。

有一个接口边界仍很容易被忽略。Google 的 GenAI Client 指南仍将推荐接口标为预览版,并使其受预发布条款约束。服务概览将较旧的 vertexai.evaluation.EvalTask 模块标为 GA,并称其为兼容性而维护,但也表示它不支持自适应量规等较新的方法。评估服务可以是 GA,而团队采用的确切客户端却不一定是 GA。

独立的 AgentPedia 实现指南得出了相同的运营结论:固定 SDK 版本,并将依赖预览版的调用隐藏在可替换适配器之后。发布决策应记录实际使用接口的生命周期状态,而不是继承发布标题中最宽泛的状态。

可比的分数需要带版本的测量包

Google 的指标注册表文档称,已注册定义可以一致地应用于离线评估和持续监测。这是闭环中稳定的中心,但周围的测量仍需要自己的记录。

测量组成记录离线到线上的边界
被测系统在线下固定代理、模型、指令、检索语料和工具模式的修订版。在线上记录确切的部署修订版和流量分配。即使指标不变,系统变化也能移动分数。
案例命名离线数据集修订版、是否为留出集、场景来源和预期结果。对于生产环境,记录轨迹筛选器、队列、语言、工具路径、区域和时间窗口。固定套件与变化中的用户群体回答的是不同问题。
指标在两处使用相同的注册表资源和定义修订版。编辑过的标准可能看起来像产品漂移。
评审者固定比较窗口中的评审模型 ID、参数、提示或量规修订版,以及重试策略。评审者更新可能改变判定,即使代理没有变化。
证据定义所需轨迹事件、删节规则、缺失字段策略和工件位置。确认生产环境暴露相同的可观测字段;实时轨迹遗漏的工具动作,评审者无法评分。
抽样与汇总记录离线重复次数、随机种子、无效运行规则、切片和统计量。将它们与线上抽样百分比、最大样本数、计划、无效轨迹、切片和统计量配对。抽样平均值可能因规模或构成改变而移动。

这张表是发布建议,并不是声称 Agent Platform 会自动捕获每个字段。Google 的注册表提供可复用的指标资源。团队仍负责把这些资源连接到不可变的应用、数据、遥测和分析修订版。

实际标识符可以是上述测量包的哈希,而不是手写的 quality-v3 之类标签。将可读字段与它并列保存。当评审模型或量规改变时,使用两个版本对共享校准集和近期生产轨迹样本评分。只有在重叠部分表明分数变化已被理解时,才拼接图表;否则开始新的序列并标注变化。

自适应量规提高匹配度,但也增加了一个生成工件

自适应量规会要求评审模型根据评估案例、开发者指令和工具声明创建针对案例的通过/失败标准,然后为生成的轨迹评分。对于退款代理,一个案例可能要求先检查配送状态再取消、最多执行一次变更,并报告实际工具结果。通用的“有帮助程度”分数会遗漏这些状态和授权边界。

只有在检查生成标准时,额外的具体性才有用。量规可能要求任务从未请求的行为,以正确的工具结果换取冗长解释,或遗漏关键的授权不变量。应将生成的量规组视为证据的一部分:为它建立版本,抽样进行人工审查,并测试评审者是否能区分已知的通过、失败和含糊样本。

Google 发布之前的研究说明了校准为何重要。同行评审的 MT-Bench 与 Chatbot Arena 研究发现,在其聊天助手场景中,强大的语言模型评审者可以近似人类偏好,但也记录了位置、冗长、自我增强和推理偏差。这些结果没有测量 Google 当前托管的评审器,却确立了一个更窄的观点:必须针对团队实际使用的评审者、任务、标签和条件测试一致性。

在预期属性精确的地方使用程序化检查:允许的工具名称、必需的 JSON 字段、算术总数、权限边界、事务状态或被禁止的副作用。对需要解释的语义属性使用语言模型评审者。两种分数都不应覆盖失败的确定性安全不变量。

我们的 AI 评估通用说明介绍了更广泛的规则:指标会塑造产品决策。HarnessRisk 分析(中文)将范围扩展到配置、能力安装、持久状态、动作控制和恢复——响应质量分数无法认证的领域。

模拟扩大覆盖范围,生产环境提供不同的分布

Agent Platform 可以生成案例、模拟多轮用户,并使用受控的数据、错误或延迟拦截工具调用。这些功能让测试罕见且危险的路径变得更容易,而无需破坏真实后端。它们可以显示代理是否能在定义的条件下处理合成的超时、权限拒绝或格式错误的结果。

模拟器无法确立这些失败在生产环境中的发生率、真实服务副作用的保真度,或未被模拟器代表的用户的行为。生成的案例也可能重复用于创建它们的代理指令和工具模式中的假设。应将合成案例、人工编写的留出案例和生产衍生案例保留为单独切片,而不是混合成一个通过率。

Google 的线上监测文档允许运营者筛选轨迹、设置抽样百分比并限制每次运行的样本数。这可以控制成本,但也让抽样规则成为结果的一部分。只针对缓慢、冗长或 token 数高的轨迹的监测有助于诊断;除非分析考虑到这种选择,否则其分数并不是全部流量的估计。

最干净的桥梁是影子比较。上线前,在留出套件上运行候选版本。上线后,将一小部分经过审查的合格轨迹通过完全相同的指标包,同时保留随机基线。如果线上分数发生变化,在称其为产品漂移之前,应按代理修订版、工具路径、语言、队列和轨迹完整性拆解。

成本、遥测和安全控制属于结果的一部分

Google 当前两个页面对计算指标收费存在分歧。发布文章称,基于代码和计算的指标不增加额外费用。专门的 Agent Platform 定价页面列出了计算指标按字符计费,并分别通过底层自动评审器为基于模型的指标收费。预算时应以定价页面和账单账户为准,并为任何“每条评估轨迹成本”计算标记所使用的费率日期。

公告还称,数据集和轨迹保留在客户项目中。但不应将这句话扩大为每项所需控制都可用的保证。Google 当前的企业安全支持表标明 Agent 评估支持 HIPAA,同时将 VPC Service Controls、客户管理的加密密钥、静态数据驻留、Access Transparency 和 Access Approval 列为该服务不支持。产品支持可能变化,因此应为确切部署核实该表、区域、目标模型、Cloud Trace 路径和 Cloud Storage 配置。

评估轨迹可能包含提示、回应、工具定义、参数、会话标识符和失败样本。因此,生产监测器需要经过审查的字段允许列表、导出前删节、访问和留存规则、删除行为,以及针对受监管或受合同约束数据的明确政策。如果更高的抽样百分比把更多敏感内容复制到控制较弱的证据路径中,它并不会自动变得更好。

同一个产品家族不会让离线和线上分数相同

Google 的 GA 发布让实验、轨迹、可复用指标和线上监测器更容易协同运行。可信的好处是证据连续,而不是指标名称连续。

线上分数仍取决于抽取了哪些轨迹、哪些字段经过日志和删节后保留下来、运行了哪个评审者和量规版本,以及生产用户是否类似于离线案例。当其中任何一项发生变化时,即使代理没有变化,数字也可能移动;或者重要的失败切片恶化而总体数字保持不变。

产品弥合了运营缺口,但没有消除判断观察到的变化究竟属于代理、评估器还是流量所需的分析工作。

资料来源

  1. Google announcement: Agent and Model Evaluations are generally available
  2. Google Cloud agent evaluation overview
  3. Google Cloud metric registry documentation
  4. Google Cloud continuous online evaluation documentation
  5. Google Cloud GenAI Client agent evaluation documentation
  6. Google Cloud Gen AI evaluation service overview
  7. Gemini Enterprise Agent Platform pricing
  8. Google Cloud Agent Platform enterprise security support table
  9. AgentPedia independent implementation guide to Gemini agent evaluations
  10. NeurIPS paper: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena