GPT-5.6 Terra 在 Kiro 中降低 82% 成本,但需要更大的分母
OpenAI 和 AWS 报告称,GPT-5.6 Terra 在 Kiro 中完成 Terminal-Bench 任务的成本大约降低了 82%,但仓库工作还会增加审查和修复成本。
OpenAI 表示,GPT-5.6 Terra 在 Kiro 中完成 Terminal-Bench 2.1 的成功任务时,成本大约降低了 82%。这是一个来自特定模型、代理环境和基准的有用结果,但它并不能证明工程团队在自己的仓库中合并可靠变更时会少花 82%。
缺少的桥梁是模型调用周围的工作。如果维护者必须修复它的补丁、重新运行不稳定的测试周期、撤销过大的差异,或在部署后回滚某项变更,那么编码代理即使消耗更少额度,也可能创造出更昂贵的工作。决策指标应是每项通过固定工程验收门槛的已完成变更的总成本,而不只是额度、token 或生成的代码行数。
两家公司都没有在公告中发布足够的任务级细节,无法让外部人员独立重建这 82% 的数字。
82% 的结果比公告听起来更窄
OpenAI 的8 月 24 日合作伙伴公告称,Sol、Terra 和 Luna 可以用于 Kiro 的规划、实现、审查和测试工作流。公告将这一成本结果归因于 OpenAI 与 AWS 的测试:GPT-5.6 Terra 在 Kiro 中完成 Terminal-Bench 2.1 的成功任务时,成本大约降低了 82%。
公告没有说明比较基线、试验次数、Kiro 版本、模型设置、超时时间、重试策略、每项任务成本,或该数字是否包括失败试验。它也没有发布能够显示运行了哪些命令、代理进行了多少次修正的轨迹。没有这些细节,这个百分比是供应商报告的工具链结果,而不是可复用的预测。
可用性也早于合作伙伴文章。Kiro 的发布变更日志将首次 GPT-5.6 推出时间定为 7 月 14 日。随后,7 月 31 日的更新将 Terra 的 Kiro 额度倍率从 1.2x 降至 1.0x,将 Luna 的倍率从 0.6x 降至 0.1x,而 Sol 仍为 2.4x。因此,OpenAI 的 8 月文章增加了性能主张和合作伙伴叙事,但并不代表 Kiro 客户第一次可以选择这些模型的日期。
基准本身很有用,但范围有界。Terminal-Bench 2.1 仓库描述了在容器环境中执行的 89 项任务,包括调试、安全、科学和系统工作。公开排行榜的提交必须每项任务至少运行五次试验,并上传作业数据。Terminal-Bench 2.1 还从 2.0 版本修改了任务,以修复错误、超时、资源限制和奖励劫持方面的弱点。
这使它成为对终端代理的严肃测试,但它并不代表团队的私有代码库、审查标准、部署路径或维护成本。模型、Kiro 工具链、任务容器、验收测试和重试预算共同产生了这一结果。基准获胜不能将模型单独隔离为原因,更不能保证在其他地方节省 82%。
Kiro 额度为活动定价,而不是为已验收的工程工作定价
Kiro 的当前模型文档列出了三个 GPT-5.6 变体,均拥有 272,000 token 的上下文窗口。它们的额度倍率以 Auto(Kiro 的默认路由选项)为相对基准:
| Kiro 选择 | 当前倍率 | 文档所述访问权限 | 合理的第一假设——不是结论 |
|---|---|---|---|
| GPT-5.6 Luna | 0.1x | 付费套餐 | 便宜的尝试和快速反馈很重要的高频、有边界任务 |
| GPT-5.6 Terra | 1.0x | 付费套餐 | 需要在能力与额度使用之间取得平衡的常规多步骤变更 |
| GPT-5.6 Sol | 2.4x | 付费套餐 | 更难的规划或长时程工作,此时较少的失败尝试可能抵消更高倍率 |
| Auto | 1.0x | 所有套餐 | 实用的产品基线,但底层路由可能在不同运行之间变化 |
这些是相对于产品的倍率,而不是 API token 价格。同一份文档称,Auto 消耗 10 个额度的任务,使用 Sol 会消耗 24 个、Terra 会消耗 10 个、Luna 会消耗 1 个。文档还称,无论 Kiro 配置文件所在地区如何,GPT-5.6 请求都由美国提供服务。在考虑成本之前,这一数据位置条件可能已经让该模型系列不适用于某些仓库。
Kiro 的定价页面目前列出的套餐从每月 20 美元购买 1,000 个额度的 Pro,到每月 200 美元购买 10,000 个额度的 Power;附加额度的价格为每个 0.04 美元。包含的额度和边际附加支出回答的是不同的预算问题。已经为闲置容量付费的团队可能不会因为一次试验而立即产生现金费用,但这项工作仍会消耗稀缺的套餐容量,之后还可能触发超额使用。
一份独立的 Fathom 分析正确地将读者引向审查时间、失败测试、后续修复和模型总支出,但它没有报告独立的 Kiro 实验。它提供的是有用的衡量框架,而不是对 82% 结果的佐证。
“已完成变更”是缺少的分母
从一个所有候选项都必须通过的二元门槛开始。只有在所有必需条件都满足时,变更才算完成:
- 任务声明的行为已经实现;
- 目标测试和冻结的完整测试套件通过;
- 该仓库要求的代码检查、类型检查、安全检查和构建步骤通过;
- 差异保持在任务声明的范围内,并避开受保护文件;
- 审查者在固定的修正时间预算内接受变更;
- 在选定的观察窗口内没有出现代理引入的回归;以及
- 变更不需要回滚或紧急后续处理。
低风险固定装置使用更短的观察窗口,生产试验使用更长的观察窗口,但对所有候选项保持一致。一个结果可以在窗口关闭前保持“暂时接受”状态。这样可以防止一次快速合并后又发生昂贵回滚,却仍被计为成功。
不要让一名审查者决定补丁“看起来不错”。为每项任务写下可观察的规则。依赖更新可能要求锁定文件包含一个预期版本、漏洞扫描结果不超过基线、所有测试通过且没有无关软件包发生变化。错误修复可能要求此前失败的测试通过,同时不能删除或削弱该测试。
一种 Kiro 工作流仍可能产生三种不同的实验
从近期、有代表性的工作中选择 20–40 项任务。除了普通维护工作,也要纳入那些会消耗不成比例审查时间的失败。四类有用的任务包括小型错误修复、跨文件功能、依赖或配置变更,以及测试驱动的重构。
先将团队当前的 Kiro 选择与一个 GPT-5.6 候选项进行比较。固定 Kiro 版本、仓库提交、任务提示词、规范文档、引导规则、权限、工具、超时、代理步骤上限、重试策略、测试环境和验收评分器。如果首次比较支持增加另一个层级,则在第二轮加入它。一次改变模型、提示词、权限和任务拆分,会产生产品试点,而不是模型比较。
交替运行顺序,避免提供商变慢或仓库服务中断只影响一个候选项。将失败尝试保留在分母中。如果有人类介入,记录分钟数和修正类型,不要默默地把失败尝试转换成通过。
| 衡量项 | 为每个候选项记录 | 它为什么会改变决策 |
|---|---|---|
| 已验收变更 | 原始数量和尝试总数 | 提供分母;没有数量的百分比会隐藏不确定性 |
| Kiro 额度 | 总量及每次尝试变更的额度 | 显示当前倍率下的产品消耗 |
| 代理耗时 | 从开始到提交补丁的中位数和 p95 | 暴露平均值隐藏的慢尾 |
| 审查和修复 | 人工分钟数、审查轮次、请求的变更 | 将维护者工作纳入成本 |
| 验证失败 | 失败的目标测试、完整套件回归、代码检查/类型/安全失败 | 将打磨过的输出与仓库适配度区分开 |
| 范围失败 | 未请求的文件、依赖漂移、删除的测试、受保护路径编辑 | 捕捉任务成功分数可能遗漏的风险 |
| 运营失败 | 回退、回滚、事故、紧急后续处理 | 防止快速合并看起来比稳定变更更便宜 |
我们的 Gemini 思考级别分析(中文)展示了在提供商 token 价格可用时,模型调用价格、重试和回退成本如何相互作用。对于 Kiro,额度是原生的产品衡量方式。GitHub Copilot 模型退役分析(中文)展示了命名模型变化可能比其周围的产品更快。
成本只有在观察窗口关闭后才会出现
使用组织为审查和修复设定的人工费率。加上消耗的 Kiro 额度的边际价格、CI 或沙箱计算成本,以及任何已经衡量的回滚或事故费用。如果一次决策将包含的订阅额度视为零现金成本,就报告两次结果:一次按零边际额度费用计算,一次按当前附加额度费率计算。这样可以让容量假设变得可见。
total evaluated cost =
Kiro credit expense
+ CI and sandbox expense
+ reviewer and repair minutes × loaded cost per minute
+ measured rollback and incident expense
cost per completed change =
total evaluated cost / changes that cleared the full acceptance gate
当已验收变更数量为零时,绝不要用它作除数。将候选项报告为未通过门槛,同时给出总支出和失败类别。数值上的无穷大在数学上整洁,在运营上却没有帮助。
最好的结果可能是一项路由策略,而不是某个单一默认值。Luna 可以在小型、经过充分测试的变更上获胜,而 Terra 在跨文件工作上获胜;只有当更困难的任务原本需要多次失败尝试时,Sol 才可能更经济。Auto 可能仍然适合一般工作,但其不断变化的路由使它在精确模型可复现性重要时成为较弱的实验基线。
82% 的数字足以让 GPT-5.6 Terra 进入受控的 Kiro 试点,但不能结束采购或默认模型决策。只有当团队能够指出来自相同仓库、在相同门槛下的已验收补丁、失败运行、审查分钟数、额度消耗和回滚证据时,这项决策才算完成。
资料来源
- OpenAI: Advancing price-performance for developers with GPT-5.6 in Kiro
- Kiro models and current credit multipliers
- Kiro GPT-5.6 launch changelog
- Kiro GPT-5.6 Terra and Luna credit multiplier update
- Kiro pricing and included credits
- Terminal-Bench 2.1 repository and submission protocol
- Fathom analysis of GPT-5.6 in Kiro