Gemini 3.7 Flash 价格翻倍,但更高推理等级仍可能成本更低

Gemini 3.7 Flash 将于 2027 年 1 月涨价,而最便宜的推理等级仍取决于验收率、重试、延迟和回退成本。

分享这篇文章

Google 已让 Gemini 3.7 Flash 正式可用,并提供三个推理等级——lowmediumhigh——在令牌使用量和延迟之间作出取舍,从而带来不同的推理行为。它也为该模型设置了价格时钟。标准全球 API 费率在 2026 年 12 月 31 日之前为每百万输入令牌 0.75 美元、每百万输出令牌 3.75 美元,之后于 1 月 1 日翻倍。

但这仍不意味着 low 一定便宜,或 high 一定昂贵。有用的比较是总支出除以已验收任务数,并计入被拒尝试、重试、回退工作和经过时间。 如果一个等级更常通过同一项外部验收测试,那么即使它每次调用成本更高,也可能每个可用结果成本更低。

下面的计算器将 Google 发布的两个价格时段应用于读者工作负载的测量结果。它的默认数字是虚构的,不代表 Gemini 基准测试。

价格翻倍,但决定并不会因此简化

Google 的 Gemini 3.7 Flash 开发者指南gemini-3.7-flash 列为可用于生产的模型,拥有一百万令牌的上下文窗口、最多 64,000 个输出令牌,并将 medium 作为默认推理等级。Google 将 low 描述为面向延迟的设置,将 medium 描述为通用默认值,将 high 描述为用于更困难推理和工具使用的选项,但令牌消耗和成本更高。

这些描述是起始假设,而不是路由策略。“困难”不是 API 字段,自信的答案也不一定是已验收的答案。团队仍必须在模型之外定义成功标准,例如测试通过、所需模式验证通过、引文支持每项实质性主张,或与人工批准的参考答案匹配。

Google Cloud 费率卡明确列出了标准全球服务的定时成本变化:

价格时段每百万输入令牌每百万文本输出和推理令牌
截至 2026 年 12 月 31 日$0.75$3.75
自 2027 年 1 月 1 日起$1.50$7.50

同一页面还列出了非全球区域、缓存输入、优先级以及弹性/批处理的单独费率。计算器有意排除这些变体,避免悄悄混合不同的服务。它也将输出令牌和计费的推理令牌放在一起处理,与 Google 的价格类别保持一致。

按已验收任务计算的成本会改变表面上的赢家

在每个推理等级运行同一组冻结任务,然后输入汇总平均值或每次尝试的平均值。“尝试”包括重试;“已验收任务”只统计通过测试前就写好的规则的结果。回退成本可以代表另一次模型调用、确定性的恢复路径或单独估算的修复费用,但三个等级必须使用同一定义。

工作负载计算器

按已验收工作量比较推理等级

用同一组冻结任务的实测数据替换虚构默认值。输出令牌应包含计费的推理令牌。延迟按串行经过时间处理;计算器不对并发进行建模。

低 推理
中 推理
高 推理

当前显示虚构示例。在做部署决策前,请输入自己实测的工作负载数据。

Gemini 3.7 Flash 标准全球定价,已于 2026 年 8 月 24 日核实。当前费率截止于 2026 年 12 月 31 日。
推理已验收 / 尝试拒绝负担当前 API / 已验收1 月 API / 已验收当前 API + 回退 / 已验收每个已验收任务的串行分钟数
78 / 10028.2%US$0.00673US$0.01346US$0.020830.32
88 / 10013.6%US$0.0081US$0.01619US$0.014910.51
93 / 1007.5%US$0.01129US$0.02258US$0.015050.86

包含:标准全球输入和文本输出费率。不包含:缓存输入、非全球区域、优先或弹性/批处理服务、工具、存储、网络、税费、人员时间和提供商特定折扣。

静态计算如下:

API cost per attempt =
  (input tokens × input rate + output-and-reasoning tokens × output rate)
  / 1,000,000

API cost per accepted task =
  (API cost per attempt × all attempts) / accepted tasks

Effective cost per accepted task =
  (total API cost + rejected attempts × fallback cost) / accepted tasks

Serial minutes per accepted task =
  (minutes per attempt × all attempts) / accepted tasks

对于虚构的默认值,low 在 100 次尝试中产生 78 个已验收任务,medium 产生 88 个,high 产生 93 个。当前仅 API 的每个已验收任务成本约为 0.00673 美元、0.00810 美元和 0.01129 美元。若每次被拒尝试收取虚构的 0.05 美元回退成本,总额约变为 0.02083 美元、0.01491 美元和 0.01505 美元。在这个虚构的工作负载中,medium 在有效成本上略胜,尽管 low 的令牌账单最小,而 high 验收的工作最多。

这个结果并不是建议选择 medium。它说明令牌价格、验收率和恢复费用为什么应放在同一项计算中。

独立基准测试有助于选择测试,而不是选择赢家

Artificial Analysis 对三个推理等级都进行了测试,并报告了不同的智能指数分数、每项任务耗时、输出速度和每项任务成本。在其测试套件中,high 的分数高于 medium 和 low,而按照入门费率,medium 的每项指数任务花费少于 high。

这些结果提供了有用证据,说明该控制项会改变可观察行为。但它们没有提供读者产品的验收率或令牌数量。Artificial Analysis 使用自己的基准组合、权重、测试工具和评分器。支持回答工作流、代码修复代理、文档提取器和多模态检查系统可能会反转这一排序,因为它们以不同方式失败。

Google 的 Gemini 3.7 Flash 模型卡划出了类似的边界。它展示了推理、编码、代理工具使用、多模态任务、多语言性能和长上下文方面的评估,同时指出该模型适合若干宽泛的使用场景。基准测试表支持测试计划,但不能为未经测试的工作负载确立生产适用性。

推理等级同时改变质量和账单

在第一次比较中只改变 thinking_level。保持确切的模型 ID、提示词、夹具、工具定义、上下文、最大输出、重试规则、区域、并发数、超时和验收评分器不变。记录 API 报告的使用量,而不是用通用分词器估算所有等级。

使用从真实工作中抽样的任务,包括普通案例和代价高昂的失败。以随机或交替顺序运行各个等级,避免提供商短暂变慢只影响一个候选项。当样本较小时,公布原始的已验收数和尝试数;没有分母的百分比会隐藏不确定性。

延迟也需要同样的纪律。计算器报告每个已验收任务的串行分钟数,因为这可以从五个输入审计得出。它不会预测并发系统。至少分别跟踪中位数和尾部延迟,因为某个推理等级可能平均看起来高效,却错过产品的 p95 截止时间。

Grok 4.6 成本分析解释了模型之间同一个分母问题。通用 AI 评估说明说明了为什么所选择的成功指标会塑造产品。

盈亏平衡点必须经得起账单检验

对每个推理等级,保留四个单独的决策列:

  • 每个已验收任务的 API 成本;
  • 定义的回退之后的有效成本;
  • 每经过一分钟验收的任务数;以及
  • 每个已验收任务所需的人工审查或修复分钟数。

然后选择在最低相关成本下满足产品质量和延迟门槛的等级。如果没有任何等级通过门槛,答案并不会自动变成“使用 high”。提示词、工具、任务分解、模型或回退方案可能需要改变。

在 2027 年 1 月 1 日之前重新计算。按照当前记录的标准全球计划,仅 API 成本会翻倍,但当回退或人员费用占主导时,有效成本的涨幅可能低于 100%。相反,恢复费用可以忽略的工作流会感受到几乎完整的费率变化。

在加入真实部署中的缓存令牌、服务模式、区域、工具、网络费用、速率限制、错误、折扣、税费和并发之前,不要使用这个简化计算器预测账单。Google 也可能改变价格或可用性。每次决策都要保存费率卡 URL 和核验时间戳。

1 月的变化是一个有用的截止时间,因为它会阻止促销价格变成未被注意到的架构假设。持久的结果不是某个偏爱的推理等级,而是冻结的工作负载、外部通过规则,以及足够的计费和失败证据,以便在模型或价格发生变化时重新运行决定。

资料来源

  1. Google AI for Developers: What’s new in Gemini 3.7 Flash
  2. Google Cloud Agent Platform pricing
  3. Google DeepMind Gemini 3.7 Flash model card
  4. Artificial Analysis: Gemini 3.7 Flash on the intelligence versus time frontier