Grok 4.6 的低词元价格并不意味着它是最便宜的模型

Grok 4.6 结合了较低的标价和报告中很强的基准成绩,但重试、失败任务、延迟和工具费用可能逆转表面上的优势。

分享这篇文章

SpaceXAI 发布了 Grok 4.6,其 API 定价从每百万输入词元 $2 和每百万输出词元 $6 起。Artificial Analysis 独立地将高推理版本列入其性价比前沿。两个事实都无法回答开发团队真正关心的问题:Grok 4.6 是否会以更低成本完成我们的工作?

可靠的判断方式,是让每个候选模型运行同一组有代表性的任务,应用通过或失败的验收规则,并将完整账单——包括失败尝试和重试——除以已接受结果的数量。词元价格是这个计算的输入,而不是结论。

已发布的证据没有证明 Grok 4.6 在编码方面普遍比 GPT-5.6 Sol 便宜。Grok 4.6 的列示词元价格更低,Artificial Analysis 也在自己的测试套件中测得了较强的成本效率。但公平比较需要两种模型使用相同的仓库任务、代理工作台、推理设置、工具、重试策略和评分器。如果模型生成更多词元、失败更频繁或需要更多人工修复,较低价格可能消失。

Grok 4.6 基准测试实际说明了什么

Grok 4.6 公告称,该模型专注于长时间运行的代理、编码和知识工作。公告报告 Artificial Analysis Intelligence Index 得分为 61,这也是 SpaceXAI 比较表中 GPT-5.6 Sol 的相同标题分数。Axios 描述这一结果称,它让 SpaceXAI 回到了接近模型前沿的位置。

综合分数掩盖了有意义的差异。SpaceXAI 自己的发布表格报告了以下结果,其背后使用了不同的基准测试所有者和代理工作台:

供应商报告的 Grok 4.6 和 GPT-5.6 Sol 部分基准结果
基准测试 Grok 4.6 high GPT-5.6 Sol max 差异提醒我们不要做什么
CursorBench 3.2 69.9% 67.2% 在这张表中,一种 IDE 风格的任务分布偏向 Grok。
DeepSWE 1.1 65.9% 73.0% 另一种软件工程测试反转了排序。
Terminal-Bench 3.0 26.0% 34.6% 综合分数和词元价格都无法预测终端任务成功率。

这些是供应商展示的结果,并不是本文进行的一次受控比较。Grok 4.6 模型卡片标明了基准版本、思考力度以及外部评估者或工作台。SpaceXAI 还指出,竞争对手的数据可能来自开发者发布的卡片或公共排行榜。因此,这张表适合用来选择测试,但本身不是干净的性价比实验。

Artificial Analysis 提供了第二个独立视角。在 2026 年 8 月 21 日的证据刷新中,其Grok 4.6 分析报告 Intelligence Index 得分为 61,每个指数任务的加权成本约为 $0.84。其实时的模型和提供商页面还报告称,通过测量的 SpaceXAI 端点,输出速度约为每秒 65.8 个词元,首词元时间为 51.53 秒。这些实时测量会随着提供商和基础设施变化而变化。

$0.84 不是你工作负载上每个成功任务的成本。Artificial Analysis 方法结合了九项英语、纯文本评估,将代理权重设为 34%、编码权重设为 24%,通常使用 pass-at-one 评分。其成本指标使用供应商报告的词元数量和测试套件的基准权重。这是有用的标准化比较,但它的任务组合、评分器、工具环境和重试行为可能与生产编码代理不匹配。

完整价格表改变了标题数字

当前 SpaceXAI 模型页面列出 Grok 4.6 每百万输入词元 $2、每百万缓存输入词元 $0.50、每百万输出词元 $6。发布说明表示,超过 200,000 个提示词词元的请求分别使用 $4、$1 和 $12 的更高费率。

Grok 4.6 API 指南列出 500,000 词元的上下文窗口以及 lowmediumhighxhigh 推理力度,其中默认值为 high。它还建议使用稳定的提示缓存键,因为路由到缓存冷服务器的对话可能需要支付完整输入费率。

在计算集成和人员时间之前,至少有六个成本变量:

  • 未缓存的输入词元;
  • 缓存的输入词元和观察到的缓存命中率;
  • 供应商收取的输出词元和隐藏推理词元;
  • 超过 200,000 个词元的提示词所适用的更高费率;
  • 失败的调用、被拒绝的答案和重试;以及
  • 单独收费的供应商工具或服务。

记录 API 返回的计费用量。用一个分词器估算每个供应商,可能让比较看起来一致,却与发票不一致。

成功与否决定低价是否重要

选择 20–50 个取自团队真实工作的任务。不要只根据某个模型的发布优势构建测试集。一个小型编码代理评估可以使用四类任务:

按工作负载划分的模型评估任务类别和验收门槛示例
任务类别 固定任务 验收门槛
代码修复 使用相同的工具和时间限制,修复一个小型仓库中预先植入的缺陷。 目标测试通过,完整测试套件没有回归,差异保持在范围内。
仓库导航 找到负责某项行为的模块,并解释其调用路径。 指定的文件和关系与维护者核验过的参考答案一致。
结构化工具使用 查询一个 fixture API,并返回要求的 JSON 模式。 所有必需的工具调用完成,模式验证通过。
长上下文知识工作 根据有版本的文档包回答一个决策问题。 每个有后果的主张都有所提供文档的支持。

在第一次运行前,固定每个提示词、仓库提交、fixture、工具定义、评分器和时间限制。即使更细致的评分标准有助于诊断失败,成本计算仍应使用二元验收决定。如果关键测试失败或编造了引用,润色过的答案仍不是已接受任务。

以随机或交替顺序运行候选模型,避免临时的供应商降速只影响一个模型。重复足够多的任务以暴露方差,并在样本足够时报告置信区间。样本非常小时,公布原始计数并称结果具有方向性。

已接受任务的成本包括被拒绝的尝试

对于每次 API 尝试,根据记录的用量计算供应商费用:

attempt cost = (uncached input × input rate + cached input × cache rate + output × output rate) / 1,000,000 + separate tool charges

然后将每次尝试都计入分子:

cost per accepted task = total cost of first attempts and retries / accepted tasks

假设一项 20 个任务的评估进行了 20 次首次尝试,并对 6 个被拒绝的结果进行重试。4 次重试通过,因此 26 次调用后接受了 18 个任务。如果这些调用成本为 $3.60,有用的数字是 $3.60 / 18 = $0.20 per accepted task。除以 26 次请求回答的是另一个问题,并会让失败看起来更便宜。

保持输出表格足够朴素,以便审计:

模型每个已接受任务成本比较中应报告的测量值
测量值 为什么应纳入结果
已接受任务 / 总任务 展示任务成功率,而不隐藏分母。
API 总支出 捕捉实际词元组合、缓存行为和重试。
每个已接受任务的成本 把支出与已完成工作联系起来。
首次尝试接受率和重试率 区分便宜且可靠的运行与反复发生的低价失败。
任务耗时中位数和第 95 百分位 暴露平均值可能掩盖的慢速异常值。
人工审查或修复分钟数 防止 API 节省掩盖额外人员工作。
输入、缓存、推理和回答词元 解释账单为何不同于标题费率。
失败类别 显示错误来自推理、工具、格式、限制还是供应商。

本文没有发布新的端点比较:没有为本文执行受控的 Grok 4.6 与竞争模型运行。上面的数字示例是说明性的,不是测量得到的模型结果。这一边界很重要,因为虚构的精确性会击败本文所推荐的评估方法。

实际决策规则

当 Grok 4.6 的已发布优势与团队工作重合,且团队能够承受观察到的端点延迟时,它值得进行特定工作负载的试验。从一种固定的推理力度和低于 200,000 词元价格门槛的提示词开始。将长上下文、更深入推理和工具作为独立实验加入,以便它们的影响保持可见。

只有当一个模型在产品需要的指标上胜出时才采用它:每美元接受的工作量、每分钟接受的工作量,或每位审查者每小时接受的工作量。将可靠性、数据处理、速率限制、区域可用性和迁移成本作为明确的决策列,而不要试图把它们压缩为一个基准分数。

我们的 AI 评估说明解释了测试设计为何会塑造产品行为。Qwen 本地部署分析将同一原则应用于硬件、内存和运营成本。对 Grok 4.6 而言,下一项有用结果不是另一张综合排行榜截图,而是证据表明较低词元费率经得起重试、失败、延迟以及已接受结果的发票检验。

资料来源

  1. SpaceXAI Grok 4.6 announcement
  2. Grok 4.6 model card
  3. SpaceXAI Grok 4.6 API documentation
  4. SpaceXAI Grok 4.6 model pricing
  5. SpaceXAI API release notes
  6. Artificial Analysis Grok 4.6 benchmark analysis
  7. Artificial Analysis Grok 4.6 model and provider results
  8. Artificial Analysis intelligence benchmarking methodology
  9. Axios on Grok 4.6 returning SpaceXAI to the model frontier