Grok 4.6 的低词元价格并不意味着它是最便宜的模型
Grok 4.6 结合了较低的标价和报告中很强的基准成绩,但重试、失败任务、延迟和工具费用可能逆转表面上的优势。
SpaceXAI 发布了 Grok 4.6,其 API 定价从每百万输入词元 $2 和每百万输出词元 $6 起。Artificial Analysis 独立地将高推理版本列入其性价比前沿。两个事实都无法回答开发团队真正关心的问题:Grok 4.6 是否会以更低成本完成我们的工作?
可靠的判断方式,是让每个候选模型运行同一组有代表性的任务,应用通过或失败的验收规则,并将完整账单——包括失败尝试和重试——除以已接受结果的数量。词元价格是这个计算的输入,而不是结论。
已发布的证据没有证明 Grok 4.6 在编码方面普遍比 GPT-5.6 Sol 便宜。Grok 4.6 的列示词元价格更低,Artificial Analysis 也在自己的测试套件中测得了较强的成本效率。但公平比较需要两种模型使用相同的仓库任务、代理工作台、推理设置、工具、重试策略和评分器。如果模型生成更多词元、失败更频繁或需要更多人工修复,较低价格可能消失。
Grok 4.6 基准测试实际说明了什么
Grok 4.6 公告称,该模型专注于长时间运行的代理、编码和知识工作。公告报告 Artificial Analysis Intelligence Index 得分为 61,这也是 SpaceXAI 比较表中 GPT-5.6 Sol 的相同标题分数。Axios 描述这一结果称,它让 SpaceXAI 回到了接近模型前沿的位置。
综合分数掩盖了有意义的差异。SpaceXAI 自己的发布表格报告了以下结果,其背后使用了不同的基准测试所有者和代理工作台:
| 基准测试 | Grok 4.6 high | GPT-5.6 Sol max | 差异提醒我们不要做什么 |
|---|---|---|---|
| CursorBench 3.2 | 69.9% | 67.2% | 在这张表中,一种 IDE 风格的任务分布偏向 Grok。 |
| DeepSWE 1.1 | 65.9% | 73.0% | 另一种软件工程测试反转了排序。 |
| Terminal-Bench 3.0 | 26.0% | 34.6% | 综合分数和词元价格都无法预测终端任务成功率。 |
这些是供应商展示的结果,并不是本文进行的一次受控比较。Grok 4.6 模型卡片标明了基准版本、思考力度以及外部评估者或工作台。SpaceXAI 还指出,竞争对手的数据可能来自开发者发布的卡片或公共排行榜。因此,这张表适合用来选择测试,但本身不是干净的性价比实验。
Artificial Analysis 提供了第二个独立视角。在 2026 年 8 月 21 日的证据刷新中,其Grok 4.6 分析报告 Intelligence Index 得分为 61,每个指数任务的加权成本约为 $0.84。其实时的模型和提供商页面还报告称,通过测量的 SpaceXAI 端点,输出速度约为每秒 65.8 个词元,首词元时间为 51.53 秒。这些实时测量会随着提供商和基础设施变化而变化。
$0.84 不是你工作负载上每个成功任务的成本。Artificial Analysis 方法结合了九项英语、纯文本评估,将代理权重设为 34%、编码权重设为 24%,通常使用 pass-at-one 评分。其成本指标使用供应商报告的词元数量和测试套件的基准权重。这是有用的标准化比较,但它的任务组合、评分器、工具环境和重试行为可能与生产编码代理不匹配。
完整价格表改变了标题数字
当前 SpaceXAI 模型页面列出 Grok 4.6 每百万输入词元 $2、每百万缓存输入词元 $0.50、每百万输出词元 $6。发布说明表示,超过 200,000 个提示词词元的请求分别使用 $4、$1 和 $12 的更高费率。
Grok 4.6 API 指南列出 500,000 词元的上下文窗口以及 low、medium、high 和 xhigh 推理力度,其中默认值为 high。它还建议使用稳定的提示缓存键,因为路由到缓存冷服务器的对话可能需要支付完整输入费率。
在计算集成和人员时间之前,至少有六个成本变量:
- 未缓存的输入词元;
- 缓存的输入词元和观察到的缓存命中率;
- 供应商收取的输出词元和隐藏推理词元;
- 超过 200,000 个词元的提示词所适用的更高费率;
- 失败的调用、被拒绝的答案和重试;以及
- 单独收费的供应商工具或服务。
记录 API 返回的计费用量。用一个分词器估算每个供应商,可能让比较看起来一致,却与发票不一致。
成功与否决定低价是否重要
选择 20–50 个取自团队真实工作的任务。不要只根据某个模型的发布优势构建测试集。一个小型编码代理评估可以使用四类任务:
| 任务类别 | 固定任务 | 验收门槛 |
|---|---|---|
| 代码修复 | 使用相同的工具和时间限制,修复一个小型仓库中预先植入的缺陷。 | 目标测试通过,完整测试套件没有回归,差异保持在范围内。 |
| 仓库导航 | 找到负责某项行为的模块,并解释其调用路径。 | 指定的文件和关系与维护者核验过的参考答案一致。 |
| 结构化工具使用 | 查询一个 fixture API,并返回要求的 JSON 模式。 | 所有必需的工具调用完成,模式验证通过。 |
| 长上下文知识工作 | 根据有版本的文档包回答一个决策问题。 | 每个有后果的主张都有所提供文档的支持。 |
在第一次运行前,固定每个提示词、仓库提交、fixture、工具定义、评分器和时间限制。即使更细致的评分标准有助于诊断失败,成本计算仍应使用二元验收决定。如果关键测试失败或编造了引用,润色过的答案仍不是已接受任务。
以随机或交替顺序运行候选模型,避免临时的供应商降速只影响一个模型。重复足够多的任务以暴露方差,并在样本足够时报告置信区间。样本非常小时,公布原始计数并称结果具有方向性。
已接受任务的成本包括被拒绝的尝试
对于每次 API 尝试,根据记录的用量计算供应商费用:
attempt cost = (uncached input × input rate + cached input × cache rate + output × output rate) / 1,000,000 + separate tool charges
然后将每次尝试都计入分子:
cost per accepted task = total cost of first attempts and retries / accepted tasks
假设一项 20 个任务的评估进行了 20 次首次尝试,并对 6 个被拒绝的结果进行重试。4 次重试通过,因此 26 次调用后接受了 18 个任务。如果这些调用成本为 $3.60,有用的数字是 $3.60 / 18 = $0.20 per accepted task。除以 26 次请求回答的是另一个问题,并会让失败看起来更便宜。
保持输出表格足够朴素,以便审计:
| 测量值 | 为什么应纳入结果 |
|---|---|
| 已接受任务 / 总任务 | 展示任务成功率,而不隐藏分母。 |
| API 总支出 | 捕捉实际词元组合、缓存行为和重试。 |
| 每个已接受任务的成本 | 把支出与已完成工作联系起来。 |
| 首次尝试接受率和重试率 | 区分便宜且可靠的运行与反复发生的低价失败。 |
| 任务耗时中位数和第 95 百分位 | 暴露平均值可能掩盖的慢速异常值。 |
| 人工审查或修复分钟数 | 防止 API 节省掩盖额外人员工作。 |
| 输入、缓存、推理和回答词元 | 解释账单为何不同于标题费率。 |
| 失败类别 | 显示错误来自推理、工具、格式、限制还是供应商。 |
本文没有发布新的端点比较:没有为本文执行受控的 Grok 4.6 与竞争模型运行。上面的数字示例是说明性的,不是测量得到的模型结果。这一边界很重要,因为虚构的精确性会击败本文所推荐的评估方法。
实际决策规则
当 Grok 4.6 的已发布优势与团队工作重合,且团队能够承受观察到的端点延迟时,它值得进行特定工作负载的试验。从一种固定的推理力度和低于 200,000 词元价格门槛的提示词开始。将长上下文、更深入推理和工具作为独立实验加入,以便它们的影响保持可见。
只有当一个模型在产品需要的指标上胜出时才采用它:每美元接受的工作量、每分钟接受的工作量,或每位审查者每小时接受的工作量。将可靠性、数据处理、速率限制、区域可用性和迁移成本作为明确的决策列,而不要试图把它们压缩为一个基准分数。
我们的 AI 评估说明解释了测试设计为何会塑造产品行为。Qwen 本地部署分析将同一原则应用于硬件、内存和运营成本。对 Grok 4.6 而言,下一项有用结果不是另一张综合排行榜截图,而是证据表明较低词元费率经得起重试、失败、延迟以及已接受结果的发票检验。
资料来源
- SpaceXAI Grok 4.6 announcement
- Grok 4.6 model card
- SpaceXAI Grok 4.6 API documentation
- SpaceXAI Grok 4.6 model pricing
- SpaceXAI API release notes
- Artificial Analysis Grok 4.6 benchmark analysis
- Artificial Analysis Grok 4.6 model and provider results
- Artificial Analysis intelligence benchmarking methodology
- Axios on Grok 4.6 returning SpaceXAI to the model frontier