本文数据核验时间为 2026 年 8 月 13 日。模型价格、排行榜名次和可用平台可能继续变化,请以文末原始资料为准。
2026 年 8 月 12 日,xAI(官方页面现使用 SpaceXAI 品牌)正式发布 Grok 4.6。与单纯追求更高单项分数相比,这次升级更加集中在长时间运行的 Agent、代码库级任务、知识工作以及交互式应用开发。
先说结论:Grok 4.6 已经进入当前前沿模型行列,独立评测也验证了其 61 分的 Artificial Analysis Intelligence Index。不过,它并不是所有项目上的第一名,发布次日可用的独立数据仍然有限。
Grok 4.6 核心规格
根据 xAI 官方 API 文档,Grok 4.6 的公开规格如下:
| 项目 |
Grok 4.6 |
| 发布时间 |
2026 年 8 月 12 日 |
| API 模型 ID |
grok-4.6 |
| 上下文窗口 |
500,000 tokens |
| 知识截止日期 |
2026 年 2 月 1 日 |
| 输入模态 |
文本、图片 |
| 输出模态 |
文本 |
| 推理强度 |
low、medium、high、xhigh |
| 默认推理强度 |
high |
| API |
Responses API、Chat Completions |
| 内置工具 |
Function Calling、Web Search、X Search、Code Execution |
| 可用平台 |
xAI API、Grok Build、Cursor、OpenRouter、Vercel、Cloudflare |
官方文档将其定位为面向编程、Agent 任务和知识工作的前沿模型。
需要特别说明的是,xAI 将文本输出限制标记为“No text output limit”。更准确的理解是:官方没有公布一个单独的最大文本输出 token 数,而不是模型能够真正无限输出。实际请求仍会受到上下文窗口、API 行为和账户限制影响。
另外,xAI 尚未公开 Grok 4.6 的参数规模、MoE 架构细节或激活参数数量。网上流传的“1.5T”“2T”等参数说法目前没有可靠的官方依据,不建议写入正式介绍。
这次升级重点是什么?
xAI 表示,Grok 4.6 在 Grok 4.5 的基础上进行了更长时间的补充训练,加入了模型生成的推理与高级技术数据、高质量工程数据,并改进了优化器和训练方案。
随后,xAI 使用 Grok 4.5 重新生成了覆盖 STEM、软件工程、知识工作和不同 Agent Harness 的监督微调轨迹,再通过模型检查过滤问题轨迹。
强化学习阶段则覆盖了知识工作、通用编程、内核优化、Web 开发和计算机辅助设计等 Agent 环境。
这些变化对应着一个明确方向:让模型不只完成一次问答,而是能够在多步骤任务中持续研究、调用工具、修改代码、自我检查并迭代结果。
独立评测结果怎么样?
Artificial Analysis:独立跑出 61 分
Artificial Analysis 已经完成对 Grok 4.6 High 的独立测试,而不是简单转载 xAI 的宣传成绩。
截至本文核验时,其结果为:
| 指标 |
结果 |
| Intelligence Index v4.1.1 |
61 |
| 详情页显示排名 |
第 6 / 183 |
| 完整评测输出量 |
约 7200 万 tokens |
| 完整评测成本 |
1,068.47 美元 |
| 输出速度 |
暂无数据 |
这一综合指数由九项评测组成,包括 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR。
需要注意,第 6/183 是页面当时显示的动态排名,并不是永久固定的“全球第六”。随着更多模型加入、评测版本变化,排名还会调整。
Arena:1464 分,但仍属于初步成绩
Arena Text Leaderboard 已经收录 grok-4.6-high,当前数据显示:
| 指标 |
结果 |
| Arena Score |
1464 ± 12 |
| 当前名次 |
第 43 |
| 名次区间 |
18–64 |
| 投票数量 |
2,448 |
| 状态 |
Preliminary |
这项成绩仍被标记为“Preliminary”。目前投票量较少、置信区间较宽,因此不适合据此直接判断模型最终排名。
Artificial Analysis 与 Arena 的结果也不矛盾:前者更偏向知识、推理、编程和 Agent 基准,后者主要衡量真实用户的对话偏好,两者测试的能力并不相同。
xAI 官方公布的基准成绩
以下数据来自 Grok 4.6 官方发布页。Grok 4.6 和 Grok 4.5 使用 High 推理强度,对比模型使用 Max 档位。
| Benchmark |
Grok 4.6 |
Grok 4.5 |
GPT-5.6 Sol |
Fable 5 |
| AA Intelligence Index |
61 |
56 |
61 |
62 |
| GDPVal-AA v2 |
1753 |
1526 |
1728 |
1741 |
| CursorBench v3.2 |
69.9% |
66.7% |
67.2% |
70.5% |
| DeepSWE v1.1 |
65.9% |
54.0% |
73.0% |
70.0% |
| FrontierCode v1.1 Extended |
61.3% |
56.6% |
60.6% |
63.6% |
| APEX-Agents |
57.5% |
47.1% |
56.7% |
59.2% |
| Terminal-Bench v3.0 |
26.0% |
15.7% |
34.6% |
34.1% |
| APEX-SWE |
56.4% |
53.6% |
— |
58.8% |
| AA-Briefcase |
1577 |
1313 |
1502 |
1574 |
| Harvey LAB(Vals) |
15.8% |
12.9% |
2.5% |
11.3% |
从这张表可以得到几个相对稳妥的结论:
- Grok 4.6 在官方列出的十项测试中全部超过 Grok 4.5。
- AA Intelligence Index 从 56 提升到 61,与 GPT-5.6 Sol 持平,落后 Fable 5 一分。
- DeepSWE 从 54% 提升至 65.9%,但仍落后两款主要对比模型。
- Terminal-Bench 从 15.7% 提升到 26%,进步明显,但与 34% 左右的领先成绩仍有距离。
- 在 GDPVal-AA、AA-Briefcase 和 Harvey LAB 三项中,Grok 4.6 是这张对比表里的最高分。
- 在 CursorBench、FrontierCode、APEX-Agents 和 APEX-SWE 等项目中,Fable 5 仍然领先。
但这张表不能被描述为“完全相同条件下的独立横评”。
xAI 明确说明,竞品数据取自各开发商发布的系统卡或公开排行榜,并采用自报结果或公开结果中的最佳值。发布页也没有公开完整 Prompt、运行次数、Harness、Pass@k、工具权限和 token 预算。
因此,更准确的说法是“xAI 官方发布页汇总的对比数据”,而不是“所有模型在统一环境中的权威排名”。
API 价格与长上下文成本
Grok 4.6 的标准 API 价格如下:
| 请求范围 |
输入 |
缓存输入 |
输出 |
| 输入少于 200K tokens |
$2 / 1M |
$0.50 / 1M |
$6 / 1M |
| 输入达到或超过 200K |
$4 / 1M |
$1 / 1M |
$12 / 1M |
当输入达到 200K tokens 后,整次请求都会按长上下文价格计费,而不只是超过 200K 的部分。
例如:
- 100K 输入加 10K 输出,不考虑缓存时约为
$0.26。
- 250K 输入加 10K 输出,会进入长上下文计价,约为
$1.12。
这意味着 50 万上下文虽然适合大型代码库、长文档和持续 Agent 会话,但并不代表应该无差别地塞入全部历史内容。合理使用缓存和上下文压缩会显著影响实际成本。
xAI 建议 Responses API 请求设置 prompt_cache_key;Chat Completions 则可以使用 x-grok-conv-id,让同一会话更稳定地路由至相同服务器,提高缓存命中率。长时间 Agent 循环还可以配合 Context Compaction。
Web Search、X Search 和 Code Execution 的公开价格均为每 1,000 次调用 5 美元,工具调用过程中产生的模型 token 仍会另外计费。
官方还提到存在两倍价格的快速处理方式,但目前没有公开独立的 grok-4.6-fast 模型 ID。开发者不应自行杜撰该名称,公开可确认的模型 ID 仍然是 grok-4.6。
Grok 4.6 适合哪些场景?
从目前规格和评测来看,Grok 4.6 更适合以下任务:
- 需要连续执行多个步骤的研究与知识工作;
- 跨文件、跨模块的大型代码库分析;
- 需要搜索、代码执行和函数调用的 Agent;
- 从产品想法快速生成可交互应用原型;
- 长文档、图片和文本混合分析;
- 需要更高推理预算的复杂工程问题。
如果业务主要是简单分类、短文本摘要或追求极低延迟,Grok 4.6 未必是成本最优的选择。Artificial Analysis 暂时也没有公布它的输出速度和首 token 延迟,因此目前还不能对实时交互体验做出可靠判断。
目前仍有哪些不确定性?
截至 2026 年 8 月 13 日,Grok 4.6 仍处于发布初期:
- Arena 的成绩仍是 Preliminary;
- Terminal-Bench 官方榜尚未收录 Grok 4.6;
- SWE-bench 官方榜尚未收录 Grok 4.6;
- LiveBench、Aider Polyglot 和 ARC Prize 暂未出现 Grok 4.6;
- LMArena Agent Arena 暂未收录该模型;
- xAI Safety 页面尚未发布独立的 Grok 4.6 PDF 模型卡;
- 官方没有公开模型参数量与完整训练架构。
因此,网上出现的 Grok 4.6 SWE-bench、HLE 或 Terminal-Bench 单项数字,需要检查究竟来自 xAI 宣传图、第三方复测还是二手转载。尤其不能把 Grok 4.5、Grok 4 或其他版本的成绩直接算到 Grok 4.6 名下。
总结
Grok 4.6 的重点不是单纯增加上下文,而是提升模型在长时间、多步骤 Agent 任务中的持续执行能力。
独立的 Artificial Analysis 61 分说明它已经处于前沿模型梯队;xAI 公布的十项测试也显示,它相较 Grok 4.5 获得了全面提升。但 Arena 仍处于初步阶段,多项主流公开榜单尚未收录,因此现在就宣称它“全面第一”并不严谨。
对于需要代码库级分析、工具调用、长文档处理和持续 Agent 工作流的开发者,Grok 4.6 值得测试。对于重视延迟、稳定性和严格可复现评测的团队,则建议等待更多独立结果,并先用自身任务集完成小规模验证。
参考资料