xAI于2026年8月12日正式发布Grok 4.6,在AI智能指数(Artificial Analysis Intelligence Index)上获得61分,追平了GPT-5.6 Sol(Max),仅落后Claude Opus 5(63分)和Claude Fable 5(62分,含fallback)。

Grok 4.6在Grok 4.5基础上进行了扩展训练,核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,结合高质量工程数据和改进的优化器。Grok 4.5被用于重新生成SFT(监督微调)轨迹,涵盖推理、代理工具使用,以及STEM、软件工程和知识工作等领域。模型还在广泛的代理强化学习任务上进行了训练,包括知识工作、通用编码、内核优化、网页开发和计算机辅助设计。
在Agent类基准测试中,Grok 4.6表现尤为突出。GDPval-AA v2达到1753 Elo,仅次于Claude Opus 5;DeepSWE v1.1达到65.9%,较Grok 4.5(54%)大幅提升;APEX-Agents从47.1%跃升至57.5%;Terminal-Bench v3.0从15.7%提升至26%。在CursorBench v3.2上获得69.9%,在FrontierCode v1.1上获得61.3%。

值得注意的是,Grok 4.6在成本效率方面具有显著优势。定价维持在每百万输入token 2美元、每百万输出token 6美元,比Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)低60%以上。在AA-Briefcase长周期知识工作基准中,Grok 4.6平均仅用53个回合和约5亿输入token完成任务,而Claude Opus 5则需要约103个回合和约20亿token。
模型已通过Cursor、Grok Build、API以及OpenRouter、Vercel和Cloudflare等合作伙伴提供。首周在Grok Build和Cursor中提供2倍用量优惠。上下文窗口维持在50万token。
参考来源: