Artificial Analysis对Grok 4.6进行了独立深度评测,结果显示这款模型在Agent任务上表现尤为出色,同时在成本效率方面建立了显著优势。Grok 4.6在AI智能指数(九项基准测试的复合评分)中获得61分,较Grok 4.5提升5分,较Grok 4.3提升23分。


评测的核心发现是:Grok 4.6的Agent能力突出于静态推理能力之上。模型在多轮交互、工具使用型任务中表现最佳。在GDPval-AA v2(Agent能力评估)中取得1753 Elo,仅次于Claude Opus 5;在τ³-Banking银行业务Agent测试中获得50.7%的分数,与Qwen3.8 Max并列前两名;在Terminal-Bench v2.1中获得88.4%,与领先模型持平。

在AA-Briefcase长周期知识工作评测中,Grok 4.6达到Fable 5级别的表现,在评分标准、展示质量和分析质量三个维度上表现均衡。但最令人印象深刻的是其效率优势:Grok 4.6平均仅用53个回合完成Briefcase任务,而Claude Opus 5平均需要103个回合——几乎翻倍。在输入token消耗上,Grok 4.6约5亿token,Claude Opus 5约20亿token,差距达4倍。
成本方面,Grok 4.6的定价(2美元/6美元每百万输入/输出token)比Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)低60%以上。实测每个任务的平均成本仅为0.84美元。与Kimi K3相同,但智能水平略高。这种智能与成本的组合使Grok 4.6在AI智能指数中每一项Agent评估的成本-性能帕累托前沿上都占据了一席之地。

不足之处在于上下文窗口仍维持在50万token,缓存命中价格从每百万0.30美元涨至0.50美元。此外,在纯推理类评估中的提升幅度相对Agent类任务较小。
Artificial Analysis的结论很明确:如果你需要的是Agent能力——让模型自主完成多步骤任务、使用工具、处理复杂工作流——Grok 4.6以远低于竞品的价格提供了接近顶尖水平的表现。
参考来源: