买币
行情
🔥
预测市场

Grok 4.7基准测试得分:它是否超越了所有模型?

Grok 4.7在AA基准测试中得分为46,排名第四,编码能力有所提升,但token成本上升。

2026-09-22 02:41约 5 分钟阅读

SpaceXAI已发布Grok 4.7,独立评估将其在领先AI实验室中排名第四。

基准测试公司Artificial Analysis在其实力指数上给该模型打了46分,比Grok 4.6高出2分。排名更高的是Claude Fable 5.1、GPT-6 Astra和Claude Opus 5。

Grok 4.7将SpaceXAI带入前四名AI实验室

在发布之前,埃隆·马斯克表示,该模型将基于一个2.1万亿参数的系统,并超越所有现有模型。他还提到,训练过程中整合了SpaceX的数据。

Grok 4.7来了。

它在相同价格和速度下比Grok 4.6有显著改进。pic.twitter.com/H3OTBbXyvO

— SpaceXAI (@SpaceXAI) 2026年9月21日

在针对真实专业任务的基准测试AA-Briefcase中,Grok 4.7达到了1657 Elo。这比Grok 4.6提高了111分,使模型性能接近Claude Opus 5。

在GDPval-AA评估中,该模型得分为1695 Elo,比前代高出90分。编码测试结果也呈现同样的上升趋势。

当与其编码代理Grok Build一起使用时,Grok 4.7在编码代理指数上得分为56,比Grok 4.6高出9分。

该模型已超越GPT-5.6 Sol,目前仅落后于Anthropic的Claude Fable 5.1、GPT-6 Astra和Opus 5。

“Grok 4.7在Artificial Analysis实力指数上得分为46,使SpaceXAI进入前四名AI实验室。编码代理指数表现也有所提升,超越了GPT-5.6 Sol,”帖子写道。

在其他方面,该模型的进步微乎其微。它在Terminal-Bench 4.0上提升了4.5个百分点,在GDP.pdf上提升了3点。然而,在AA-LCR和AutomationBench-AA测试中得分下降。Grok 4.5曾在7月登顶AutomationBench,支持了马斯克称其与Claude Opus相当的声明。

进步伴随着token账单

费率表未变。Grok 4.7的价格仍为每百万输入token 2美元,每百万输出token 6美元。缓存命中折扣仍为0.50美元,50万token的上下文窗口继承自Grok 4.6。

然而,该模型每次回答的工作量显著增加。Artificial Analysis测量到每个指数任务大约输出81,000个token,而Grok 4.6为36,000个,GPT-6 Astra为27,000个。因此,稳定的逐token定价仍导致每个任务的成本更高。

这种token消耗量落在了一个已报告12.6亿美元亏损的部门身上。与此同时,马斯克在9月14日表示,Grok 4.8将在一周内完成训练。

他还期望Grok 5成为实现通用人工智能的模型。下一次发布将测试SpaceXAI是否能在不增加计算成本的情况下提升排名。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章