Grok 4.7 的基準測試分數:它是否擊敗了所有模型?

Grok 4.7 在 AA 基準上獲得 46 分,排名第四,程式設計有進步但代幣成本上升。

2026-09-22 02:41約 5 分鐘閱讀

SpaceXAI 已推出 Grok 4.7,獨立評估將它排在領先 AI 實驗室中的第四名。

基準測試公司 Artificial Analysis 在其智慧指數中給了這個模型 46 分,比 Grok 4.6 高出 2 分。排名較高的是 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。

Grok 4.7 將 SpaceXAI 推入前四大 AI 實驗室

在發布之前,Elon Musk 表示該模型將基於一個 2.1 兆參數的系統,並超越所有現有模型。他還提到訓練過程中納入了來自 SpaceX 的數據。

Grok 4.7 來了。

這是一個比 Grok 4.6 在相同價格和速度下顯著的改進。pic.twitter.com/H3OTBbXyvO

— SpaceXAI (@SpaceXAI) 2026 年 9 月 21 日

在 AA-Briefcase(一個用於現實專業任務的基準)上,Grok 4.7 達到了 1657 Elo。這比 Grok 4.6 增加了 111 分,並使該模型接近 Claude Opus 5 的表現。

在 GDPval-AA 評估中,該模型獲得了 1695 Elo,比其前一代高出 90 分。程式設計測試結果也遵循了同樣的上升趨勢。

當與其程式設計代理 Grok Build 一起使用時,Grok 4.7 在 Coding Agent Index 上獲得了 56 分,比 Grok 4.6 高 9 分。

該模型已經超越了 GPT-5.6 Sol,現在僅落後於 Anthropic 的 Claude Fable 5.1、GPT-6 Astra 和 Opus 5。

「Grok 4.7 在 Artificial Analysis 智慧指數上獲得 46 分,使 SpaceXAI 進入前四大 AI 實驗室。Coding Agent Index 的表現也有所提升,超越了 GPT-5.6 Sol,」該貼文寫道。

在其他方面,該模型的進展很小。它在 Terminal-Bench 4.0 上增加了 4.5 個百分點,在 GDP.pdf 上增加了 3 分。然而,在 AA-LCR 和 AutomationBench-AA 測試上的分數有所下降。Grok 4.5 曾在 7 月登上 AutomationBench 榜首,支持了 Musk 關於它與 Claude Opus 匹配的說法。

這些進步伴隨著代幣成本

價格表沒有改變。Grok 4.7 仍定價為每百萬輸入代幣 2 美元,每百萬輸出代幣 6 美元。快取命中保持在 0.50 美元的折扣,50 萬代幣的上下文視窗也從 Grok 4.6 沿用下來。

然而,該模型每次回答所做的工作明顯更多。Artificial Analysis 測量到每個 Index 任務約有 81,000 個輸出代幣,而 Grok 4.6 為 36,000 個,GPT-6 Astra 為 27,000 個。因此,穩定的每代幣定價仍然會導致每個任務的成本更高。

這種代幣需求落在了一個已經報告 12.6 億美元虧損的部門上。與此同時,Musk 在 9 月 14 日表示,Grok 4.8 將在一周內完成訓練。

他還預計 Grok 5 將成為實現人工通用智慧的模型。下一個版本將測試 SpaceXAI 是否能在不增加計算成本的情況下提升排名。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章