Grok 4.7のベンチマークスコア:すべてのモデルを上回ったのか?

Grok 4.7はAAベンチマークで46点を獲得し、第4位にランクイン。コーディング能力は向上したが、トークンコストは上昇した。

22/09/2026 02:41約 6 分で読めます

SpaceXAIはGrok 4.7をリリースし、独立した評価では主要AIラボの中で第4位に位置付けられています。

ベンチマーク企業のArtificial Analysisは、このモデルにIntelligence Indexで46点のスコアを与えました。これはGrok 4.6より2ポイント高い数字です。より高い順位には、Claude Fable 5.1、GPT-6 Astra、Claude Opus 5が名を連ねています。

Grok 4.7、SpaceXAIをトップ4のAIラボに押し上げる

リリース前、イーロン・マスクは述べていた、このモデルは2.1兆パラメータのシステムに基づき、既存のすべてのモデルを凌駕するだろうと。また、トレーニングプロセスにはSpaceXのデータが組み込まれているとも述べていました。

Grok 4.7が登場しました。

同じ価格と速度でGrok 4.6からの顕著な改良です。pic.twitter.com/H3OTBbXyvO

— SpaceXAI (@SpaceXAI) 2026年9月21日

現実の専門的タスク向けベンチマークAA-Briefcaseでは、Grok 4.7は1657 Eloを達成しました。これはGrok 4.6から111ポイントの増加であり、モデルをClaude Opus 5のパフォーマンスに近づけています。

GDPval-AA評価では、モデルは1695 Eloを獲得し、前モデルより90ポイント高いスコアでした。コーディングテストの結果も同様の上昇傾向を示しました。

コーディングエージェントのGrok Buildと併用した場合、Grok 4.7はCoding Agent Indexで56点を記録し、Grok 4.6より9ポイント上回りました。

このモデルはGPT-5.6 Solを上回り、現在はAnthropicのClaude Fable 5.1、GPT-6 Astra、Opus 5に次ぐ位置にあります。

「Grok 4.7はArtificial Analysis Intelligence Indexで46点を獲得し、SpaceXAIをトップ4のAIラボに押し上げました。Coding Agent Indexのパフォーマンスも向上し、GPT-5.6 Solを上回りました」と投稿には書かれていました。

その他の分野では、モデルの進歩はわずかでした。Terminal-Bench 4.0では4.5パーセントポイント、GDP.pdfでは3ポイント上昇しました。しかし、AA-LCRおよびAutomationBench-AAテストではスコアが低下しました。7月にはGrok 4.5がAutomationBenchでトップとなり、マスクがClaude Opusに匹敵すると主張したことを裏付けていました。

向上にはトークン代が伴う

レートカードは変更されていません。Grok 4.7は、入力トークン100万個あたり2ドル、出力トークン100万個あたり6ドルのままです。キャッシュヒットは引き続き0.50ドルで割引され、50万トークンのコンテキストウィンドウはGrok 4.6から引き継がれています。

しかし、このモデルは回答あたりの作業量が大幅に増えています。Artificial Analysisの測定では、Indexタスクあたりの出力トークン数は約8万1000トークンで、Grok 4.6の3万6000トークン、GPT-6 Astraの2万7000トークンと比較されています。したがって、トークンあたりの価格が変わらなくても、タスクあたりのコストは高くなります。

そのトークン消費量は、すでに12億6000万ドルの損失を報告している部門にのしかかります。一方、マスクは9月14日、Grok 4.8のトレーニングが1週間以内に完了すると述べました。

また、マスクはGrok 5が人工知能を達成するモデルとなると期待しています。次のリリースでは、SpaceXAIが追加の計算コストなしでランキングを上げられるかどうかが試されます。

共有先

X (Twitter)Telegram

免責事項:本記事の内容は第三者メディアからの引用であり、参考情報としてのみ提供されます。投資助言を構成するものではありません。暗号資産およびその他の金融商品には大きな価格変動リスクがありますので、ご自身で慎重にご判断ください。

関連記事