Google 與 Meta 同日推出 AI 模型,基準測試結果分歧

Google 於週三推出 Gemini 3.8 Flash 及一款網路安全版本,而 Meta 則推出 Muse Spark 1.3。獨立基準測試將效能領先地位一分為二。

2026-09-03 06:17約 6 分鐘閱讀

週三,Google 與 Meta 相隔僅數小時發布了各自最新的前沿 AI 模型。Google 推出了 Gemini 3.8 Flash 及一款網路安全版本,而 Meta 則推出了 Muse Spark 1.3。

這兩項發布引發了直接比較。由 Artificial Analysis 進行的獨立測試得出分歧結果。Meta 在代理知識工作與科學推理方面領先,而 Google 在事實回憶與終端編碼方面具有優勢。

兩項前沿發布同日登場

Gemini 3.8 Flash 是 Google 的 六週內的第三次 Flash 發布。該模型定價為每 100 萬輸入代幣 0.75 美元,每 100 萬輸出代幣 3.75 美元。

今天我們推出全新 3.8 Flash 模型,這是我們在短短 6 週內的第 3 次 Flash 發布。

它在軟體工程、代理任務與多步驟推理方面,相較 3.7 Flash 有顯著飛躍。在 DeepSWE v1.1 上,它在自主……方面超越大多數較大的前沿模型。 pic.twitter.com/MB5seliluh

— Sundar Pichai(@sundarpichai)2026年9月2日

此優惠價格有效期至2026年12月31日。之後價格將翻倍至每 100 萬代幣 1.50 美元和 7.50 美元。

Google 也將一般模型與 Gemini 3.8 Flash Cyber 搭配使用。其存取權限僅限於一組受信任的防禦者。在專為尋找漏洞而設的基準測試 CyberGym 上,它獲得了 86.2% 的分數。

該網路安全模型在修補基準測試 CWE-Bench 上也取得了 47.2% 的成績。Google 報告指出,該模型為 Chrome 漏洞產生的正確修補數量是較大型商業模型的 2.6 倍。

該模型的存取權限位於 Fairwind Program 之後,僅限政府機關與關鍵基礎設施營運商使用。一天前,OpenAI 也為 Astra 劃定了類似界線,這是其評定為 臨界網路安全門檻 的首個模型。

與此同時,Meta 透過 Muse Code 與 Meta Model API 推出了 Muse Spark 1.3。公司工程師測量到,其工具調用數量比版本 1.2 減少了約 20%。

Muse Spark 1.3 今日推出,具有幾乎便宜到無法衡量的前沿性能。這是我們迄今在編碼與代理工作上所取得的最大飛躍。請在 Muse Code 與我們的 API 中試用。

接下來 🍉 與 Muse Spark 開放權重版本即將推出。 pic.twitter.com/XQQEDEJGD7

— Mark Zuckerberg(@finkd)2026年9月2日

Gemini 3.8 Flash 對比 Muse Spark 1.3:獨立基準測試結果分歧

Artificial Analysis 測試了這些模型,結果顯示了它們的排名。在最高模式下,Muse Spark 1.3 在 GDPval-AA v2 上獲得 1,754 Elo。Gemini 3.8 Flash(高)則得到 1,545。

Meta 也在 Sierra Research 銀行代理測試中以 52.4% 對 44.9% 領先,以及 CritPt 物理推理。Gemini 3.8 Flash 在 Terminal-Bench 2.1 以 87.6% 領先,在 AA-LCR 長上下文以 81% 領先,在 AA-Omniscience 準確率以 55% 領先。

Gemini 3.8 Flash 在受測模型中取得了最高的 GPQA Diamond 分數,達 95%。兩者在 Humanity's Last Exam 上的得分差距在一分之內。

Meta 的頂級得分者並未於今天出貨。該公司表示,最高推理將在進一步安全測試後到來,因此目前可用版本為 xhigh。

該版本在 Artificial Analysis 智能指數上獲得 61 分,比 Muse Spark 1.2 高出 4 分。它落後於 Claude Fable 5.1 的 66 分,以及 Claude Opus 5 的 63 分

更多發布已在排隊中。Elon Musk 表示 Grok 4.7 即將推出,這意味著在兩週內將有四次前沿發布。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章