谷歌与Meta同日推出AI模型,基准测试结果出现分化

谷歌发布了Gemini 3.8 Flash及网络安全变体,Meta发布了Muse Spark 1.3。独立基准测试显示两者在不同领域各有优势。

2026-09-03 06:17约 6 分钟阅读

周三,谷歌和Meta在短短数小时内相继发布了各自最新的前沿AI模型。谷歌推出了Gemini 3.8 Flash以及一个网络安全版本,而Meta则发布了Muse Spark 1.3。

这两款模型的发布引发直接比较。由Artificial Analysis进行的独立测试得出了截然不同的结果。Meta在智能体知识工作和科学推理方面领先,而谷歌在事实回忆和终端编码方面占据优势。

两个前沿版本同日登场

Gemini 3.8 Flash是谷歌六周内的第三个Flash版本。该模型定价为每100万个输入token 0.75美元,每100万个输出token 3.75美元。

今天我们推出新款3.8 Flash模型,这是我们在短短6周内发布的第3个Flash版本。

它在软件工程、智能体任务和多步推理方面相比3.7 Flash实现了显著飞跃。在DeepSWE v1.1上,它在自主……方面超越了大多数更大的前沿模型。 pic.twitter.com/MB5seliluh

— Sundar Pichai (@sundarpichai) 2026年9月2日

优惠价格有效期至2026年12月31日。之后价格将翻倍至每100万个token 1.50美元和7.50美元。

谷歌还将通用模型与Gemini 3.8 Flash Cyber配套推出。该访问权限仅限于一组受信任的防御者。在用于发现漏洞的基准测试CyberGym上,它取得了86.2%的成绩。

该网络安全模型在补丁基准测试CWE-Bench上也获得了47.2%的成绩。谷歌报告称,该模型为Chrome漏洞生成的正确补丁数量是其他大型商业模型的2.6倍。

访问权限通过Fairwind Program进行控制,该计划限制仅政府机构和关键基础设施运营商可使用。前一天,OpenAI也为Astra划定了类似界限,Astra是其第一个被评定为关键网络安全阈值的模型。

与此同时,Meta通过Muse Code和Meta模型API推出了Muse Spark 1.3。公司工程师测算其工具调用次数比版本1.2减少了大约20%。

Muse Spark 1.3今天正式推出,前沿性能几乎低廉到无需计量。这是我们在编码和智能体工作上迄今为止最大的一次飞跃。请尝试Muse Code和我们的API。

接下来🍉以及Muse Spark开放权重版本即将到来。 pic.twitter.com/XQQEDEJGD7

— Mark Zuckerberg (@finkd) 2026年9月2日

Gemini 3.8 Flash vs Muse Spark 1.3:独立基准测试结果出现分化

Artificial Analysis对模型进行了测试,结果显示了它们的排名。在最大模式下,Muse Spark 1.3在GDPval-AA v2上获得了1,754 Elo分。Gemini 3.8 Flash(高模式)则获得了1,545分。

Meta还在Sierra Research银行代理测试中以52.4%对44.9%领先,并在CritPt物理推理中胜出。Gemini 3.8 Flash在Terminal-Bench 2.1上以87.6%领先,在AA-LCR长上下文上以81%领先,并在AA-Omniscience准确性上以55%领先。

Gemini 3.8 Flash在已测试模型中取得了最高的GPQA Diamond分数,达到95%。两者在Humanity's Last Exam上的得分相差不到1分。

Meta的最高得分版本今天并未发布。该公司表示,最大推理将在进一步安全测试后推出,目前可用的变体是xhigh。

该版本在Artificial Analysis Intelligence Index上得分为61,比Muse Spark 1.2高出4分。它落后于Claude Fable 5.1的66分和Claude Opus 5的63分

更多版本已在排队中。Elon Musk曾表示Grok 4.7即将发布,这意味着两周内将有四个前沿版本问世。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章