Google 的 Gemini 3.8 Live 模型在语音基准测试中位居榜首

Google 于 9 月 15 日发布了新的 Gemini 3.8 Live 和 Extended Thinking 音频模型。Extended Thinking 在 Artificial Analysis 指数中以 82.6 分领先。

2026-09-16 06:11约 5 分钟阅读

9月15日,Google发布了Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,称其为迄今为止最强大的音频模型。

这些模型可以对话、推理和执行任务。独立分析机构对其进行了排名:Extended Thinking版本在Artificial Analysis的语音到语音指数中以82.6分领先,超过了GPT-Live-1和Grok Voice。

向我们的最新先进音频模型说“hi”,它们来自 @GoogleDeepMind ,专为自然、生产就绪的语音应用而构建。

🔷 Gemini 3.8 Live
🔷 Gemini 3.8 Live Extended Thinking

使用这些模型,你可以自然地说话、轻松协作,并处理复杂任务…… pic.twitter.com/TCcuANcIWl

— Google (@Google) September 15, 2026

Google最新对话式AI的基准排名

Artificial Analysis的指数综合了语音推理、智能体性能、竞技场偏好和任务成功率等分数。

在高推理努力测试下,Gemini 3.8 Live Extended Thinking占据榜首。GPT-Live-1 Astra以81.5分紧随其后,Grok Voice Think Fast 2.0 High得分为81.3。

常规版Gemini 3.8 Live以76.0分排名第五。这两款新模型均优于Gemini 3.1 Flash Live High的71.5分。

智能体能力的差异更大。Extended Thinking在Tau Voice基准测试中达到68.6%,而早期模型仅为37.7%。

在语音推理方面,Extended Thinking得分为97.7%,略高于Grok Voice的97.2%。但不及Qwen Audio 3.0 Realtime Plus的99.2%。

较老的Gemini模型仍受人类测试者青睐

定价显示出明显差异。标准版模型每小时输入音频成本为0.84美元,约为前代产品1.75美元的一半,是指数中最便宜的。

Extended Thinking的定价为每小时3.50美元,低于GPT-Live-1 Sol的4.47美元和Grok Voice Think Fast 2.0 High的4.80美元。

延迟也有所改善。首次音频响应的平均时间从旧模型的2.99秒降至1.18秒。

但人类听众并未完全信服。在盲测的Speech Agent Arena对话中,Gemini 3.1 Flash Live继续以1096的Elo评级在偏好度上领先。

Gemini 3.8 Live以1083排名第二,而Extended Thinking版本以990落后,尽管它完成了89.1%的任务。

语音AI评估现在使用两种截然相反的指标。基准测试倾向于推理能力最强的模型,而偏好分数则青睐最善于对话的模型。Google在这两个类别中都保持领先,尽管是不同的模型。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章