Google 的 Gemini 3.8 Live 模型在語音基準測試中位居榜首

Google 於 9 月 15 日發布新的 Gemini 3.8 Live 和 Extended Thinking 音頻模型。Extended Thinking 在 Artificial Analysis 指數中以 82.6 分領先。

2026-09-16 06:11約 5 分鐘閱讀

9月15日,Google發布了Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,稱其為迄今為止最強大的音頻模型。

這些模型可以對話、推理和執行任務。獨立分析機構對其進行了排名:Extended Thinking版本在Artificial Analysis的語音到語音指數中以82.6分領先,超過了GPT-Live-1和Grok Voice。

向我們的最新先進音頻模型說“hi”,它們來自 @GoogleDeepMind ,專為自然、生產就緒的語音應用而構建。

🔷 Gemini 3.8 Live
🔷 Gemini 3.8 Live Extended Thinking

使用這些模型,你可以自然地說話、輕鬆協作,並處理複雜任務…… pic.twitter.com/TCcuANcIWl

— Google (@Google) September 15, 2026

Google最新對話式AI的基準排名

Artificial Analysis的指數綜合了語音推理、智能體性能、競技場偏好和任務成功率等分數。

在高推理努力測試下,Gemini 3.8 Live Extended Thinking佔據榜首。GPT-Live-1 Astra以81.5分緊隨其後,Grok Voice Think Fast 2.0 High得分為81.3。

常規版Gemini 3.8 Live以76.0分排名第五。這兩款新模型均優於Gemini 3.1 Flash Live High的71.5分。

智能體能力的差異更大。Extended Thinking在Tau Voice基準測試中達到68.6%,而早期模型僅為37.7%。

在語音推理方面,Extended Thinking得分為97.7%,略高於Grok Voice的97.2%。但不及Qwen Audio 3.0 Realtime Plus的99.2%。

較老的Gemini模型仍受人類測試者青睞

定價顯示出明顯差異。標準版模型每小時輸入音頻成本為0.84美元,約為前代產品1.75美元的一半,是指數中最便宜的。

Extended Thinking的定價為每小時3.50美元,低於GPT-Live-1 Sol的4.47美元和Grok Voice Think Fast 2.0 High的4.80美元。

延遲也有所改善。首次音頻響應的平均時間從舊模型的2.99秒降至1.18秒。

但人類聽眾並未完全信服。在盲測的Speech Agent Arena對話中,Gemini 3.1 Flash Live繼續以1096的Elo評級在偏好度上領先。

Gemini 3.8 Live以1083排名第二,而Extended Thinking版本以990落後,儘管它完成了89.1%的任務。

語音AI評估現在使用兩種截然相反的指標。基準測試傾向於推理能力最強的模型,而偏好分數則青睞最善於對話的模型。Google在這兩個類別中都保持領先,儘管是不同的模型。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章