買幣
行情
🔥
預測市場

Claude Sonnet 5.5 接近 Opus 表現,但 Token 帳單更重

Anthropic 以 Sonnet 5 的價格推出 Claude Sonnet 5.5,但 Artificial Analysis 發現它在最大努力模式下 Token 用量很高。

2026-09-29 04:46約 6 分鐘閱讀

Claude Sonnet 5.5 於 9 月 28 日由 Anthropic 推出,定價與 Sonnet 5 相同。該公司表示,其運行速度提升超過 30%,且每項任務成本最多可降低 30%。

另一家獨立評測機構在測試該模型極限時,對成本有不同的看法。

隆重推出 Claude Sonnet 5.5,Claude 5.5 系列的第二款模型。

它是 Sonnet 5 的明顯升級版,運行速度提升超過 30%,且大部分工作成本最高降低 30%。

— Claude (@claudeai) 2026 年 9 月 28 日

Sonnet 5.5 在 Claude 系列中於 Opus 5.5 推出數日後亮相

Claude 5.5 系列現在有了第二款產品 Sonnet 5.5。Opus 5.5 於 9 月 22 日首次亮相,而 OpenAI 也在同一天推出了 GPT-6 Sol 和 Luna。

定價延續 Sonnet 5:每百萬輸入 Token 2 美元,每百萬輸出 Token 10 美元。Anthropic 在代理編碼基準 Terminal-Bench 4.0 上取得了 70.6% 的成績。Sonnet 5 得分為 10.3%,而 Opus 5.5 則為 66.4%。

「Opus 5.5 專為需要謹慎判斷的複雜工作而建,而 Sonnet 5.5 最擅長的是範圍明確的日常任務、修復錯誤,以及建立精緻的文件、簡報和試算表。」Anthropic 團隊寫道。

根據 Anthropic 的說法,Sonnet 5.5 並未向外拓展能力邊界。因此,對齊評估集中在欺騙使用者和支持高風險濫用等危害上。

此次發布還包含網路保護和反蒸餾分類器,旨在阻止為訓練競爭系統而提取模型推理的嘗試。Claude Haiku 5.5 將在未來幾週內推出。

與此同時,OpenAI 因安全原因暫停了 GPT-6.1 Astra。CNBC 週一證實該模型未達到公司標準。

Artificial Analysis 發現最大努力模式下的 Token 消耗更高

評測機構 Artificial Analysis 將 Grok 4.7 排在第四名,在 Intelligence Index 上給 Sonnet 5.5 打了 56 分。這在總體上排名第二,僅次於最大努力模式下的 Opus 5.5 2 分。

Artificial Analysis 在 Terminal-Bench 4.0 上記錄了 Sonnet 5.5 的 64%,而 Opus 5.5 和 GPT-6 Astra 則為 60%。在 GDPval-AA 和類似的知識工作任務上,該公司認為 Sonnet 5.5 與 Opus 5.5 大致相當。

據 Artificial Analysis 稱,Sonnet 5.5 消耗了相當多的 Token 才能達到這一水準。

「在最大努力模式下,其性能接近 Opus 5.5,Claude Sonnet 5.5 每個 Intelligence Index 任務使用了約 193k 輸出 Token。」該公司寫道。

這一消耗量比 Opus 5.5 和 Sonnet 5 在最大努力模式下高出約 60%,約為 GPT-6 Astra 最大努力模式消耗量的 7 倍。

相比之下,Anthropic 的早期客戶描述了與 Sonnet 5 相反的模式,儘管這些工作負載有所不同。Balyasny Asset Management 在其金融工作負載上測得的 Token 使用量遠低得多。

「在我們包含 2,441 個金融任務的私有套件中,涵蓋 Q&A、擷取、分析和預測,Claude Sonnet 5.5 得分優於 Sonnet 5,每個答案使用約 121k Token,而 Sonnet 5 使用了 497k。」Balyasny Asset Management 資深 AI 工程師 Joe Poirier 表示。

Artificial Analysis 測試了一個包含結構化輸出錯誤的預發行版本,Anthropic 隨後已修補該錯誤。該公司計劃近期重新進行受影響的評測。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章