买币
行情
🔥
预测市场

Claude Sonnet 5.5 性能逼近 Opus,但 Token 消耗更大

Anthropic 以 Sonnet 5 的价格发布了 Claude Sonnet 5.5,但 Artificial Analysis 发现其在最大努力模式下 Token 使用量巨大。

2026-09-29 04:46约 6 分钟阅读

Anthropic 于 9 月 28 日发布了 Claude Sonnet 5.5,定价与 Sonnet 5 持平。该公司称其运行速度提升超过 30%,每项任务成本降低高达 30%。

一家独立的基准测试机构在对模型进行极限压力测试时,对费用得出了不同的看法。

介绍 Claude Sonnet 5.5,这是 Claude 5.5 系列中的第二个模型。

相比 Sonnet 5 有明显升级,运行速度提升超过 30%,大多数工作成本降低高达 30%。

— Claude (@claudeai) 2026年9月28日

Sonnet 5.5 在 Opus 5.5 推出数天后亮相于 Claude 系列

Claude 5.5 系列现在拥有第二个成员 Sonnet 5.5。Opus 5.5 于 9 月 22 日亮相,同一天 OpenAI 也发布了 GPT-6 Sol 和 Luna。

定价延续 Sonnet 5:每百万输入 Token 2 美元,每百万输出 Token 10 美元。Anthropic 在 Terminal-Bench 4.0(一项智能体编码基准测试)上取得了 70.6% 的成绩。Sonnet 5 的成绩为 10.3%,而 Opus 5.5 为 66.4%。

“Opus 5.5 是为需要仔细判断的复杂工作而生,而 Sonnet 5.5 最擅长范围明确的日常任务、修复错误以及创建精美的文档、幻灯片和电子表格,”Anthropic 团队写道。

据 Anthropic 称,Sonnet 5.5 并未向外拓展能力边界。因此,对齐评估主要集中在危害类别上,如欺骗用户和支持高风险滥用。

此次发布还包括网络保护和反蒸馏分类器,旨在阻止提取模型推理以训练竞争系统的尝试。Claude Haiku 5.5 将在未来几周内到来。

与此同时,OpenAI 以安全为由暂停了 GPT-6.1 Astra。CNBC 周一证实,该模型未达到公司标准。

Artificial Analysis 发现最大努力模式下 Token 消耗更高

基准测试机构 Artificial Analysis 将 Grok 4.7 排在第四位,给 Sonnet 5.5 在 Intelligence Index 上打了 56 分。这足以排到总体第二,仅比最大努力模式下的 Opus 5.5 少 2 分。

Artificial Analysis 记录到 Sonnet 5.5 在 Terminal-Bench 4.0 上的成绩为 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。在 GDPval-AA 及类似知识工作任务上,该公司发现 Sonnet 5.5 大致与 Opus 5.5 持平。

据 Artificial Analysis 称,Sonnet 5.5 消耗了更多 Token 以达到这些成绩。

“在最大努力模式下,当性能接近 Opus 5.5 时,Claude Sonnet 5.5 每项 Intelligence Index 任务使用了约 193k 个输出 Token,”该机构写道。

这一消耗量比 Opus 5.5 和 Sonnet 5 在最大努力模式下高出约 60%,大约是 GPT-6 Astra 最大努力模式消耗量的 7 倍。

相比之下,Anthropic 的早期访问客户描述了与 Sonnet 5 相反的模式,尽管这些工作负载不同。Balyasny Asset Management 在其财务工作负载上测得 Token 使用量低得多。

“在我们包含 2,441 项财务任务(涵盖问答、提取、分析和预测)的私有测试集中,Claude Sonnet 5.5 得分领先于 Sonnet 5,每个答案消耗约 121k 个 Token,而 Sonnet 5 消耗了 497k,”Balyasny Asset Management 的高级 AI 工程师 Joe Poirier 表示。

Artificial Analysis 测试了一个存在结构化输出错误的预发布版本,Anthropic 此后已修复该错误。该机构计划很快重新进行受影响的多项评估。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章