Anthropic 把 Claude Sonnet 5.5 推上了线。这是 Claude 5.5 家族的第二款产品,排在 Opus 5.5 之后。与上一代 Sonnet 5 对照,它的生成速度提升超过 30%,处理同一批任务的开销最多可以压掉 30%。
目前 Claude 对外提供的模型共四个层级,能力与价格同步递减:顶层是 Fable,其后依次为 Opus、Sonnet、Haiku。按照 Anthropic 给出的分工,需要连续跑数小时、覆盖整个代码库的大型工程交给 Fable;涉及反复取舍的复杂工作归 Opus 5.5;范围清晰、目标明确的日常事务——改 Bug、撰写文档、制作 PPT 与表格——由 Sonnet 5.5 承担。Haiku 5.5 预计数周内登场。
提升幅度最明显的一块是编程。Terminal-Bench 4.0 用于衡量模型在命令行环境里完成多步骤专业任务的水平,Sonnet 5.5 在此拿到 70.6%,Sonnet 5 的成绩仅为 10.3%,而 Opus 5.5 的最高分为 66.4%。在题目取自真实 Cursor 编程会话的 CursorBench 上,它与 Opus 5.5 的差距只有两分上下。参与早期测试的人还注意到,它更倾向于把若干次工具调用并成一步做完,流程步骤减少,成本随之下降。
办公场景同样咬得很紧。GDPval-AA 以 44 个职业、9 大行业的真实工作任务作为评分依据,Sonnet 5.5 得 1844 分,Opus 5.5 为 1846 分,Sonnet 5 则是 1449 分。Anthropic 内部做过一次验证:交给它一家上市公司的季度财报材料、电话会议记录以及一份 PPT 模板,要求产出一份 10 页经营回顾。两位专家审阅初稿后判断,这份材料可以直接对外发出。此外,它还是首个仅凭截图就能把《宝可梦 红》打通的 Sonnet 模型。
定价与 Sonnet 5 持平:每百万输入 Token 收 2 美元,每百万输出 Token 收 10 美元,相当于 Opus 5.5 的一半。之所以更省,原因在于完成同样的工作所消耗的 Token 更少。
Claude 允许调节“思考力度”(effort),从 Low 到 Max 共五档,档位越高,模型思考越久,费用也越高。Claude App 与 Claude Code 的默认档位是 Medium。以 Terminal-Bench 为例,Sonnet 5.5 在 Medium 档下每个任务约花 0.83 美元,得分 28.8%;Sonnet 5 即便开到 Max 档,每个任务要花 11.62 美元,也只拿到 10.3%。对日常使用者来说,什么都不用调,换来的就是一个更能干、响应更快的模型。
Anthropic 同时提示,跑分只能体现能力的一部分。无论是自家测试还是外部测试者的反馈,一旦进入开放式、需要持续判断的复杂工作,Opus 5.5 依然具备明显优势。
安全方面有两处调整。Sonnet 5.5 的网络安全水平与 Opus 5 相当,因此成为首个配备网络安全防护的 Sonnet 模型:日常排查与修复 Bug 不受影响,风险较高的网络安全类请求会被转交 Sonnet 5 处理,用户可以看到这次切换。它也是首个加入防蒸馏机制的 Sonnet。所谓蒸馏,指的是有人注册成千上万个假账号批量调用模型,再把输出拿去训练自己的模型。针对这一点,Claude 的思考内容会与生成它的账号绑定,在 Claude Code 里中途更换账号的用户会因此受到影响。
Sonnet 5.5 已在全部平台上线,覆盖 AWS、Google Cloud 与 Microsoft Azure,API 模型名为 claude-sonnet-5-5。此前通过关闭思考功能来调用 Sonnet 的开发者,在迁移之前需要改用新的 between_tools 设置。
评论 共 0 条
正在加载…
还没有评论,来说两句吧。
先起个昵称
昵称只保存在你自己的浏览器里,用来显示你的评论与留言,不需要注册。
昵称需要 2 - 20 个字符。