EN
AI模型

Claude Sonnet 5.5发布:企业AI为何开始按任务成本选模型

Claude Sonnet 5.5速度提高30%以上,在相同单价下通过减少token降低单任务成本。本文拆解它与Opus 5.5的分工、编码表现、迁移注意事项与企业模型路由策略。

Jacky Wang 5 分钟阅读 36 阅读

2026年9月28日,Anthropic 发布 Claude Sonnet 5.5。如果只看发布会式的数字,它像是一轮常规升级:速度比 Sonnet 5 提高 30% 以上,单次任务成本最多降低 30%,编码和知识工作基准也明显上升。但真正值得企业注意的,不是哪一项排行榜,而是模型采购的单位正在变化——从“每百万 token 多少钱”,转向“把一件工作可靠做完需要多少钱”。

这一区别并不只是会计口径。模型可能单价不变,却因为少走弯路、少调用工具、少产生无效输出而显著降低总成本。Sonnet 5.5 的发布,恰好把这种变化摆到了台面上。

单价没降,为什么每项任务反而更便宜?

Sonnet 5.5 的公开价格与 Sonnet 5 相同:输入每百万 token 2 美元,输出每百万 token 10 美元,缓存读取每百万 token 0.20 美元。Anthropic 给出的“最多便宜 30%”并不是降价,而是模型完成同一任务通常消耗更少 token,同时输出速度提高 30% 以上。

这意味着企业不能再只用价目表比较模型。更实用的指标至少包括:任务完成率、平均重试次数、工具调用数量、人工返工时间,以及失败后是否能被及时发现。一个 token 单价较低但经常需要重跑的模型,最终未必便宜。

Sonnet 5.5 和 Opus 5.5,不是简单的上下级关系

Anthropic 对两者的定位很清楚:Sonnet 5.5 面向边界明确、频率高的日常任务,例如修复缺陷、整理文档、生成演示和处理表格;Opus 5.5 仍然适合需要持续判断、目标不完整、风险较高的开放式任务。

从已公布的测试看,Sonnet 5.5 在某些设置下已经接近 Opus 5.5。它在 Terminal-Bench 4.0 得到 70.6%,CursorBench 4.0 得到 55.5%,知识工作测试 GDPval-AA v2.1 得到 1844 分。不过这些均来自厂商发布材料,而且不同模型使用的 effort 设置未必完全相同。基准可以说明能力边界在移动,却不能直接替代企业自己的生产评测。

更合理的做法是按任务路由:大批量、可验证、流程稳定的工作优先交给 Sonnet;架构设计、复杂调查、模糊需求和高风险决策交给 Opus;一旦低成本模型出现低置信度、重复失败或越界迹象,再自动升级。这样得到的不是“押注一个最强模型”,而是一套成本和质量都可控的模型组合。

编码能力提升,重点在减少无效步骤

这次升级最显眼的部分是编码。Anthropic 表示,Sonnet 5.5 在 FrontierCode 的高 effort 设置下,相比 Sonnet 5 同设置高出 10 个百分点,同时单任务成本约为后者的十五分之一。公司引用的早期测试还显示,新模型更愿意批量调用工具,减少来回步骤。

对开发团队而言,这比“能不能写出一段函数”更重要。真实代理任务的成本常常消耗在扫描代码库、调用终端、修改文件、运行测试和修复回归的循环中。模型如果能更早理解依赖关系、减少无效 shell 操作,团队感受到的提升会直接体现在等待时间和 CI 资源上。

但上线前仍应保留三道检查:限制改动范围、要求测试或运行结果、由人审核高风险变更。我们的主流开源模型对比也得出类似结论:参数和榜单只能做初筛,真正决定生产价值的是任务级成功率与可运营性。

企业应该怎样迁移?

  1. 先建立基线。从真实任务抽取一组固定样本,记录现有模型的成功率、token、耗时、工具调用和人工返工。
  2. 从可回滚任务开始。代码审查、文档整理、客服草稿等更适合先迁移;不可逆的生产操作不应直接交给新模型。
  3. 分开测试 effort。Anthropic 应用默认 Medium,平台默认 High。更高 effort 会增加思考时间和成本,不能把不同设置的结果混为一谈。
  4. 设置升级路由。连续失败、涉及敏感数据、目标不完整或判断空间过大时,自动切换到 Opus 5.5 或人工处理。
  5. 注意 API 行为变化。官方迁移说明指出,如果原来关闭 thinking,需要切换到新的 between_tools 设置后再迁移到 claude-sonnet-5-5。

安全回退也是产品行为的一部分

Sonnet 5.5 是首个在发布时启用高能力模型级网络安全防护与回退机制的 Sonnet。对于少数高风险网络安全请求,系统可能明显回退到 Sonnet 5;日常软件开发通常不受影响。企业在做自动化评测时需要把这种回退记录下来,否则可能误以为模型性能不稳定。

同时,厂商自己的安全评测并不能覆盖所有失败模式。尤其是代理拥有写文件、执行代码或调用外部系统权限时,权限最小化、审计日志和人工批准仍然不可省略。

结论:企业 AI 的主战场是“单位成功任务”

Sonnet 5.5 最重要的信号,并不是中端模型又追近了旗舰模型,而是行业开始用更接近生产的方式谈成本。未来模型选择不会只有一个冠军:快速模型负责规模化执行,强判断模型处理少量复杂问题,人工负责不可逆和高风险决策。

如果 Anthropic 公布的效率提升能在真实工作负载中复现,那么 Sonnet 5.5 的价值将主要来自更少的无效步骤,而不是更低的 token 单价。对企业来说,下一步不是立刻全量替换,而是把评测单位从 token 改成“成功完成且通过验收的一项任务”。

主要来源

说明:本文引用的速度、成本和基准成绩均来自 Anthropic 官方发布材料。部分对比采用不同 effort 设置,且厂商披露预发布结构化输出问题及竞品图像理解问题可能影响个别成绩;本文未将这些数字视为独立第三方验证。

发表评论