一句话总结
2026 年 9 月 28 日,Anthropic 发布 Claude Sonnet 5.5——Claude 5.5 家族的第二款模型。它在 Agent 编码基准 Terminal-Bench 4.0 上拿到 70.6%,超过自家旗舰 Opus 5.5 的 66.4%,而上一代 Sonnet 5 只有 10.3%;价格却与 Sonnet 5 完全一致(输入 2 美元、输出 10 美元 / 百万 token),是 Opus 5.5 的一半。同一枚硬币的另一面是:独立评测机构发现它每个任务消耗的 token 比它测过的任何模型都多——价目表便宜,不等于账单便宜。
数据来源
本文事实依据来自:
- Anthropic 官方发布页《Introducing Claude Sonnet 5.5》(2026-09-28)
- Claude Platform 官方文档「Pricing」页的模型价格表(2026-09-28)
- AWS 官方博客《Introducing Claude Sonnet 5.5 on AWS》(2026-09-28)
- Anthropic 帮助中心《How Claude marks AI-generated content》(AI 内容标记说明)
- 第三方评测与报道:Artificial Analysis(独立复现)、Decrypt、SiliconANGLE、Reuters
先把四个数字记住
| 指标 | 数字 | 说明 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 上一代 Sonnet 5 是 10.3%,旗舰 Opus 5.5 是 66.4% |
| API 价格 | $2 / $10 | 每百万 token 的输入 / 输出,与 Sonnet 5 持平、为 Opus 5.5 的一半 |
| 输出速度 | 快 30% 以上 | Anthropic 称这是迄今最快的 Sonnet |
| 单任务成本 | 最多低 30% | 官方口径:完成同样的活,用的 token 更少 |

图片来源:Anthropic 官方发布页
官方对它的定位写得很直白:Sonnet 5.5 是 Opus 5.5 的「更快、更便宜的一侧」——Opus 5.5 面向需要审慎判断的复杂工作,Sonnet 5.5 则最强于边界清晰(well-scoped)的日常任务:修 bug,以及产出打磨过的文档、幻灯片和表格。官方还特意提了一句它「有一双对设计很毒的眼睛」。
中端反超旗舰:这次不是「渐进升级」
这一轮最值得注意的不是分数本身,而是分数来自哪一档产品。
Terminal-Bench 4.0 测的是 Agent 能不能自己在终端里敲命令、把一件复杂的专业任务做完,得分就是任务完成比例。它不是选择题式的知识测试,而是接近真实工作流的执行测试。上一代 Sonnet 5 在这项基准上的成绩是 10.3%——几乎不能被视为「能用」;Sonnet 5.5 直接跳到 70.6%,并越过了自家旗舰。

图表由本站据 Anthropic 与 Artificial Analysis 公布数据绘制
另一个口径也指向同一结论。Anthropic 自评的 GDPval-AA(覆盖 44 种职业的真实工作场景、用国际象棋式的 Elo 计分)给出 Sonnet 5.5 1844 分,与 Opus 5.5 的 1846 分基本打平;作为对照,OpenAI 的 GPT-6 Sol 是 1487 分。
官方发布页里还有一条花絮:Sonnet 5.5 是第一款仅凭截图就能通关《宝可梦红》的 Sonnet 模型——这是 Anthropic 的自报口径。
但第三方的另一半:分数进第一梯队,token 用量也是第一
分数之外,独立评测机构 Artificial Analysis 的复现给了同一方向、但更细的读数:
- Terminal-Bench 4.0:Sonnet 5.5 63.6%,Opus 5.5 59.6%,GPT-6 Astra 59.1%——便宜的那个确实更高;
- 但它在 Artificial Analysis 的榜单上排在 Opus 5.5 之后名列第二,原因不是分数,而是它每个任务消耗的 token 比该机构测过的任何模型都多。
这两条放在一起才是完整的图景:per-token 的单价是价目表,per-task 的 token 消耗才是你的账单。

图表由本站据 Anthropic 与 Artificial Analysis 公布数据绘制
effort 档位(effort setting)是这里的关键变量。Anthropic 自己给出的例子是:Sonnet 5.5 在 High effort 档位下,在 FrontierCode 上的表现与 GPT-6 Sol 相当,而每个任务的成本约为后者的五分之一。换句话说,「省 30%」这个说法成立有前提——你得让模型用更少的 token 干完同样的活;把 effort 拉满,单价上的优势就会被思考量吃掉一部分。
价格:价目表和上一代一模一样
官方价格表里,Sonnet 5.5 与 Sonnet 5 的价格行逐格相同:
| 模型 | 输入 | 输出 | 缓存写入(5 分钟) | 缓存写入(1 小时) | 缓存读取 |
|---|---|---|---|---|---|
| Claude Fable 5.1 | $10 | $50 | $12.50 | $20 | $0.25 |
| Claude Opus 5.5 | $4 | $20 | $5 | $8 | $0.20 |
| Claude Sonnet 5.5 | $2 | $10 | $2.50 | $4 | $0.20 |
| Claude Sonnet 5 | $2 | $10 | $2.50 | $4 | $0.20 |
(单位:美元 / 百万 token)

图片来源:Claude Platform 官方文档「Pricing」
所以「30% 更便宜」这句话,指的不是价目表降价,而是同样的任务用更少的 token 完成。这是近一年模型定价的一个明显转向:调价不再靠改单价,靠的是提高 token 效率——价目表看起来没动,账单变小了。
家族位置:Claude 5.5 的三条线怎么分
Sonnet 5.5 是 Claude 5.5 家族的第二款。第一款 Opus 5.5 于 9 月 22 日发布,定价 $4 / $20;官方表示 Claude Haiku 5.5 将在未来数周加入,面向高并发、成本敏感的应用。三款加起来,覆盖了「最难的活」「日常主力」「走量」三个档位。

图表由本站据 Claude Platform 官方文档价格表绘制
对使用者来说,这个排列带来一个很实际的变化:过去「日常任务」和「Agent 编码」常常要分给两个不同档位的模型,现在中端这一档自己就能接住相当一部分编码 Agent 的活。
客户和官方都强调的三件事
Anthropic 在发布页里挂了来自合作方的实测反馈,口径意外地一致:
- Zendesk(AI 负责人 Abhinay Kathuria):用几百个真实客服场景测试,Sonnet 5.5 的错误决策更少、工单解决更快,工单处理速度提升 20%;
- Box(AI 产品 VP Yashodha Bhavnani):在金融、医疗这类敏感场景里更可靠,会回源文档重新核对数据,更准、快 2.4 倍、总 token 少 12%;
- CodeRabbit(AI VP David Loker):判断力比 Sonnet 5 更好,同时输出 token 显著更少,「上一代动不动就去搜网页、以及高 token 用量的问题,在这个新模型上都没了」;
- SpaceXAI(ML 总监 Sualeh Asif):在 CursorBench 4.0 上拿到 55.5%,仅次于 Opus 5.5。

图片来源:Anthropic 官方发布页
官方自己总结的四条改进是:性能(Terminal-Bench 与 GDPval-AA)、协作(写得更清楚,早期测试者说它更适合快速迭代)、成本(token 效率)、速度(输出快 30% 以上)。
安全与合规:第一批带「网络防护栏」的 Sonnet
发布页里有一段容易被忽略的安全说明:因为 Sonnet 5.5 的网络安全能力已经接近 Opus 5,它成为第一款带着与最强模型同级的网络防护栏(cyber safeguards and fallbacks)上线的 Sonnet。生物领域的防护栏与 Sonnet 5 相同。官方强调这两类防护针对的都是「一小组高风险请求」,常规软件开发与绝大多数生命科学工作不受影响。
另一半是内容标记。Anthropic 已签署欧盟《AI 法案》关于 AI 生成内容透明度的第 50(2) 条行为准则,做法分两层:
- 文本嵌入不可见水印——在模型层面写入,会跟着文本被复制粘贴走,轻编辑一般去不掉;
- 文件附带签名来源元数据——图片等文件走 C2PA 开放标准(OpenAI、Meta 也已采用,Google 走自研的 SynthID)。
这件事还有两个必须一起说的限制:水印只是「可能经过 Claude 处理」的概率信号,不是生成与否的确证;反过来,检测不到水印也不能说明内容不是 AI 生成的——重编辑、转述、翻译都会让它失效,代码这类高度确定性的文本水印也更少。这项机制 8 月公布时在用户中引起过不小反弹,Anthropic 当时表示没有观察到可测量的退订增长。
对中国读者更实际的一点是:这套标记是全球执行,不限于欧盟。做长文、营销文案、对外发布的团队,值得把它纳入流程考虑。
云端可用性:发布当天全平台上线
发布当天,Sonnet 5.5 已可在 Claude Platform(模型标识 claude-sonnet-5-5)、AWS Bedrock、Google Vertex AI 与 Microsoft Azure Foundry 调用,官方同时说明提供零数据保留(zero data retention)选项。

图片来源:AWS 官方博客
三条落地建议
- 先做 A/B,并固定 effort 档位。 只有固定档位,比较才成立——低档位省钱但可能干不完活,高档位干得好但账单接近贵的模型。
- 同时看两个数:每百万 token 的价,以及每个任务的 token 数。 只盯价目表会在月底被吓一跳。
- 把稳定的系统提示与仓库上下文放在请求前缀吃缓存。 缓存读取 $0.20 / 百万 token,写一次的成本是 $2.50(5 分钟)/ $4(1 小时),长会话下这笔账很划算。
注意事项
- 分数是厂商自跑的。 70.6% 与 1844 分来自 Anthropic 自己的测试口径;独立口径虽然方向一致,但绝对值更低(63.6%)。上线前请用你自己的任务做一次对比。
- 「省 30%」有前提。 它来自官方测试中的典型工作负载,且依赖 effort 档位与任务形态。
- 水印会跟着文本走。 如果你的内容流程需要机器可检测出处,这是加分项;如果你在客户交付物里不希望出现可检测标记,需要与客户确认口径。水印不是确证,别把它当鉴定结论用。
- Haiku 5.5 还没发。 官方只说「未来数周」,价格未公布。
总结
- Sonnet 5.5 的意义不在「更强」,而在中端这一档第一次在 Agent 编码基准上超过了自家旗舰——Terminal-Bench 4.0 从 10.3% 跳到 70.6%。
- 价格表逐格未变,变化发生在 token 效率上:官方口径同等任务最多省 30%。
- 但独立评测同时指出它每个任务的 token 用量高得惊人——便宜的是单价,不一定是你最终的账单。
- 这是第一款带网络防护栏的 Sonnet,也是水印机制全面落地后发布的中端主力,内容团队需要把它纳入流程。
- 家族还差一块拼图:Haiku 5.5 数周内到位。
(本文配图来自 Anthropic 官方发布页、Claude Platform 官方文档、AWS 官方博客;对比图表由本站据官方与 Artificial Analysis 公布数据绘制。)