模型发布#智能体#长上下文

Anthropic 发布 Claude Opus 5.5:多数任务接近 Fable 5.1,API 降价 20%

Anthropic 9 月 23 日发布 Claude 5.5 家族首款模型 Opus 5.5,官方称多数任务达到 Fable 5.1 水平,典型任务成本比 Opus 5 低 40%,API 价格降为每百万 token 输入 4 美元、输出 20 美元。

Anthropic 发布 Claude Opus 5.5 的主视觉:地平线上的日出与模型名称

Anthropic 9 月 23 日发布 Claude Opus 5.5,这是 Claude 5.5 家族的第一款模型,Sonnet 5.5 和 Haiku 5.5 会在之后几周推出。它定位为长时间编程 Agent 和知识工作的主力模型。

事实部分

  • 价格:API 输入、输出分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取从 0.50 美元降到 0.20 美元。另有最高 2.5 倍速度的 Fast mode(8 美元 / 40 美元)。
  • 规格:100 万 token 上下文,最大输出 12.8 万 token,思考模式常开,默认 effort 为 medium。API 名称 claude-opus-5-5,已上线 Claude、Claude Code、Claude Platform 以及 AWS、Google Cloud、Azure,并成为付费计划的默认模型。
  • 官方评测:Terminal-Bench 4.0 得分 66.4%(Opus 5 为 52.3%),OSWorld 2.0 从 74.0% 提高到 81.8%。也有落后项:AutomationBench 40.0%,略低于 GPT-6 Astra 的 41.4%。
  • 订阅额度:Pro、Max、Team 计划的五小时限额提高 20%。
  • 安全措施:官方称越界尝试频率比 Opus 5 低约 85%;大部分网络安全任务会转给 Opus 4.8 处理,经验证的研究人员才能拿到完整能力。

编辑判断

这次升级的重点是价格和长任务,榜单数字倒在其次。早期测试里,一次 20 万行代码库审计用时不到三小时,Opus 5 同类任务要 20 多小时。如果你之前嫌 Opus 太贵、日常只用中档模型,现在值得重新算一遍账。

要注意的是,单任务成本下降是按默认设置和典型负载算的。有开发者依据 Artificial Analysis 的测试指出,max 档下它的输出 token 消耗在已测模型里最高,开高强度跑批量任务前先小规模测一下。