Claude 4.5 家族模型解读:Sonnet 越级、Haiku 追尾,每个价位都有一款”旗舰”
模型:Claude Sonnet 4.5 / Claude Haiku 4.5 厂商:Anthropic 发布日期:Sonnet 4.5 2025-09-29;Haiku 4.5 2025-10-15 定价:Sonnet 4.5 $3/$15;Haiku 4.5 $1/$5(每百万 token,输入/输出) 总览:Opus 4.1 还热着,Anthropic 转头把枪口对准中低端。Sonnet 4.5 拿 77.2% 的 SWE-bench 直接压过旗舰 Opus 4.1,Haiku 4.5 又以 73.3% 追上自家老大哥 Sonnet 4。两代”中档越级”叠在一起,Claude 从 $1 到 $75 每个价位都有一款”接近旗舰”的模型——全价位覆盖的拼图,在这一年秋天彻底合拢。
一、引言:越级不是偶然,是节奏
Claude 4 时代”Sonnet 反超 Opus”还是新闻,到 4.5 家族,这已经是 Anthropic 的固定操作。2025 年 9 月 29 日 Sonnet 4.5 登场,官方原话:“全球最好的编程模型”;16 天后(10 月 15 日)Haiku 4.5 补位,官方文案:“五个月前还是 SOTA 的东西,今天更便宜更快。“两句话拼起来,就是 4.5 家族的产品哲学——让每个价位的人,都能买到上一档旗舰的性能。
二、Sonnet 4.5:中档越级,这次直接反超旗舰
Sonnet 4.5 定价没动,还是 $3/$15,但 SWE-bench Verified 冲到 77.2%。这个数字有多扎眼?它压过了自家旗舰 Opus 4.1 的 74.5%——中档反超旗舰,而且反超的不是上上代,是三个月前刚发布的同一代旗舰。“直逼 Opus 4.1”说轻了,这是明晃晃的越位。
编码之外,agent 能力同步升级:TAU-bench 航空和零售两个场景都拿下第一,OSWorld 61.4%(电脑操作,3.5 Sonnet 时代是 44.4%),复杂 agent 任务能连续专注 30 小时以上。官方还强调它作为**编排者(orchestrator)**指挥子 agent 的能力——这是后来多 agent 系统的伏笔。
产品侧也有配套动作:Claude Code 新增检查点(checkpoint)和回滚、VS Code 原生扩展、Agent SDK 放出——模型和工具绑在一起发,是 4.5 家族一贯的节奏。
三、Haiku 4.5:近旗舰级的”小钢炮”
Haiku 4.5 是这一年的惊喜。定价 $1/$5——比 Sonnet 4.5 便宜三分之二,SWE-bench Verified 却拿下 73.3%,官方给的对照很直接:接近 Sonnet 4 的编码能力,速度是 Sonnet 4 的 2 倍以上,价格只有三分之一。“五个月前还是 SOTA”这句话的完整含义,就在这组数字里。
几个容易漏掉的点:
首个带扩展思考(extended thinking)的 Haiku。 此前 Haiku 一直”快而平”,不会长考;4.5 破例,小模型也能分步推理——对多 agent 系统里跑子任务的场景,这是刚需。
输出上限翻 8 倍。 Haiku 3.5 最大输出 8192 token,4.5 直接到 64K,长文件、长报告一次生成成为可能。
电脑操作也能干。 Computer Use 在 $1/$5 的价位开放,某些任务甚至反超 Sonnet 4。低成本批量跑 GUI 自动化,从这代开始才谈得上经济。
安全性是另一个看点。 官方自动化对齐评估里,Haiku 4.5 的失范行为率显著低于 Sonnet 4.5 和 Opus 4.1,被评为”迄今最安全的模型”,因而拿到 ASL-2(比 Opus/Sonnet 4.5 的 ASL-3 低一级)——能力没那么强,反而可以放宽部署。
四、产品哲学:全价位覆盖
把 2025 年秋天的 Claude 产品线排开看:
- $1/$5 Haiku 4.5:73.3% SWE-bench,接近 Sonnet 4
- $3/$15 Sonnet 4.5:77.2%,反超 Opus 4.1
- $15/$75 Opus 4.1:74.5%,当时的旗舰
每个价位段,都有一款”接近上一档旗舰”的模型。 这跟”三档各卖各的”是两码事——Anthropic 的做法是让每一档都越级,把”便宜没好货”的刻板印象打掉。官方甚至直接建议组合用法:Sonnet 4.5 当大脑拆任务,一排 Haiku 4.5 当手脚并行干活——越级模型之间的协同,比单买一款旗舰更划算。
收尾:我的一点看法
Sonnet 4.5 反超 Opus 4.1 这件事,我把它看成 Anthropic 定价策略的公开宣示:档位不是能力天花板,只是成本标签。 如果中档永远追着旗舰跑,那”旗舰”二字靠什么撑?答案是长程可靠性、极端任务的上限,以及品牌溢价——这在 2026 年回头看,依然是 Claude 的定价逻辑。
Haiku 4.5 则让我想起 3.5 Sonnet 的越级,但这次更狠:越级的不再是”小一号的中档”,而是最小的那款。小模型追平大模型,靠的不是参数,是训练数据的质量和后训练的功夫。“便宜”和”强”不再是单选题。
一个隐患也值得说:既然 Haiku 4.5 在不少任务上已经摸到 Sonnet 4,Sonnet 的定位就被挤压了。Anthropic 的解法是让 Sonnet 4.5 继续往上越级,保持错位竞争——产品线内部互相蚕食,被”每一档都越级”的策略化解成互相接力。 这套玩法在 Opus 4.5 发布之前,撑住了 Claude 的整个秋冬。
附:核心数据速查
Claude 4.5 家族基本盘
| 项目 | Sonnet 4.5 | Haiku 4.5 |
|---|---|---|
| 发布日期 | 2025-09-29 | 2025-10-15 |
| 定价 | $3 / $15 | $1 / $5 |
| 上下文长度 | 200K | 200K |
| 最大输出 | 64K | 64K |
| 扩展思考 | 支持(预算至 64K) | 支持(Haiku 首例) |
关键 benchmark(官方)
- Sonnet 4.5:SWE-bench Verified 77.2%(反超 Opus 4.1 的 74.5%);TAU-bench 航空/零售双第一;OSWorld 61.4%
- Haiku 4.5:SWE-bench Verified 73.3%(近 Sonnet 4 级);速度是 Sonnet 4 的 2 倍以上、价格约三分之一
配套产品更新
- Claude Code:检查点与回滚、VS Code 原生扩展、Agent SDK
- Haiku 4.5:ASL-2 安全分级(自动化对齐评估中”最安全”)
关键概念清单
- 中档越级 = 中端型号在部分能力上追平或反超旗舰的产品策略
- orchestrator = 编排者(拆解任务、指挥子 agent 的角色)
- sub-agent = 子智能体(执行局部任务的小模型)
- extended thinking = 扩展思考(分步推理模式,Haiku 首次支持)
- Computer Use = 计算机使用(操作 GUI 的 agent 能力)
- ASL-2 / ASL-3 = AI 安全分级(能力与部署限制挂钩)
- SWE-bench Verified = 用真实 GitHub issue 评测修代码能力的基准
- TAU-bench = 多轮真实交互的 agent 工具调用基准
- OSWorld = 电脑操作(GUI)能力基准
- checkpoint = 检查点(允许回退的工作状态快照)
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





