Claude 3.5 Haiku 模型解读:最便宜的一档,追平最贵的一档
模型:Claude 3.5 Haiku 厂商:Anthropic 发布日期:2024-10-22 宣布,2024-11-04 正式上线 定价:$1/$5 上线(较上代涨 4 倍),2024-12-05 下调至 $0.80/$4 总览:Claude 3.5 Haiku 是 3.5 家族的最后一块拼图,也是”轻量档越级”的集大成者——SWE-bench Verified 拿下 40.6%,多项评测追平甚至超越上一代旗舰 Opus 3,而价格只有它的几十分之一。为了让这次”越级”定价,Anthropic 把 Haiku 涨了 4 倍,惹来一片争议,一个月后又默默降了 20%。三档分层到这一代才算真正闭合。
一、引言:三档拼图的最后一块
3.5 Sonnet 在 6 月上演”中档越级”后,三档里还剩最底层的 Haiku 没更新。2024 年 10 月 22 日,Anthropic 在发布 Computer Use 的同一天宣布了 3.5 Haiku 的存在,11 月 4 日正式上线。
它跟上一代 Claude 3 Haiku 一个关键区别:从第一天就不是”替代品”而是”升级品”。老 Haiku 继续留在货架上,因为初版 3.5 Haiku 暂不支持视觉输入——想要最便宜的多模态,还是得买老款(这个缺口直到 2025 年 2 月 25 日才补上)。一款新模型不急着覆盖全部旧功能,说明 Anthropic 对”新轻量档该长什么样”心里很有数。
二、能力与数据拆解:轻量档的性能跃迁
3.5 Haiku 的核心成绩单是这张:
| 评测 | Claude 3.5 Haiku | Claude 3 Opus | Claude 3 Haiku |
|---|---|---|---|
| SWE-bench Verified | 40.6% | ~38% | ~17% |
| 输入价格 | $0.80/百万 | $15/百万 | $0.25/百万 |
SWE-bench Verified 40.6%,超过上一代旗舰 Opus 3(约 38%),更超过当时市面上许多基于公开 SOTA 模型搭建的 agent 系统,包括 GPT-4o。用官方的话说,它”以极小的成本比例,在许多基准上超过了我们之前的旗舰模型”。Opus 3 比它贵约 15 倍——便宜 15 倍还更聪明,这是 3.5 Sonnet 越级故事的极致版。
代码、工具使用、逻辑推理是这代的主攻方向。官方给它的定位场景也很实:代码补全、交互式聊天机器人、数据提取与标注——全是高频、低成本、对延迟敏感的生产型任务。知识截止到 2024 年 7 月,是当时所有 Claude 模型里最新的。
三、定价策略调整:先涨 4 倍,再降 20%
这次发布最有戏剧性的部分,是定价。
3.5 Haiku 从 $0.25/$1.25 直接涨到 $1/$5,整整 4 倍。官方给的涨价比谁都直白:“在最终测试中,Haiku 在许多基准上超过了我们之前的旗舰模型 Claude 3 Opus,所以我们调整了定价以反映它智能的提升。“翻译一下:变聪明了,所以要涨价。
开发者不买账。当时对比下来,它比 GPT-4o Mini、Gemini 1.5 Flash 贵了将近 7 倍,用户直接开嘲”变聪明就该涨价的逻辑会惹毛所有模型爱好者”。社区情绪一度相当激烈。
一个月后的 12 月 5 日,Anthropic 借着与 AWS 合作的博客,悄悄把 3.5 Haiku 全平台价格降到 $0.80/$4(降幅 20%)。同文宣布 Trainium2 优化版提供最高 60% 的延迟优化推理,那个版本仍按 $1/$5 计费。一涨一降之间,Anthropic 完成了对轻量档真实价值的校准。
四、意义与影响:三档分层的完整闭合
3.5 Haiku 的意义,得放回三档结构里看。
3.5 Sonnet 证明”中档可以越级”,3.5 Haiku 则证明”轻量档也可以越级”——每个价位段都拿到了接近上一档旗舰的性能。至此三档分层在 3.5 这一代才算真正闭合:Opus 保持天花板,Sonnet 是性价比主力,Haiku 是成本与延迟的底线。Anthropic 此前被诟病”只有贵的好用”,从 2024 年 11 月起,这个说法站不住了。
它还为”子 agent”提供了经济基础。Agent 架构里大量底层调用(规划、检索、简单工具操作)用不到旗舰智能,3.5 Haiku 这类模型让”多智能体各司其职”在成本上变得可行。后来 Haiku 4.5 的 SWE-bench 73.3%、以及各种多 Agent 框架的底层选型,都能从这款模型的定位里看到源流。
收尾:我的一点看法
3.5 Haiku 是那种”看了分数觉得合理、看了价格觉得离谱”的发布。40.6% 的 SWE-bench 挂在一款轻量档上,本身就很荒谬——要知道 OpenAI 当时专门做 coding 的系统也不见得稳过这个数。它证明了一件事:推理能力和参数规模的关系,远没有想象中那么铁。训练数据、对齐质量、推理预算,这些因素堆起来足以让一个小模型跨档位打人。
涨价 4 倍这件事,我倒是能理解 Anthropic 一半。旧的 $0.25/$1.25 是按”轻量任务”定价的,现在它干的是”真·编码”的活,成本结构确实不一样。但”因为变聪明所以涨价”这话说得太直,等于把”我们在卖智能密度”写在了脸上——开发者不骂你骂谁。后来降价 20% 与其说是让利,不如说是给市场预期一个台阶下。
三档分层从 Claude 3 提出、3.5 Sonnet 加码、到 3.5 Haiku 闭合,整套逻辑到 2024 年底算是跑通了。之后 Anthropic 的每一代更新,本质上都在重复同一件事:把三档的性价比整体往上抬。2025 年的 3.7、Claude 4 系列,2026 年的 4.5/4.6,走的都是这条路。
附:核心数据速查
Claude 3.5 Haiku 基本盘
| 项目 | 数值 |
|---|---|
| 发布日期 | 2024-11-04(10-22 宣布) |
| 定价 | 上线 $1/$5,2024-12-05 降至 $0.80/$4 |
| 上下文长度 | 200K |
| 知识截止 | 2024-07(发布时全 Claude 最新) |
| 视觉输入 | 初版不支持,2025-02-25 补齐 |
关键 benchmark
- SWE-bench Verified:40.6%(超 Claude 3 Opus 约 38%、Claude 3 Haiku 约 17%)
- 多基准追平/超越 Claude 3 Opus(价格约为其 1/15)
定价演进
- Claude 3 Haiku:$0.25 / $1.25
- 3.5 Haiku 上线:$1 / $5(涨 4 倍)
- 3.5 Haiku 现价:$0.80 / $4(降 20%)
- Trainium2 延迟优化版:$1 / $5(最高提速 60%)
关键概念清单
- SWE-bench Verified = 用真实 GitHub issue 评测模型解决软件问题的基准
- 越级 = 低档位模型性能反超高档位模型
- 子 agent(sub-agent)= 多智能体架构中承担底层单一任务的模型
- 延迟优化推理 = 牺牲部分吞吐换取更快首字响应
- Trainium2 = AWS 自研 AI 训练/推理芯片
- prompt caching = 缓存重复前缀降低推理成本
- 知识截止 = 模型训练数据的最新时间点
- 三档分层 = Haiku/Sonnet/Opus 按成本、速度、智能分层定价的产品结构
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





