Claude 3 家族模型解读:一档打一个价格带,全家桶登顶
模型:Claude 3 家族(Haiku / Sonnet / Opus) 厂商:Anthropic 发布日期:2024-03-04(Opus、Sonnet 当日上线,Haiku 2024-03-07 上线) 定价:Opus $15/$75、Sonnet $3/$15、Haiku $0.25/$1.25(每百万 token 输入/输出) 总览:Claude 3 是 Claude 系列第一次”成家族”发布——三档模型、统一 200K 上下文、全员视觉能力,旗舰 Opus 在几乎所有主流基准上首次全面压过 GPT-4。上一代 Claude 2.1 还在 200K 上下文和 tool use 上打地基,这一代直接把”能不能打”这个问题翻篇,转而回答”要多贵、要多快、够不够用”。三档分层从此固定成 Anthropic 的产品哲学,后面每一代 Claude 都在复刻这个套路。
一、引言:从”一款模型”到”一把梯子”
Claude 1、2、2.1 都是单打独斗的选手,你只能”选一个 Claude 吃下所有 tradeoff”:要便宜就没智能,要智能就烧钱。Claude 3 第一次给了开发者一把梯子。
三档按能力递进排列:**Haiku(俳句)**最轻、最快、最便宜;**Sonnet(十四行诗)**居中,主打均衡;**Opus(史诗)**站在顶格,专啃最硬的骨头。命名借用诗歌体裁不是卖弄,三层正好对应三种工作负载——实时客服、日常主力、深度推理。在 2024 年 3 月,还没有哪家实验室一次性发布过这种”成体系、分价位、对齐场景”的产品线。
这也解释了为什么发布会当天 Haiku 没同步上:它 3 月 7 日才上线。旗舰和主力先亮相,轻量档随后补齐。
二、能力与数据拆解:Opus 全面登顶
Opus 在各大基准上对 GPT-4 的数据,是全篇最扎眼的部分:
| 基准 | Claude 3 Opus | GPT-4 | 差距 |
|---|---|---|---|
| MMLU | 86.8% | 86.4% | +0.4 |
| GPQA | 50.4% | 35.7% | +14.7 |
| MATH | 60.1% | 52.9% | +7.2 |
| HumanEval | 84.9% | 67.0% | +17.9 |
| MMMU | 59.4% | 56.8% | +2.6 |
MMLU 只领先 0.4 个百分点,属于”险胜”;但 GPQA(研究生级专家推理)领先 14.7、HumanEval(代码)领先 17.9,这是碾压级的差距。前者是 PhD 都头疼的物理/化学题,后者是实打实的编程正确率——GPT-4 的短板被 Opus 摁着打。
统一 200K 上下文。 三档一视同仁,全部 200K token(约 15 万词)。配合官方说的”三个模型都具备超过 100 万 token 的输入能力,可向特定客户开放”——虽然 1M 后来拖到 Opus 4.6 才落地,但 NIAH(Needle In A Haystack,大海捞针)测试已经做到近完美召回,超过 99%。官方还补了一个俏皮细节:Opus 有时会指出”这枚针是人为插入的”——它看穿了测试本身。
视觉是新增量。 照片、图表、流程图、技术图纸全能读。Anthropic 专门点出企业场景:不少客户的知识库有一半内容是 PDF、流程图、幻灯片这类非纯文本格式——之前这些全没法喂给模型,现在行了。
三、关键技术创新:产品结构即创新
Claude 3 的技术突破点不算多,真正的创新在产品结构上。
三档分层策略。 这是 Claude 3 最大的原创。Opus $15/$75 打旗舰价格带,Sonnet $3/$15 打主流带,Haiku $0.25/$1.25 打成本带——一档打一个价格带,任何预算、任何延迟要求都能找到对应的型号。后来的每一代 Claude 都默认了这套结构,以至于”哪个价位缺一款 Claude”成了行业观察家的固定提问。
速度与成本的匹配。 Haiku 官方定位是”不到 3 秒读完一篇带图表的 arXiv 论文(约 1 万 token)“;Sonnet 比 Claude 2/2.1 快 2 倍;Opus 速度与上一代相当但智能大幅跃升。三档不是简单的大中小,而是”延迟敏感 / 均衡 / 极致智能”三条优化曲线。
少拒绝。 前代 Claude 经常”过度自我设防”,把无害问题也拒了。Claude 3 三档都显著减少误拒——上下文理解进步直接体现在产品体验上。还顺手把开放性问答的错误陈述率降到 Claude 2.1 的一半以下。
四、意义与影响:Claude 第一次全面超越 GPT-4
这是 Anthropic 成立以来第一次能在公开基准上对 GPT-4 说出”全面领先”。在此之前,Claude 的卖点是安全、是”宁可少答不可答错”;从 Claude 3 开始,它变成了**“又强又安全”**——性能登顶不再靠安全叙事买单。
Claude 3 同时给 Anthropic 定下了此后三年的产品节奏:以家族为单位发布,用价位差制造选择空间,让每一档都精准咬住一块市场。对比后来的 Gemini 和 GPT 系列,这套”三档齐发”的节奏反而成了行业模板。
收尾:我的一点看法
Claude 3 最值得说的不是哪个跑分,而是它把”选模型”本身做成了产品能力。以前的 API 用户拿到的是一个模型,得自己猜它行不行;现在拿到的是三档定价的货架,按场景闭眼选就行。这种”产品结构创新”比单一技术突破更难复制,因为它要求团队对推理成本和用户场景的理解足够细。
Opus 对 GPT-4 的碾压级领先(GPQA +14.7、HumanEval +17.9)是那个月最容易被忽略的新闻。GPT-4 当时已经发布近一年,大家默认它就是天花板;Claude 3 用一组数据宣告:天花板是可以被掀翻的,而且掀翻它的不是财大气粗的巨头,是一家”慢半拍”的安全派实验室。
还有一层值得品:Haiku 的 $0.25 定价放今天看是白菜价,但它是三档结构的锚点——没有最底下一档的便宜,上面两档的”贵”就没有参照系。Claude 3 之后,Anthropic 的每代更新都在重复同一件事:把三档的性价比整体往上推。这个套路从 2024 年 3 月一直用到 2026 年。
附:核心数据速查
Claude 3 基本盘
| 项目 | Opus | Sonnet | Haiku |
|---|---|---|---|
| 发布日期 | 2024-03-04 | 2024-03-04 | 2024-03-07 |
| 输入定价 | $15 / 百万 token | $3 / 百万 token | $0.25 / 百万 token |
| 输出定价 | $75 / 百万 token | $15 / 百万 token | $1.25 / 百万 token |
| 上下文长度 | 200K | 200K | 200K |
| 视觉输入 | 支持 | 支持 | 支持 |
Opus 关键 benchmark(官方)
- MMLU 86.8%;GPQA 50.4%;GSM8K 95.0%;MATH 60.1%;HumanEval 84.9%;MMMU 59.4%
- NIAH 长上下文召回 >99%(近完美)
对 GPT-4 的领先
- MMLU +0.4;GPQA +14.7;MATH +7.2;HumanEval +17.9;MMMU +2.6
关键概念清单
- MMLU = 本科水平多学科知识评测
- GPQA = 研究生级专家推理评测(物理/化学/生物)
- GSM8K / MATH = 小学数学 / 竞赛级数学评测
- HumanEval = 代码生成正确性评测
- MMMU = 多学科多模态评测(跨 30+ 学科)
- NIAH = Needle In A Haystack,大海捞针(长上下文召回测试)
- token = 文本切分的最小单位(约 0.75 个英文单词)
- 上下文窗口 = 模型单次能处理的输入+输出长度上限
- 多模态(vision)= 模型可处理图像、图表等非纯文本输入
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





