Claude 2 模型解读:第一次亮成绩单,就敢对标 GPT
模型:Claude 2(Anthropic) 发布:2023-07-11,同日开放 claude.ai 公测(美国/英国) 定价:API $8 / $24(每百万 token 输入/输出) 这是 Anthropic 第一次”按行业的规矩出牌”。首发时一个分数不发的 Claude 1,四个月后带着律师考试、GRE、HumanEval 的成绩单回来了。从这一天起,Claude 正式把自己放进和 GPT 系旗舰同一个赛道上,同时把”参数规模永不公开”写成铁律。
一、引言:从”不谈跑分”到”首次公开对标”
Claude 2 的发布姿态和上一代判若两人。2023 年 7 月 11 日,Anthropic 同步放出两件事:新模型 Claude 2,以及 claude.ai 公测网站——美国、英国的用户注册账号就能直接用,不需要邀请码了。
产品侧的意义很简单:Anthropic 第一次面向大众开放,聊天的入口从”企业 API”变成了”谁都能打开的网页”。但更值得玩味的是宣传侧:官方博客破天荒地列出了具体考试分数——律师考试、GRE、HumanEval、GSM8K,一个不落。这是 Claude 家族第一次公开对标 GPT 系旗舰,等于宣告:安全路线做到第二代,能力上不再怂了。
二、能力与数据拆解:成绩单逐项看
Claude 2 把 100K 上下文(约 7.5 万词)保留为标配,同时把官方首批可引用的成绩亮了出来:
- 律师考试多选(MBE)76.5%——注意这是美国律师资格考试的 multiple-choice section(MBE,多项选择题部分),不是 GRE。Claude 1.3 是 73.0%,进步 3.5 个百分点;
- GRE 阅读与写作高于 90 分位——这是研究生入学考试(Graduate Record Examination)的语文部分,官方原话是”超过申请研究生院的学生中 90% 以上的人”,定量推理(数学)则相当于中位数水平;
- Codex HumanEval 71.2%——Python 代码生成测试,上代 56.0%,一次跳了 15 个点;
- GSM8K 88.0%——小学数学应用题,上代 85.2%。
这套数字放在 2023 年中看是什么水平?律师考试和 GRE 属于”给人类设计的考试”,模型能过这两关,意味着阅读理解、逻辑推理、写作组织能力到了可用的线;HumanEval 71.2% 则直接对齐当时闭源模型第一梯队。Anthropic 用”人类考试 + 代码 + 数学”三路证明了自己不是只会聊天的安全机器。
三、安全与对齐:无害性再翻一倍
能力之外,Claude 2 的安全牌也没丢。官方披露了一项内部红队评测:在大量代表性有害 prompt 的自动化测试中,Claude 2 给出无害响应的能力是 Claude 1.3 的 2 倍。
官方自己也承认”没有模型对 jailbreak(越狱)免疫”,但强调用了多种安全技术加人工红队测试来兜底。Claude 2 还修了上一代一个让用户头疼的毛病——过度拒答(refusals),官方说它”更容易交谈、更少拒绝无害请求”。这个平衡(既保持无害性、又不变成什么都拒绝的保守派)是宪法 AI 路线在第二代真正打磨出来的东西。
四、意义与影响:两条铁律的确立
Claude 2 留下了两条此后五年都没变过的策略:
其一,“不公开参数规模”策略的开端。 官方通篇没提 Claude 2 有多少参数。第三方传言”约 137B”满天飞,但 Anthropic 始终不置可否——从这天起,“只用行为数据说话、参数永不披露”成了固定打法。这招在商业上很聪明:参数一旦公开,就会被拿去做”每参数性能”的算术题,而 Anthropic 恰恰不想被装进这个框架。
其二,长文档能力成为差异化武器。 100K 上下文当时仍是行业天花板(GPT-4 为 32K),配合 PDF 上传、几小时到几天的长对话能力,Claude 直接吃下企业文档处理这块市场。Jasper、Sourcegraph 等第一批合作伙伴的证言里,“长上下文”是出现频率最高的词。
claude.ai 公测还有一层隐藏价值:它让 Anthropic 第一次拥有大规模真实用户反馈,为后续 RLAIF 迭代和”渐进式部署”提供了数据底座。Claude 2 不是终点,而是”能力 + 公测 + 反馈”这个循环的开始。
收尾:我的一点看法
Claude 2 最被低估的一点,是它定义了 Anthropic 后续所有发布的标准动作:先摆人类考试分数,再谈安全和可用性,参数一概不提。这个模板后来被用到烂——Claude 3 的 MMLU、Claude 4 的 SWE-bench,都是同一套话术的进化版。可以说,Claude 2 是”Anthropic 式发布”的样板间。
成绩单本身也有值得拆的地方。GRE 定量推理只到”中位数”,说明数学还是软肋;HumanEval 71.2% 看着猛,但那是 2023 年的基准水位,放到 2024 年 Claude 3 的 84.9% 面前就普通了。Claude 2 的真正价值不在单项分数,而在它证明了:安全对齐做深了,能力并不必然被拖累。
还有一层商业上的伏笔。公测 + 好成绩,直接抬高了市场对 Anthropic 的预期——四个月后 Amazon 砸下 40 亿美元,Claude 2 的表现功不可没。至于那个”137B”的传言,至今没被官方盖章,将来大概也不会。
附:核心数据速查
Claude 2 基本盘
| 项目 | 数值 |
|---|---|
| 发布时间 | 2023-07-11 |
| 访问方式 | API + claude.ai 公测(美国/英国) |
| 上下文长度 | 100K token(约 7.5 万词) |
| 定价 | $8 / $24(每百万输入/输出 token) |
| 参数规模 | 官方未披露(“137B”仅为第三方传言) |
官方公布成绩(vs Claude 1.3)
| 基准 | Claude 2 | 前代 |
|---|---|---|
| 律师考试多选(MBE) | 76.5% | 73.0% |
| GRE 阅读/写作 | >90 分位 | — |
| Codex HumanEval | 71.2% | 56.0% |
| GSM8K | 88.0% | 85.2% |
| 红队无害响应 | 2 倍于前代 | — |
关键概念清单
- MBE = Multistate Bar Examination,美国律师资格考试的多项选择部分
- GRE = Graduate Record Examination,美国研究生入学考试(这里指语文/写作部分)
- Codex HumanEval = Python 代码生成评测基准(Pass@1)
- GSM8K = 小学数学应用题基准(Grade School Math)
- claude.ai = Anthropic 官方聊天网站,2023-07 起公测
- 红队评测 = 用代表性有害 prompt 自动 + 人工评估模型无害性
- jailbreak = 越狱,通过特殊提示词绕过模型安全限制
- refusals = 拒答,模型拒绝回答用户请求的行为(过度则伤体验)
- 不公开参数策略 = 官方从不披露参数规模,只用行为数据说话
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





