mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1925 字
5 分钟
Claude 2:敢对标 GPT
2026-07-07

Claude 2 模型解读:第一次亮成绩单,就敢对标 GPT#

模型:Claude 2(Anthropic) 发布:2023-07-11,同日开放 claude.ai 公测(美国/英国) 定价:API $8 / $24(每百万 token 输入/输出) 这是 Anthropic 第一次”按行业的规矩出牌”。首发时一个分数不发的 Claude 1,四个月后带着律师考试、GRE、HumanEval 的成绩单回来了。从这一天起,Claude 正式把自己放进和 GPT 系旗舰同一个赛道上,同时把”参数规模永不公开”写成铁律。


一、引言:从”不谈跑分”到”首次公开对标”#

Claude 2 的发布姿态和上一代判若两人。2023 年 7 月 11 日,Anthropic 同步放出两件事:新模型 Claude 2,以及 claude.ai 公测网站——美国、英国的用户注册账号就能直接用,不需要邀请码了。

产品侧的意义很简单:Anthropic 第一次面向大众开放,聊天的入口从”企业 API”变成了”谁都能打开的网页”。但更值得玩味的是宣传侧:官方博客破天荒地列出了具体考试分数——律师考试、GRE、HumanEval、GSM8K,一个不落。这是 Claude 家族第一次公开对标 GPT 系旗舰,等于宣告:安全路线做到第二代,能力上不再怂了。

二、能力与数据拆解:成绩单逐项看#

Claude 2 把 100K 上下文(约 7.5 万词)保留为标配,同时把官方首批可引用的成绩亮了出来:

  • 律师考试多选(MBE)76.5%——注意这是美国律师资格考试的 multiple-choice section(MBE,多项选择题部分),不是 GRE。Claude 1.3 是 73.0%,进步 3.5 个百分点;
  • GRE 阅读与写作高于 90 分位——这是研究生入学考试(Graduate Record Examination)的语文部分,官方原话是”超过申请研究生院的学生中 90% 以上的人”,定量推理(数学)则相当于中位数水平;
  • Codex HumanEval 71.2%——Python 代码生成测试,上代 56.0%,一次跳了 15 个点;
  • GSM8K 88.0%——小学数学应用题,上代 85.2%。

这套数字放在 2023 年中看是什么水平?律师考试和 GRE 属于”给人类设计的考试”,模型能过这两关,意味着阅读理解、逻辑推理、写作组织能力到了可用的线;HumanEval 71.2% 则直接对齐当时闭源模型第一梯队。Anthropic 用”人类考试 + 代码 + 数学”三路证明了自己不是只会聊天的安全机器。

三、安全与对齐:无害性再翻一倍#

能力之外,Claude 2 的安全牌也没丢。官方披露了一项内部红队评测:在大量代表性有害 prompt 的自动化测试中,Claude 2 给出无害响应的能力是 Claude 1.3 的 2 倍

官方自己也承认”没有模型对 jailbreak(越狱)免疫”,但强调用了多种安全技术加人工红队测试来兜底。Claude 2 还修了上一代一个让用户头疼的毛病——过度拒答(refusals),官方说它”更容易交谈、更少拒绝无害请求”。这个平衡(既保持无害性、又不变成什么都拒绝的保守派)是宪法 AI 路线在第二代真正打磨出来的东西。

四、意义与影响:两条铁律的确立#

Claude 2 留下了两条此后五年都没变过的策略:

其一,“不公开参数规模”策略的开端。 官方通篇没提 Claude 2 有多少参数。第三方传言”约 137B”满天飞,但 Anthropic 始终不置可否——从这天起,“只用行为数据说话、参数永不披露”成了固定打法。这招在商业上很聪明:参数一旦公开,就会被拿去做”每参数性能”的算术题,而 Anthropic 恰恰不想被装进这个框架。

其二,长文档能力成为差异化武器。 100K 上下文当时仍是行业天花板(GPT-4 为 32K),配合 PDF 上传、几小时到几天的长对话能力,Claude 直接吃下企业文档处理这块市场。Jasper、Sourcegraph 等第一批合作伙伴的证言里,“长上下文”是出现频率最高的词。

claude.ai 公测还有一层隐藏价值:它让 Anthropic 第一次拥有大规模真实用户反馈,为后续 RLAIF 迭代和”渐进式部署”提供了数据底座。Claude 2 不是终点,而是”能力 + 公测 + 反馈”这个循环的开始。

收尾:我的一点看法#

Claude 2 最被低估的一点,是它定义了 Anthropic 后续所有发布的标准动作:先摆人类考试分数,再谈安全和可用性,参数一概不提。这个模板后来被用到烂——Claude 3 的 MMLU、Claude 4 的 SWE-bench,都是同一套话术的进化版。可以说,Claude 2 是”Anthropic 式发布”的样板间。

成绩单本身也有值得拆的地方。GRE 定量推理只到”中位数”,说明数学还是软肋;HumanEval 71.2% 看着猛,但那是 2023 年的基准水位,放到 2024 年 Claude 3 的 84.9% 面前就普通了。Claude 2 的真正价值不在单项分数,而在它证明了:安全对齐做深了,能力并不必然被拖累。

还有一层商业上的伏笔。公测 + 好成绩,直接抬高了市场对 Anthropic 的预期——四个月后 Amazon 砸下 40 亿美元,Claude 2 的表现功不可没。至于那个”137B”的传言,至今没被官方盖章,将来大概也不会。


附:核心数据速查#

Claude 2 基本盘

项目数值
发布时间2023-07-11
访问方式API + claude.ai 公测(美国/英国)
上下文长度100K token(约 7.5 万词)
定价$8 / $24(每百万输入/输出 token)
参数规模官方未披露(“137B”仅为第三方传言)

官方公布成绩(vs Claude 1.3)

基准Claude 2前代
律师考试多选(MBE)76.5%73.0%
GRE 阅读/写作>90 分位
Codex HumanEval71.2%56.0%
GSM8K88.0%85.2%
红队无害响应2 倍于前代

关键概念清单

  • MBE = Multistate Bar Examination,美国律师资格考试的多项选择部分
  • GRE = Graduate Record Examination,美国研究生入学考试(这里指语文/写作部分)
  • Codex HumanEval = Python 代码生成评测基准(Pass@1)
  • GSM8K = 小学数学应用题基准(Grade School Math)
  • claude.ai = Anthropic 官方聊天网站,2023-07 起公测
  • 红队评测 = 用代表性有害 prompt 自动 + 人工评估模型无害性
  • jailbreak = 越狱,通过特殊提示词绕过模型安全限制
  • refusals = 拒答,模型拒绝回答用户请求的行为(过度则伤体验)
  • 不公开参数策略 = 官方从不披露参数规模,只用行为数据说话
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Claude 2:敢对标 GPT
https://mizuki-eaf.pages.dev/posts/claude/claude-2敢对标-gpt/
作者
无名之子
发布于
2026-07-07
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录