Claude 1 模型解读:首发即安全,一个基准都不发
模型:Claude 1(Anthropic) 发布:2023-03-14(邀请制 API),同月配套轻量版 Claude Instant;2023-05-11 上下文扩至 100K 定价:早期 API 按量计费,未随发布公布基准跑分 这是 Anthropic 的第一份作业。别的厂商忙着秀 MMLU,它一个分数都不给,只谈宪法 AI 和安全。这份”反常规”后来被证明不是心虚,而是策略——Claude 全系列”安全是产品不是补丁”的基因,从这一天就定死了。
一、引言:一份不合时宜的第一份作业
2023 年 3 月 14 日,Anthropic 悄悄打开了 API 的大门,放出了自家第一个模型 Claude。注意”悄悄”这个词:不是向公众开放,是邀请制——只有审核通过的企业和开发者能拿到密钥。
当时的市场正被 ChatGPT 搅得火热(那已经是 ChatGPT 发布的第四个月),OpenAI 在 GPT-4 发布会上一口气摆出几十个考试分数。而 Anthropic 的发布博客里,没有一个 benchmark,没有一张对比表,翻来覆去只讲一件事:我们的模型是用宪法 AI(Constitutional AI)训练的,它更安全。
这个反差放在今天看尤其意味深长。一家公司,成立原因是创始人觉得”OpenAI 把商业化摆在了安全前面”,第一款产品就干脆把”不发成绩单”当成卖点——不是没有成绩,而是不想用分数定义自己。
二、能力拆解:9K 起步,100K 破圈
Claude 1 初始上下文只有 9K token,不算惊艳。真正的动作在两个月后:2023 年 5 月 11 日,Anthropic 宣布把 Claude 和 Claude Instant 的上下文一口气扩到 100K token,约 7.5 万英文单词。
这个数字在当时是什么概念?GPT-4 的上下文上限是 32K。100K 意味着能一次把一整本书丢进 prompt,官方演示里甚至把《了不起的盖茨比》全文加载进去,改一行字让模型找差异。对做法律、金融、学术文档处理的人来说,这直接改变工作方式——以前要分段喂、RAG 检索,现在整篇进去。
能力上限方面,官方不发数据,第三方评测把 Claude 1 定位在 GPT-3.5 档:对话流畅、写作自然,但代码、数学、推理这些”硬指标”明显落后。它不靠单项强,靠的是整体”气质”——谨慎、愿意说”我不知道”、对有害请求直接拒绝,这些在 GPT-3.5 时代是稀缺品。
三、安全与对齐:宪法 AI 从论文走进产品
Claude 1 背后是 2022 年 12 月发表的宪法 AI 论文。传统 RLHF 靠人类标注员打分教模型变好,宪法 AI 把流程改了:先写一份”宪法”(一份原则清单,包含联合国《世界人权宣言》等 75 条),让模型自己用这套原则批评并改写自己的回答(SL-CAI),再训练一个 AI 评委给回答打分做强化学习(RL-CAI)。
一句话:用 AI 反馈替代人类反馈(RLAIF,RL from AI Feedback)。好处立竿见影——无害性追平 RLHF 模型,人类标注成本大幅下降,而且对齐的标准是”白纸黑字的宪法”而非”标注员的直觉”,可审计、可迭代。
这也是”对话气质”的来源。Claude 1 的拒绝不是简单触发词拦截,而是训练目标的一部分:模型在训练里就学会了”不确定就说不确定”。这套东西今天看是标配,在当时是独一份。
四、Claude Instant:常被忽略的第二块拼图
同月发布的 Claude Instant 经常被人忘掉,但它同样重要:更快、更便宜、更轻量的版本,定位生产级任务——摘要、搜索、结构化抽取这类对延迟敏感的场景。
一个 Claude 负责”稳”,一个 Instant 负责”快”,双轨并行的产品哲学从第一代就有了。后来的 Haiku 系列、以及”每个价位都有一款 Claude”的策略,源头都能追到这里。
五、意义与影响:验证了一件没人验证过的事
Claude 1 最重要的遗产,是证明了”安全对齐路线能不能做出可用的模型”。
在它之前,“很安全的模型”和”很能打的模型”像是两个物种。Claude 1 用实际产品告诉市场:把对齐写进训练目标,不会让模型废掉,反而能长出一种差异化的对话体验。它不强,但好用、可靠、敢说不知道——这在 2023 年春天是个新鲜事。
邀请制发布也开了”渐进式部署(iterative deployment)“的头:小范围放量、观察、再扩大,而不是一次性丢给全世界。这条方法论此后贯穿 Anthropic 所有产品的生命周期。至于”官方从不发布基准”,直接演变成了整个公司的固定策略,直到 Claude 2 才第一次破例。
收尾:我的一点看法
回头看,Claude 1 是一份被严重低估的答卷。它的参数规模到现在都没公布,跑分一个没有,但它精准地赌对了一件事:2023 年的市场不缺”更强的模型”,缺”让人敢用的模型”。谨慎、诚实、拒绝有害请求,这些”软能力”在当时被当成保守,后来被证明是护城河。
当然,硬伤也是明摆着的。GPT-3.5 档的性能在代码和数学上撑不起大场面,9K 的起始上下文更是差点意思——要不是两个月后扩到 100K,长文档这个后来最值钱的卖点根本立不起来。
有意思的是,Claude 1 验证的”安全路线”,到 Claude 3 时期反而成了双刃剑:过度拒答(refusals)开始劝退用户,“对齐税”的代价在 2024 年集中爆发。但那是后话。至少在 2023 年春天,这家只有 150 人上下的公司,用一款不跑分、只谈安全的模型,站住了脚跟。
附:核心数据速查
Claude 1 基本盘
| 项目 | 数值 |
|---|---|
| 发布方式 | 邀请制 API(审核制开放) |
| 上下文长度 | 初始 9K token,2023-05-11 扩至 100K(约 7.5 万词) |
| 参数规模 | 官方从未披露 |
| 基准成绩 | 官方未发布任何跑分(第三方定位 GPT-3.5 档) |
| 配套模型 | Claude Instant(轻量版,同月发布,同样扩至 100K) |
| 训练方法 | 宪法 AI(SL-CAI + RL-CAI) |
| 生命周期 | 2024-09 弃用,2024-11 退役 |
关键概念清单
- 宪法 AI = Constitutional AI,把价值原则写成”宪法”、用 AI 反馈对齐模型的方法
- RLAIF = RL from AI Feedback,用 AI 评委的反馈替代人类反馈做强化学习
- SL-CAI = 监督学习阶段,让模型按宪法原则自我改写回答后微调
- RL-CAI = 强化学习阶段,训练 AI 评委给回答打分做 RL
- HH-RLHF = Helpful & Harmless 人类反馈强化学习数据集(Anthropic 早期奠基工作)
- 红队测试 = Red Teaming,人类主动攻击模型找安全漏洞的评估方法
- 渐进式部署 = iterative deployment,小范围放量、观察、再扩大的发布策略
- 对齐税 = alignment tax,安全对齐牺牲部分 benchmark 性能的代价
- Claude Instant = 第一代轻量版模型,快、便宜、低延迟,面向生产级任务
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





