Claude 3.5 Sonnet 模型解读:中档模型打爆自家旗舰
模型:Claude 3.5 Sonnet 厂商:Anthropic 发布日期:2024-06-20(2024-10-22 发布升级版) 定价:$3/$15,200K 上下文 总览:Claude 3.5 Sonnet 是 3.5 家族的第一个成员,也是 Claude 史上最会”越级”的模型:花中档的钱,拿旗舰的智能,速度还是 Opus 3 的两倍。六月首发带着 Artifacts,十月升级又顺带把业界第一个 Computer Use(计算机使用)公开测试版送上线。3.5 Sonnet 之后,“用 Sonnet 的预算逼近 Opus 的体验”成了 Claude 每一代都要复刻一遍的戏码。
一、引言:3.5 家族的开路先锋
2024 年 6 月 20 日,GPT-4o 才发布不到两个月,Claude 3.5 Sonnet 就以中档身份出场,直接宣布”在广泛评测上超越竞品模型和 Claude 3 Opus”——官方原话,一点不谦虚。
价格没变,还是 $3/$15,200K 上下文。但智能跳了一级,速度还翻了一倍。这等于在告诉市场:Anthropic 这一代不做”更贵的旗舰”,而是把智能整体往下送。三个月后的十月升级版进一步把编程和 agentic 能力再推一轮,顺手带出了 Computer Use——那是当年 AI 圈最激进的一次公开动作。
二、能力与数据拆解:越级怎么打
先看六月首发的硬数据:
| 基准 | Claude 3.5 Sonnet | Claude 3 Opus |
|---|---|---|
| GPQA | 59.4% | 50.4% |
| MMLU | 88.7% | 86.8% |
| HumanEval | 92.0% | 84.9% |
| MATH | 71.1% | 60.1% |
| MMMU | 68.3% | 59.4% |
全项反超旗舰,其中 GPQA 直接干到 59.4%(GPT-4 才 35.7)。更关键的是速度:官方口径是 Opus 3 的两倍——同等智能、两倍速度、三分之一的价格,这个组合当时市面上没人接得住。
agentic 编码评测。 这是 3.5 Sonnet 最值得盯的一项:在内部 agentic coding 评测里,它解决 64% 的问题,Opus 3 只有 38%。评测内容不是写几行函数,而是”给一个开源代码库的自然语言描述,让它自己修 bug 或加功能”。64% vs 38% 说明这代模型的差距不在背知识,而在能不能独立干活。
十月升级版。 2024-10-22 补了一刀,方向全在 agent 上:SWE-bench Verified 从 33.4% 提到 49.0%(当时超过所有公开模型),TAU-bench 零售 62.6%→69.2%、航空 36.0%→46.0%。SWE-bench 测的是”解决真实 GitHub issue”,TAU-bench 测的是”跟用户和工具多轮打交道”——两项都踩在 Agent 时代的命门上。
三、关键技术创新:Artifacts 和 Computer Use
3.5 Sonnet 的技术核心不是单个 benchmark 的跃迁,而是两个产品级创新。
Artifacts。 六月首发,让模型生成的内容不只是一段对话文字,而是一个可交互的面板——代码、文档、图表、网页都在旁边的窗口里实时生成、随时编辑。Claude 从”聊天机器人”第一次变成了”工作台”。这个功能后来一路演变成 Claude 的”Projects”体系,今天人人熟悉的”AI 产出物就地编辑”体验,源头就是 Artifacts。
Computer Use(计算机使用)。 十月升级同日发布,业界第一个公开测试版。思路跟”给模型做特定工具”完全相反:不教 Claude 用某个 API,而是教它通用电脑技能——看截图、移动光标、点按钮、敲键盘,像人一样操作浏览器和桌面软件。官方承认动作还很笨(滚动、拖拽、缩放都费劲),但方向已经摊开。
在 OSWorld 基准上,纯截图模式得分 14.9%——此前最佳 AI 系统只有 7.8%,人类是 72.4%;如果步数给足,能到 22.0%。数字低是事实,但它是从”完全不会”到”会一点但很慢”的质变。
四、意义与影响:Agent 方向最激进的一步
“中档越级”从此成为 Claude 的经典戏码。3.5 Sonnet 用价格证明了一件事:智能密度不是旗舰专属,中档模型可以在主力价格带上打出旗舰级体验。这直接动摇了”买 Opus 才安心”的心智,也让 Anthropic 的 API 生意从”卖贵模型”转向”卖性价比”。
Computer Use 的意义更深远。14.9% 的分数在今天看来低得可怜,但在 2024 年 10 月,它是AI 能直接操作电脑的首次公开产品化。OpenAI 的 Operator、Google 的 Project Mariner 都在几个月后跟进了同样的方向——不是它们想跟,是这条路被 Anthropic 先踩通了。从”AI 会说”到”AI 会做”,Computer Use 是把门踹开的那一脚。
收尾:我的一点看法
3.5 Sonnet 是那种”数据很漂亮,但漂亮得不够劲爆”的发布——直到你意识到它是个中档模型。全项反超 Opus 3 这种事,正常公司不会让它发生(会影响旗舰销量),Anthropic 偏要这么干。事后看,这是很聪明的策略:用一场”越级”制造话题,用性价比换市场份额,再用下一代的 Opus 拉回高端心智。戏码不断重演,市场还就吃这套。
Computer Use 我持保留态度的乐观。14.9% 的分数意味着它在生产环境里基本干不了实事,但 Anthropic 愿意把”半成品”公开出来让开发者折腾,这在保守的 Anthropic 身上极其反常。它的价值不在分数,在于把 Agent 从演示拽进了真实浏览器——之后的 Agent 赛道爆发,起点就是这一天。
顺带说一句,Artifacts 才是被低估的那个。Computer Use 抢了头条,但 Artifacts 改变了每个 Claude 用户的日常交互方式。回头看,那是 Anthropic”从对话走向工作流”产品哲学的第一次完整表达。
附:核心数据速查
Claude 3.5 Sonnet 基本盘
| 项目 | 数值 |
|---|---|
| 发布日期 | 2024-06-20(2024-10-22 升级版) |
| 定价 | $3 / $15(每百万 token 输入/输出) |
| 上下文长度 | 200K |
| 速度 | Opus 3 的两倍 |
首发版 benchmark(官方)
- GPQA 59.4%;MMLU 88.7%;HumanEval 92.0%;MATH 71.1%;MMMU 68.3%
- agentic 编码评测:64%(Opus 3 为 38%)
升级版(2024-10-22)
- SWE-bench Verified:33.4% → 49.0%
- TAU-bench 零售:62.6% → 69.2%;航空:36.0% → 46.0%
- Computer Use(公开测试版):OSWorld 14.9%(此前最佳 7.8%、人类 72.4%、步数给足 22.0%)
关键概念清单
- agentic coding = 让模型自主完成”读代码→改 bug→加功能”的闭环
- SWE-bench Verified = 用真实 GitHub issue 评测模型修代码能力的基准
- TAU-bench = 评测模型与用户/工具多轮交互的 agent 基准(零售、航空两域)
- OSWorld = 让 AI 像人一样操作电脑的桌面场景基准
- Artifacts = 模型生成的可在独立面板实时编辑的产出物(代码/文档/图表)
- Computer Use = 让模型看屏幕、移光标、点击、打字操作电脑的能力
- 越级 = 低档位模型性能反超高档位模型
- 脚手架(scaffolding)= 评测时额外搭建的提示与工具框架
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





