mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2347 字
7 分钟
Claude 3.7 Sonnet:一个大脑双速
2026-07-14

Claude 3.7 Sonnet 模型解读:第一个混合推理模型,一个大脑两种速度#

模型:Claude 3.7 Sonnet 厂商:Anthropic 发布日期:2025-02-24 定价:$3/$15(标准与扩展思考模式同价,思考 token 计入输出) 总览:Claude 3.7 Sonnet 是 Anthropic 迄今最智能的模型,也是市面上第一款混合推理(hybrid reasoning)模型——同一个模型,既能秒回,也能把思维过程摊开给你看,思考预算最高 128K token。标准模式下 SWE-bench Verified 62.3%,开扩展思考加脚手架能到 70.3%。同日 Claude Code 以研究预览身份亮相。这之后,“一个模型两种模式”成了全行业标配。


一、引言:从”两套模型”到”一个大脑”#

3.7 Sonnet 之前,推理模型是另一条产品线:OpenAI 的 o 系列独立成军,模型又慢又贵,只在需要深度思考时才值得用。Anthropic 明确反对这个设计。官方的说法很漂亮:“正如人类用同一个大脑既快速应答、又深入反思,我们认为推理应该是前沿模型的集成能力,而不是一个独立的模型。”

于是有了混合推理:同一个 Claude 3.7 Sonnet,标准模式(standard)是 3.5 Sonnet 的升级版,秒回;扩展思考(extended thinking)模式则先自我反思再作答,数学、物理、代码、指令跟随全面受益。用户按需切换,API 用户还能精确控制思考时长。价格一分不涨,还是 $3/$15。

二、能力与数据拆解:编程能力跃迁#

核心变化集中在现实任务——官方直说这代”没那么为数学和计算机竞赛题优化,而是聚焦企业真正会用到的工作负载”。

基准Claude 3.7 Sonnet说明
SWE-bench Verified(标准)62.3%3.5 Sonnet 升级版为 49.0%
SWE-bench Verified(扩展思考+脚手架)70.3%当时全行业最佳
TAU-bench 零售81.2%agent 工具调用,3.5 Sonnet 为 69.2%

SWE-bench Verified 62.3% 的标准模式成绩,比 3.5 Sonnet 的 49.0% 一跳就是 13 个点;扩展到 70.3%,直接刷新纪录,超过了当时所有公开模型。TAU-bench 零售 81.2%,比 3.5 Sonnet 涨了 12 个点。这些不是排行榜刷分——SWE-bench 是改真实 GitHub issue,TAU-bench 是跟真实用户和工具打交道,全是”能不能干活”的问题。

编程之外,前端 Web 开发被单独点名”显著改进”。Cursor、Vercel、Replit、Canva 这些第一批用户也都出来背书:处理复杂代码库、规划跨仓库改动、从零搭 Web 应用,3.7 Sonnet 都比前代和竞品稳。连 Pokémon 游戏通关测试都赢了所有前代——Anthropic 偶尔会放出这种”不正经”的成绩,但它是真实能力的侧写。

三、关键技术创新:混合推理与思考预算#

3.7 Sonnet 的技术创新有三层,一层比一层更”产品化”。

一个模型,两种模式。 这是核心。不需要用户在”快模型”和”思考模型”之间切换,也不用担心选错——标准模式答得不够好,就换扩展思考再来一次。模式切换不换模型,上下文和对话历史完全连续。官方强调 prompting 在两种模式下基本一致,开发者几乎零迁移成本。

思考预算(thinking budget)。 API 用户可以显式控制”think up to N tokens”,任何 N 值,上限到输出限制的 128K token。想要更快就设小预算,想要更高质量就放足预算——质量和速度的 tradeoff 第一次被做成了一个旋钮,而不是一个二选一。思考 token 按输出计费,定价透明,没有额外溢价。

可见的思维过程。 扩展思考模式的推理链对用户可见。用户能看见模型”先分析已知、再拆解问题、再分步求解”,这在可调试性和可信度上都是前代没有的。对开发者来说,可见的思考链还能帮助 prompt 调试——看模型在哪一步想偏了。

同一天,Claude Code 以研究预览身份发布:一个跑在终端里的编码 agent,读仓库、改代码、跑测试、提交 PR。详情另篇再讲,但记住一点就够了——它跟 3.7 Sonnet 同日登场,不是巧合。

四、意义与影响:混合推理成为行业标配#

3.7 Sonnet 发布时,OpenAI 的 o 系列还是”独立推理模型”路线;到 2026 年再看,“一个模型两种模式”已经成了全行业默认。DeepSeek V3.1 走混合推理、OpenAI 后续把推理能力并进主模型,方向惊人一致。Anthropic 用一款产品证明了:分叉的”快模型+推理模型”体验割裂、维护两套成本,不如在训练阶段就把推理能力长进同一个大脑。

这个设计的连锁反应很实在。一是成本结构简化——开发者不再需要”这个场景用 A,那个场景用 B”的路由逻辑,一个模型通吃。二是推理民主化——思考预算旋钮让中小开发者也能按任务精度花钱,而不是被”推理模型贵 5 倍”挡在门外。三是可见思维链给了调试抓手,为后来 Agent 工作流里的”可观测性”埋了伏笔。

收尾:我的一点看法#

3.7 Sonnet 最狠的地方不在 70.3% 的 SWE-bench,而在它对”推理模型该长什么样”的定义权。o 系列把推理做成一个独立、昂贵、封闭的箱子,Anthropic 反手把推理做成一个可以调节的旋钮,还放在 $3/$15 的价位上。行业后来集体转向混合推理,本质是承认”独立推理模型”这条路更贵、更难用——这是 3.7 Sonnet 留下的最大遗产。

思考预算这个机制我尤其喜欢。它把”智能”从玄学变成了可度量的资源:花多少 token 思考,就换回多少质量。这让 3.7 Sonnet 更像一个工程产品而非研究 demo——也解释了为什么它发布后,各家 API 都开始推出”思考时长/推理预算”之类的参数。现在看是标配,但第一个把它做成产品的人,是 Anthropic。

编程能力的跃迁也值得单说。62.3%→70.3% 的跨越,靠的不是更大参数,而是”该想的时候真的去想了”。扩展思考 + 脚手架的组合证明了一件事:给模型思考的时间和工具,比给它更深的神经网络更划算。这个结论在 2026 年的今天已经被反复验证,但在 2025 年 2 月,它是很新的一步。

当然,这代还是 Sonnet 档位——真正的 Opus 级混合推理要等到 Claude 4 系列。3.7 Sonnet 的意义是先把路趟通:价格不变、模式可切、思考可控。它教会了整个行业一件事——推理不是一种商品规格,而是一种交互方式。


附:核心数据速查#

Claude 3.7 Sonnet 基本盘

项目数值
发布日期2025-02-24
定价$3 / $15(两种模式同价,思考 token 计入输出)
上下文长度200K
思考预算上限128K token(API 可设任意 N)
核心形态首个混合推理(hybrid reasoning)模型

关键 benchmark(官方)

  • SWE-bench Verified:标准模式 62.3%;扩展思考+脚手架 70.3%
  • TAU-bench 零售:81.2%(3.5 Sonnet 为 69.2%)
  • 前端 Web 开发、复杂代码库处理显著改进

同日发布

  • Claude Code 研究预览(终端编码 agent)

关键概念清单

  • hybrid reasoning = 混合推理(同一模型集成快答与深度思考两种模式)
  • extended thinking = 扩展思考(模型先自省再作答,思维链对用户可见)
  • thinking budget = 思考预算(API 控制模型思考 token 上限的旋钮)
  • SWE-bench Verified = 用真实 GitHub issue 评测模型修代码能力的基准
  • TAU-bench = 评测模型与用户/工具多轮交互的 agent 基准
  • 脚手架(scaffolding)= 评测时额外搭建的提示与工具框架
  • 思维链(chain of thought)= 模型分步展示的推理过程
  • Claude Code = 跑在终端里的 AI 编码 agent(研究预览首发)
  • thinking token = 思考模式消耗并计入输出计费的 token
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Claude 3.7 Sonnet:一个大脑双速
https://mizuki-eaf.pages.dev/posts/claude/claude-37-sonnet一个大脑双速/
作者
无名之子
发布于
2026-07-14
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录