mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2061 字
6 分钟
Claude Opus 4.5:SWE 破 80%
2026-07-15

Claude Opus 4.5 模型解读:首个 SWE-bench 破 80%,还顺手降了价#

模型:Claude Opus 4.5 厂商:Anthropic 发布日期:2025-11-24 定价:$5/$25(每百万 token,输入/输出,较 Opus 4.1 的 $15/$75 降价约 66%) 总览:2025 年压轴登场。SWE-bench Verified 80.9%——500 道人类工程师手工验证过的真实 GitHub issue,第一个跨过 80% 大关的模型。更狠的是价格:旗舰档从 $15/$75 砍到 $5/$25。性能登顶加价格腰斩,这一年 Anthropic 用一款模型把两件事都干了。


一、引言:先记住这个数字#

SWE-bench Verified 不是选择题考试。它是从真实开源仓库里挑出的 500 个 issue,要求模型读代码、定位 bug、写补丁、跑测试,每道题都有人类工程师手工确认”可解”。在 Opus 4.5 之前,没有任何模型能在这个基准上破 80%。

2025 年 11 月 24 日,Opus 4.5 把这个数字钉在 80.9%。官方 System Card 的对比表写得很清楚:GPT-5.1 76.3%、Gemini 3 Pro 76.2%、自家 Sonnet 4.5 77.2%。同一份文档里还有更吓人的一句——Anthropic 内部的绩效工程师招聘测验(2 小时限时的”带回家”工程题),Opus 4.5 得分高于历史上所有人类应征者

二、能力与数据拆解:全面登顶#

编码是招牌,但 Opus 4.5 不是只修代码:

  • SWE-bench Verified 80.9%(首个破 80,当时全球第一)
  • GPQA Diamond ~87%(研究生级科学推理)
  • MMMU 80.7%(多模态)
  • OSWorld 66.3%(电脑操作,当时最强)
  • Terminal-Bench Hard 44%(更难的终端任务子集)
  • SWE-bench Multilingual:9 种编程语言里领先 8 种

数字之外,用户评价里反复出现一个词:“开窍了”(just gets it)。开发者关系负责人 Alex Albert 说它处理真实任务时表现出直觉和判断力,“感觉比前代质的跨越”。模糊需求能自己权衡,跨系统的大 bug 能自己定位——这类”现实感”是基准分数量不出来的,但对实际生产力才是关键。

三、关键技术创新:把”算力花在哪”交给你决定#

这一代的技术创新不在模型内部,而在使用方式的革新。

effort 参数。 官方承认:不同任务对速度和质量的要求天差地别,有些任务希望它多想一会儿,有些任务要它麻利。于是 API 加了 effort 参数(low/medium/high),把”投入多少算力”做成一个旋钮。官方给的数据非常有说服力:medium 档在 SWE-bench 上追平 Sonnet 4.5 的最佳成绩,同时输出 token 省 76%;最高档比 Sonnet 4.5 高 4.3 个百分点,token 还省 48%。开发者终于不用再”买断”全部算力——按任务精度花钱,第一次成为可能。

上下文压缩(context compaction)。 长对话不再撞墙:上下文快满时,Claude 自动总结更早的内容腾出空间。在带搜索的深度研究评估(BrowseComp-Plus)里,配合上下文管理后性能从 70.48% 升到 85.30%——长任务不掉链子,靠的就是这个。

客户端 Memory 工具(beta)。 在 200K 上下文之外,模型可以读写客户端本地的一个记忆目录,跨会话积累知识。对要跑几天的 agent 项目,记忆不再是”塞进上下文”,而是”存进文件”。

四、意义与影响:性能与价格的双重改写#

性能端,80.9% 把 SWE-bench 的天花板从”差一口气到 80”推到了”80 是及格线”。它领先 GPT-5.1(76.3%)4.6 个点、Gemini 3 Pro(76.2%)4.7 个点——这已经是身位级的差距,不是同档竞争。编码霸权这一局,Anthropic 赢得干净利落。

价格端,$5/$25 比 Opus 4.1 的 $15/$75 便宜约 66%——输入和输出都降到原来的三分之一。这等于同时改写了两条规则:一是旗舰不必最贵,二是最强模型也可以是最普惠的模型。对竞争对手,这是”性能 + 价格”的双重挤压;对开发者,Opus 级能力首次进入可以日常调用的预算区间。

这两件事叠在一起的信号再明确不过:Anthropic 不再把”最强”当成稀缺品来卖。 它要把最强的能力铺到最多的地方——接下来的 Opus 4.6、5 系,都在这条路上继续跑。

收尾:我的一点看法#

80.9% 这个数字的象征意义,比数值本身大。SWE-bench 破 80,意味着”让 AI 独立修真实代码”从”偶尔能成”变成了”大概率能成”。 行业对 agent 的预期在这一天被整体抬了一格——之后所有模型都以”破 80”为基线来讨论,这是 Opus 4.5 给整个 2026 年定下的调子。

我最欣赏的是 effort 参数。它本质上是把”智能”拆成了可买的资源:同一颗大脑,low 档干快活,high 档干硬活。比起”买断一个最强模型”,这种按需付费更接近真实世界——没有哪个工程师会对所有任务都用最大力气。Anthropic 又一次把行业变量做成了产品旋钮,上一回是 3.7 Sonnet 的思考预算,这一回是 effort。

降价 66% 背后其实藏着它的商业判断:在模型能力开始过剩、调用成本卡脖子的阶段,把价格打下来比再堆 5 个点分数更能打开市场。 2026 年 Claude 的企业采用率反超 OpenAI,回头看,Opus 4.5 的定价是那场反超的重要推手。

当然,破 80 的成色得打个问号——SWE-bench 是限定仓库、限定环境的”干净世界”,Flexport 的工程师专门写过一篇文章,提醒大家别把它当生产环境。但这不影响 Opus 4.5 的里程碑地位:天花板被它抬高了,至于天花板离地多远,是下一个模型的事。


附:核心数据速查#

Claude Opus 4.5 基本盘

项目数值
发布日期2025-11-24
定价$5 / $25(较 Opus 4.1 的 $15/$75 降约 66%)
上下文长度200K
最大输出64K
安全分级ASL-3

关键 benchmark(官方 System Card)

  • SWE-bench Verified 80.9%(首个破 80;GPT-5.1 76.3%、Gemini 3 Pro 76.2%、Sonnet 4.5 77.2%)
  • GPQA Diamond ~87%;MMMU 80.7%
  • OSWorld 66.3%;Terminal-Bench Hard 44%
  • SWE-bench Multilingual:9 语言领先 8 种

新能力

  • effort 参数:medium 追平 Sonnet 4.5 最佳、token 省 76%;最高档超 Sonnet 4.5 4.3 个点、token 省 48%
  • 上下文压缩:长对话自动总结,deep research 评估 70.48% → 85.30%
  • 客户端 Memory 工具(beta):跨会话持久记忆

关键概念清单

  • effort parameter = 努力参数(low/medium/high 三档,控制算力投入换取速度或质量)
  • context compaction = 上下文压缩(长对话自动总结旧内容腾出空间)
  • Memory tool = 记忆工具(beta,读写客户端本地目录实现跨会话记忆)
  • SWE-bench Verified = 真实 GitHub issue 修代码基准(500 题,人类验证可解)
  • GPQA Diamond = 研究生级科学问答基准(生物/物理/化学)
  • MMMU = 多模态多学科理解基准
  • OSWorld = 电脑操作(GUI)能力基准
  • Terminal-Bench Hard = 终端任务基准的高难子集
  • SWE-bench Multilingual = SWE-bench 多语言版本(9 种编程语言)
  • ASL-3 = AI 安全三级(高能力模型的严格部署分级)
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Claude Opus 4.5:SWE 破 80%
https://mizuki-eaf.pages.dev/posts/claude/claude-opus-45swe-破-80/
作者
无名之子
发布于
2026-07-15
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录