mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1609 字
5 分钟
Claude Opus 4.1:Agent 拧紧半圈
2026-07-11

Claude Opus 4.1 模型解读:不折腾架构,把 Agent 拧紧半圈#

模型:Claude Opus 4.1 厂商:Anthropic 发布日期:2025-08-05 定价:$15/$75(每百万 token,输入/输出,与 Opus 4 同价) 总览:Opus 4 发布后不到三个月,4.1 静悄悄来了。没有新架构、没有发布会,官方明说这是 Opus 4 的”直接升级”,重心全压在 agentic 任务上:SWE-bench Verified 74.5%,GPQA Diamond 80.9%,TAU-bench 零售 82.4%。中期迭代,拼的是工程手感。


一、引言:中期迭代的正确姿势#

2025 年 8 月 5 日,Anthropic 放出 Opus 4.1。官方定义很朴素:“Opus 4 在 agentic 任务、真实编码和推理上的升级”,推荐所有 Opus 4 用户直接换。注意”升级”这个词——不是换代,定价没变,上下文还是 200K。它存在的意义,是在两个大版本之间把旗舰的短板补一补。

当时外部有个误传,说 Opus 4.1 的 SWE-bench 到了 80.1%。官方后来把话说死:74.5%,不是 80.1%。这个勘误值得记住——中期迭代通常不会动辄涨 5 个点,进步是挤出来的。

二、能力与数据拆解:Agentic 能力全面补强#

先看数字(对比 Opus 4,官方同口径):

基准Opus 4.1Opus 4
SWE-bench Verified74.5%72.5%
Terminal-Bench43.3%39.2%
GPQA Diamond80.9%79.6%
TAU-bench 零售82.4%81.4%
AIME 202578.0%75.5%

涨得最明显的不是跑分榜常客,而是跟”agent 干活”直接相关的那几项:Terminal-Bench 从 39.2% 跳到 43.3%,TAU-bench 零售 82.4%。GPQA Diamond 80.9% 和 AIME 2025 78.0% 说明推理能力也顺手强了一截。

三、关键技术创新:没有新架构,全是工程功夫#

4.1 没有新论文、没有架构变革,官方反复强调的是三类真实场景反馈。

多文件代码重构是最大亮点。 GitHub 点名叫好:“相对 Opus 4,多数能力有提升,尤其多文件重构。“Rakuten 的观察更细:它在大型代码库里能精确定位该改的地方,不碰不该碰的,团队日常调试任务效率提升约 50%。“知道什么时候不该动代码”,这句话在 agent 编码里比”会写代码”更值钱——大模型最招人恨的就是自作主张乱改。

深度研究与数据分析被点名补强。 官方明说这版在”细节追踪和 agentic 搜索”上下了功夫——也就是信息密集型任务里不丢线索。

Windsurf 给了一把跨代对比的尺子。 它说 4.1 在自家初级开发者基准上比 Opus 4 高 1 个标准差,跃迁幅度”相当于 Sonnet 3.7 到 Sonnet 4”。基准上的小幅爬升,放到真实工作负载里可能是质变。

四、意义与影响:迭代哲学的一次示范#

Opus 4.1 回答了一个问题:旗舰模型发布之后,三个月里应该干什么? 答案不是憋大招,而是把已知短板一个个补上,让真实用户先用起来、先反馈。Anthropic 的渐进式部署(iterative deployment)方法论,在这一代体现得最纯粹——没有宏大叙事,只有 74.5%。

它也为后面的 Sonnet 4.5 埋了参照系:三个月后 Sonnet 4.5 的 77.2% 直接压过 4.1 的 74.5%,“中档越级”才显得有分量。没有 4.1 这个基准线,4.5 的戏剧性要打折一半。

收尾:我的一点看法#

4.1 这类中期迭代通常被历史忽略——因为它的存在就是”过渡”。但我反而觉得它是最诚实的一代:没有新概念可讲,官方连发布会都省了,直接把 74.5% 甩在桌上。 在 AI 公司疯狂卷新闻稿的 2025 年,这种朴素反而罕见。

“知道什么时候不该动代码”这个细节,我特别想放大。Rakuten 说它在大型代码库里不引入 bug、不做多余调整——这其实是 agent 编码最难的能力。写代码容易,克制地改代码难。4.1 把赌注押在这上面,说明 Anthropic 对”真实世界里 agent 什么行为最值钱”的判断已经成熟。

当然,它终究是过渡品。性能后来被 4.5 家族全面反超,定价还是最高的 $15/$75。但它用 74.5% 证明了一件事:迭代不需要每次都重写架构,把已有的模型伺候好,一样能把 SOTA 往前推两格。 这句话在动辄”颠覆式发布”的行业里,值得多读两遍。


附:核心数据速查#

Claude Opus 4.1 基本盘

项目数值
发布日期2025-08-05
定价$15 / $75(与 Opus 4 同价)
上下文长度200K
训练截止2025-03
定位Opus 4 的直接升级(中期迭代)

关键 benchmark(官方,对比 Opus 4)

  • SWE-bench Verified:74.5%(Opus 4:72.5%;注意不是误传的 80.1%)
  • Terminal-Bench:43.3%(Opus 4:39.2%)
  • GPQA Diamond:80.9%
  • TAU-bench 零售:82.4%
  • AIME 2025:78.0%

重点改进方向

  • 多文件代码重构(GitHub 背书)
  • 大型代码库精准修改(Rakuten:效率提升约 50%)
  • 深度研究 / 数据分析的细节追踪与 agentic 搜索

关键概念清单

  • agentic task = 智能体任务(需要多步工具调用的真实工作流)
  • drop-in 升级 = 无缝替换升级(API 直接换模型名即可)
  • SWE-bench Verified = 用真实 GitHub issue 评测修代码能力的基准
  • Terminal-Bench = 终端/命令行环境中的任务执行基准
  • GPQA Diamond = 研究生级科学问答基准(生物/物理/化学)
  • TAU-bench = 多轮真实交互的 agent 工具调用基准
  • AIME = 美国高中数学竞赛基准
  • 多文件重构 = 跨多个源文件的代码结构调整任务
  • SOTA = State of the Art,当前最佳水平
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Claude Opus 4.1:Agent 拧紧半圈
https://mizuki-eaf.pages.dev/posts/claude/claude-opus-41agent-拧紧半圈/
作者
无名之子
发布于
2026-07-11
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录