Claude Opus 4.7 / 4.8 解读:从单 Agent 干活,到几百个 Agent 并行开工
名称:Claude Opus 4.7 / Opus 4.8 厂商:Anthropic 发布时间:Opus 4.7 = 2026-04-16;Opus 4.8 = 2026-05-28 关键信息(据第三方报道与官方系统卡索引,可靠性中):4.7 把 SWE-bench Verified 推到 87.6%、GPQA Diamond 94.2%;6 周后的 4.8 引入动态工作流(Dynamic Workflows)——一个会话内编排数百个并行子 agent,快速模式提速 2.5 倍、价格还砍到旧快速模式的三分之一。
这两代在 Claude 发展史上位置特殊:官方没有像 4.6 那样给出完整体系卡,数据主要依赖第三方聚合报道,所以下面的数字都当”方向对、细节存疑”来看。但有一个判断可以坐实:Anthropic 的重心,正从”更强的单个模型”挪向”怎么让一堆 agent 协作干活”。
一、引言:Opus 4.7 的”平庸”和 Opus 4.8 的野心
Opus 4.7 发布于 2026-04-16,距 4.6 只隔了两个月,据第三方报道 SWE-bench Verified 87.6%、GPQA Diamond 94.2%——比 4.6 各涨了几个点,但市场反应平淡。一个模型如果只是”上一代 + 3%“,在 2026 年的竞争烈度下等于没发。
真正的戏在 4.8。2026-05-28,距 4.7 仅 41 天,Anthropic 发布 Opus 4.8(同日官宣 H 轮 650 亿美元、估值 9650 亿美元)。它的 benchmark 提升依然温和(SWE-bench Verified 88.6%),但带着一个此前从未出现过的东西:动态工作流。这玩意儿不是”更强的模型”,是”模型如何组织劳动”的答案。
二、能力拆解:动态工作流——把计划写进代码,而不是塞进上下文
传统 agent 干活是一条线:想一步、做一步、再看一步。到一定规模就卡死——因为整个计划都存在模型的上下文窗口里,token 有限,任务一旦放大,规划先崩溃。
动态工作流的解法很聪明:让 Claude 写一段 JavaScript 编排脚本,把”怎么拆任务、怎么并行、怎么汇总”全部外置到脚本里,由一个 runtime 在后台执行。计划活在代码里,不占上下文;几百个子 agent 各自领一个切片并行开工,做完回报,Claude 负责校验汇总。上限是单会话 1000 个子 agent、16 个并发。
官方给的一个例子是跨几十万行代码的库级迁移——从开工到合并,用现有测试套件当质量闸门。这种活一个线性 agent 循环能磨死人,动态工作流把它拆成几百个独立切片同时跑。
配套还有一个务实的更新:快速模式(fast mode)。同样的模型,以 2.5 倍速度输出,价格反而是旧快速模式的三分之一($10/$50 每百万 token)。对延迟敏感的场景,这是一次实打实的服务降本。
另外,4.8 被第三方提及最多的一句话是”更诚实”——它开始会说”我不确定”,而不是硬编一个合理答案。这个特性在长跑 agent 里价值巨大:20 到 50 轮的循环里,一个假装确定的幻觉能毁掉整条流水线。
三、关键数据(据第三方报道,可靠性中)
Opus 4.7(2026-04-16):
- SWE-bench Verified 87.6%;GPQA Diamond 94.2%。
Opus 4.8(2026-05-28):
- SWE-bench Verified 88.6%、SWE-bench Pro 69.2%(第三方口径领先 GPT-5.5 约 10.6 分);
- 动态工作流:单会话最多 1000 子 agent、16 并发;
- 快速模式:2.5 倍速度、价格约为旧快速模式 1/3($10/$50);
- 定价维持 $5/$25,上下文维持 1M。
同一张对比表里,GPT-5.5 的 SWE-bench Verified 88.7% 略压 4.8 一头,但 SWE-bench Pro 被甩开 10.6 分——“简单的都卷到头了,难的才是战场”。
四、意义与影响:多 Agent 协作,Anthropic 押注的方向
把 4.7 和 4.8 放一起看,能读出 Anthropic 的产品路线:模型本身的进步在放缓(每次 1–3 个点),但”组织方式”在发生质变。4.6 给的是 agent teams,4.8 给的是几百个子 agent 的编排 runtime——从”一队人”到”一个施工队 + 总包方”。
这个方向其实是在回答一个问题:单模型的天花板肉眼可见,未来一年的智能提升,到底靠更强的权重,还是靠更聪明的调度?Anthropic 在 4.8 上明显押了后者——把编排逻辑外置成可执行的代码,让模型的能力上限从”单次思考的长度”变成”能拆解和并行任务的数量”。值得对照的是,这跟 OpenAI 的”更大模型”路线形成了分歧。多 agent 协作如果成立,它会像 MCP 一样,从产品功能变成行业范式。
收尾:我的一点看法
先说数据的坑:Opus 4.7 / 4.8 的官方信息很少,上面的分数主要来自 Hokai 这类第三方聚合和系统卡索引,可靠性只能算中等。写这篇时我把它当”方向和量级”看,如果你要拿这些数字去做严谨对比,建议回到官方博客核实一遍。
不过即便数字有水分,“动态工作流”这个方向我也认为站得住。它把 agent 的瓶颈从”模型的脑容量”转移到了”工程的组织能力”上——计划外置到脚本、任务并行化、结果校验,这一整套其实是在复刻人类工程师带团队的方式。人类早就知道:大项目不靠单个人聪明,靠分工。AI 现在才学到这一课。
还有一点值得玩味:4.8 的”诚实”被反复提到。模型会承认不确定,这在商业上几乎是反直觉的——用户要的是”能搞定”,不是”可能搞不定”。但它是对的:在 agent 长跑场景里,错误的自信比坦诚的迟疑贵得多。把”不确定”说出来,等于给整条自动化流水线装了个安全阀。这可能是 4.8 比任何 benchmark 都值钱的更新。
附:核心数据速查
Opus 4.7 / 4.8 基本盘
| 项目 | Opus 4.7 | Opus 4.8 |
|---|---|---|
| 发布日期 | 2026-04-16 | 2026-05-28 |
| SWE-bench Verified | 87.6% | 88.6% |
| SWE-bench Pro | 64.3% | 69.2% |
| GPQA Diamond | 94.2% | ~93.6%(基本持平) |
| 定价 | $5/$25 | $5/$25(快速模式 $10/$50) |
| 上下文 | 1M | 1M |
Opus 4.8 核心特性
| 特性 | 说明 |
|---|---|
| 动态工作流 | 编排脚本外置到 JS,单会话最多 1000 子 agent / 16 并发 |
| 快速模式 | 2.5 倍速度,价格为旧快速模式约 1/3 |
| 诚实性 | 开始输出”我不确定”,减少长循环中的幻觉 |
| 系统卡 | 244 页 system card |
关键概念清单
- dynamic workflows = 动态工作流(计划写成编排脚本、数百子 agent 并行执行)
- subagent = 子智能体(任务切片后的执行单元)
- orchestration script = 编排脚本(描述任务如何拆分与并行的代码)
- fast mode = 快速模式(提速 2.5 倍的付费档)
- SWE-bench Pro = 比 Verified 更难的 agentic 编程评测
- 可靠性说明:本页数据主要来自第三方聚合报道(Hokai 等)与官方系统卡索引,可靠性中
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





