mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
2015 字
6 分钟
Claude Opus 4.7·4.8:多 Agent 并行
2026-07-25

Claude Opus 4.7 / 4.8 解读:从单 Agent 干活,到几百个 Agent 并行开工#

名称:Claude Opus 4.7 / Opus 4.8 厂商:Anthropic 发布时间:Opus 4.7 = 2026-04-16;Opus 4.8 = 2026-05-28 关键信息(据第三方报道与官方系统卡索引,可靠性中):4.7 把 SWE-bench Verified 推到 87.6%、GPQA Diamond 94.2%;6 周后的 4.8 引入动态工作流(Dynamic Workflows)——一个会话内编排数百个并行子 agent,快速模式提速 2.5 倍、价格还砍到旧快速模式的三分之一。

这两代在 Claude 发展史上位置特殊:官方没有像 4.6 那样给出完整体系卡,数据主要依赖第三方聚合报道,所以下面的数字都当”方向对、细节存疑”来看。但有一个判断可以坐实:Anthropic 的重心,正从”更强的单个模型”挪向”怎么让一堆 agent 协作干活”。


一、引言:Opus 4.7 的”平庸”和 Opus 4.8 的野心#

Opus 4.7 发布于 2026-04-16,距 4.6 只隔了两个月,据第三方报道 SWE-bench Verified 87.6%、GPQA Diamond 94.2%——比 4.6 各涨了几个点,但市场反应平淡。一个模型如果只是”上一代 + 3%“,在 2026 年的竞争烈度下等于没发。

真正的戏在 4.8。2026-05-28,距 4.7 仅 41 天,Anthropic 发布 Opus 4.8(同日官宣 H 轮 650 亿美元、估值 9650 亿美元)。它的 benchmark 提升依然温和(SWE-bench Verified 88.6%),但带着一个此前从未出现过的东西:动态工作流。这玩意儿不是”更强的模型”,是”模型如何组织劳动”的答案。

二、能力拆解:动态工作流——把计划写进代码,而不是塞进上下文#

传统 agent 干活是一条线:想一步、做一步、再看一步。到一定规模就卡死——因为整个计划都存在模型的上下文窗口里,token 有限,任务一旦放大,规划先崩溃。

动态工作流的解法很聪明:让 Claude 写一段 JavaScript 编排脚本,把”怎么拆任务、怎么并行、怎么汇总”全部外置到脚本里,由一个 runtime 在后台执行。计划活在代码里,不占上下文;几百个子 agent 各自领一个切片并行开工,做完回报,Claude 负责校验汇总。上限是单会话 1000 个子 agent、16 个并发

官方给的一个例子是跨几十万行代码的库级迁移——从开工到合并,用现有测试套件当质量闸门。这种活一个线性 agent 循环能磨死人,动态工作流把它拆成几百个独立切片同时跑。

配套还有一个务实的更新:快速模式(fast mode)。同样的模型,以 2.5 倍速度输出,价格反而是旧快速模式的三分之一($10/$50 每百万 token)。对延迟敏感的场景,这是一次实打实的服务降本。

另外,4.8 被第三方提及最多的一句话是”更诚实”——它开始会说”我不确定”,而不是硬编一个合理答案。这个特性在长跑 agent 里价值巨大:20 到 50 轮的循环里,一个假装确定的幻觉能毁掉整条流水线。

三、关键数据(据第三方报道,可靠性中)#

Opus 4.7(2026-04-16):

  • SWE-bench Verified 87.6%;GPQA Diamond 94.2%

Opus 4.8(2026-05-28):

  • SWE-bench Verified 88.6%、SWE-bench Pro 69.2%(第三方口径领先 GPT-5.5 约 10.6 分);
  • 动态工作流:单会话最多 1000 子 agent、16 并发;
  • 快速模式:2.5 倍速度、价格约为旧快速模式 1/3($10/$50);
  • 定价维持 $5/$25,上下文维持 1M。

同一张对比表里,GPT-5.5 的 SWE-bench Verified 88.7% 略压 4.8 一头,但 SWE-bench Pro 被甩开 10.6 分——“简单的都卷到头了,难的才是战场”。

四、意义与影响:多 Agent 协作,Anthropic 押注的方向#

把 4.7 和 4.8 放一起看,能读出 Anthropic 的产品路线:模型本身的进步在放缓(每次 1–3 个点),但”组织方式”在发生质变。4.6 给的是 agent teams,4.8 给的是几百个子 agent 的编排 runtime——从”一队人”到”一个施工队 + 总包方”。

这个方向其实是在回答一个问题:单模型的天花板肉眼可见,未来一年的智能提升,到底靠更强的权重,还是靠更聪明的调度?Anthropic 在 4.8 上明显押了后者——把编排逻辑外置成可执行的代码,让模型的能力上限从”单次思考的长度”变成”能拆解和并行任务的数量”。值得对照的是,这跟 OpenAI 的”更大模型”路线形成了分歧。多 agent 协作如果成立,它会像 MCP 一样,从产品功能变成行业范式。

收尾:我的一点看法#

先说数据的坑:Opus 4.7 / 4.8 的官方信息很少,上面的分数主要来自 Hokai 这类第三方聚合和系统卡索引,可靠性只能算中等。写这篇时我把它当”方向和量级”看,如果你要拿这些数字去做严谨对比,建议回到官方博客核实一遍。

不过即便数字有水分,“动态工作流”这个方向我也认为站得住。它把 agent 的瓶颈从”模型的脑容量”转移到了”工程的组织能力”上——计划外置到脚本、任务并行化、结果校验,这一整套其实是在复刻人类工程师带团队的方式。人类早就知道:大项目不靠单个人聪明,靠分工。AI 现在才学到这一课。

还有一点值得玩味:4.8 的”诚实”被反复提到。模型会承认不确定,这在商业上几乎是反直觉的——用户要的是”能搞定”,不是”可能搞不定”。但它是对的:在 agent 长跑场景里,错误的自信比坦诚的迟疑贵得多。把”不确定”说出来,等于给整条自动化流水线装了个安全阀。这可能是 4.8 比任何 benchmark 都值钱的更新。


附:核心数据速查#

Opus 4.7 / 4.8 基本盘

项目Opus 4.7Opus 4.8
发布日期2026-04-162026-05-28
SWE-bench Verified87.6%88.6%
SWE-bench Pro64.3%69.2%
GPQA Diamond94.2%~93.6%(基本持平)
定价$5/$25$5/$25(快速模式 $10/$50)
上下文1M1M

Opus 4.8 核心特性

特性说明
动态工作流编排脚本外置到 JS,单会话最多 1000 子 agent / 16 并发
快速模式2.5 倍速度,价格为旧快速模式约 1/3
诚实性开始输出”我不确定”,减少长循环中的幻觉
系统卡244 页 system card

关键概念清单

  • dynamic workflows = 动态工作流(计划写成编排脚本、数百子 agent 并行执行)
  • subagent = 子智能体(任务切片后的执行单元)
  • orchestration script = 编排脚本(描述任务如何拆分与并行的代码)
  • fast mode = 快速模式(提速 2.5 倍的付费档)
  • SWE-bench Pro = 比 Verified 更难的 agentic 编程评测
  • 可靠性说明:本页数据主要来自第三方聚合报道(Hokai 等)与官方系统卡索引,可靠性中
分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Claude Opus 4.7·4.8:多 Agent 并行
https://mizuki-eaf.pages.dev/posts/claude/claude-opus-4748多-agent-并行/
作者
无名之子
发布于
2026-07-25
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录