Claude Opus 4.6 解读:1M 上下文不是参数,是检索能力
名称:Claude Opus 4.6 厂商:Anthropic 发布时间:2026-02-05(1M 上下文 beta)→ 2026-03-13 转 GA 关键信息:首个 Opus 级 1M token 上下文窗口,最大输出 128K,定价 $5/$25(超 200K 提示按 $10/$37.5 计费);新增 adaptive thinking 与四档 effort;MRCR v2@1M 76%,SWE-bench Verified 80.8%,GPQA Diamond 91.3%;ASL-3 安全等级。
Opus 4.6 承接了 4.5 的”编码登顶”,但它真正拉开分水岭的地方在别处——1M token 上下文。长上下文行业里喊了很多年,大多是”参数很好看,用起来不顶用”。4.6 用 MRCR v2 这个评测证明:这 1M 是真的。
一、引言:长上下文为什么容易变成摆设
模型上下文从 200K 扩到 1M,中间隔的不是五倍的参数,是一道检索能力的坎。把一百万 token 塞进窗口只是第一步,模型能不能在大量无关信息里把需要的片段捞出来、记住、并正确引用,才是真正的难题。
行业里管这个叫 context rot(上下文腐烂):对话越长,模型越容易”忘事”——早期信息被后来内容稀释,检索时抓错、编造、答非所问。于是很多模型的长上下文窗口是”纸面容量”,实际可用深度大打折扣。所以判断 1M 上下文是能力还是摆设,得看一个指标:针在干草堆里,能不能找出来。
MRCR v2 就是干这个的——把多个事实埋进百万 token 的上下文里,考多针检索准确率。Opus 4.6 的 76%,对照 Sonnet 4.5 的 18.5%、Gemini 3.1 Pro 的 26.3%,差距不是百分比的差别,是”能不能用”的差别。
二、能力拆解:adaptive thinking 与四档 effort
1M 上下文之外,4.6 最值得拆的是推理控制机制,它直接回应了上一代的一个痛点:什么时候该想、想多久。
adaptive thinking(自适应思考)。 之前 extended thinking 是个开关,要么开要么关。4.6 让模型自己读上下文线索,判断任务难度决定思考预算:简单问题秒回,疑难杂症慢慢想。效果是”聪明的懒”——它自己决定在正确的地方花正确的力气。
四档 effort(low / medium / high / max)。 自适应之外,给开发者手动干预的空间:低档最省最快,high 是默认,max 档投入最大推理预算换最高质量。这是成本-质量天平上的四个刻度,配合 /effort 参数随时拨。第三方流传的”Opus 4.6-Max”就源于此——max 只是档位,不是独立模型。
配套还有 context compaction(上下文压缩):agent 快撞上窗口上限时,自动把旧上下文总结替换,长任务可以一直跑下去,不用手动”续命”。这在 Agent 场景里比 1M 本身还实用——之前长任务最大的墙就是上下文耗尽。
三、关键数据
编码与推理成绩(官方口径):
- SWE-bench Verified 80.8%(优化提示词后 81.42%);
- GPQA Diamond 91.3%(研究生级科学推理);
- Terminal-Bench 2.0 65.4%——agentic 编码评测当时最高分;
- OSWorld 72.7%(计算机使用);
- MMMU-Pro 73.9%(多模态理解);
- 另有 ARC-AGI-2 68.8%(上一代 37.6%)、GDPval-AA 领先 GPT-5.2 约 144 Elo、Humanity’s Last Exam 与 BrowseComp 行业第一。
定价维持 $5/$25 每百万 token,超过 200K 提示的扩展上下文档按 $10/$37.5 计费;最大输出 128K。安全等级 ASL-3,官方 system card 称整体安全画像不输任何同代前沿模型。
四、意义与影响:长上下文从”参数竞赛”变成”可用能力”
1M 上下文落到 Opus 级,实际改变的是 Agent 的作业半径。之前一个 agent 处理大型代码库要自己切块、搬运上下文,现在整个仓库能一次装下;处理整本法律卷宗、一整套财报、上千文件的历史——“先完整读进来,再干活”成为可能。MRCR 76% 说明这不只是”装得下”,而是”找得准”。
这对产品形态的影响是连锁的:Claude Code 里 agent teams 的分工、Cowork 里的多任务自动化,都建立在长上下文不烂的前提下。换句话说,Opus 4.6 之后,Anthropic 的 agent 产品才有条件讨论”规模”,而不是”生存”。
收尾:我的一点看法
Opus 4.6 最打动我的不是 1M 这个数字,而是 Anthropic 肯用 MRCR v2 这种”打脸式”评测来公布成绩。长上下文是各家的宣传重灾区,能晒出 76% 对 18.5% 的对比,说明他们真把检索能力当工程做完了。这比发布会上的上下文演示诚实得多。
adaptive thinking 我反而觉得是被低估的更新。effort 四档 + 自适应,等于把”想多深”这个原本交给运气的变量变成了可调参数。模型的性价比之争,下一步很可能就卷到这里——同一个模型,不同档位跑出不同的质量-成本曲线,这在 API 经济学里是个大杀器。
最后说句公道话:SWE-bench Verified 在 4.6 上其实比 4.5(80.9%)略退,官方后来靠提示词优化找回来。这说明 1M 上下文是有代价的——长窗口会占用更多注意力资源。强如 4.6,也在长上下文和编码巅峰之间做了取舍。真正两全其美,要等下一代。
附:核心数据速查
Opus 4.6 基本盘
| 项目 | 数值 |
|---|---|
| 厂商 | Anthropic |
| 发布 | 2026-02-05(1M beta);2026-03-13 转 GA |
| 上下文 / 最大输出 | 1M token / 128K |
| 定价 | $5/$25;超 200K 提示 $10/$37.5 |
| 安全等级 | ASL-3 |
| 推理控制 | adaptive thinking + 四档 effort(low/medium/high/max) |
关键 benchmark(官方口径)
| 基准 | 得分 |
|---|---|
| MRCR v2@1M | 76%(Sonnet 4.5 18.5% / Gemini 3.1 Pro 26.3%) |
| SWE-bench Verified | 80.8%(优化提示词 81.42%) |
| GPQA Diamond | 91.3% |
| Terminal-Bench 2.0 | 65.4% |
| OSWorld | 72.7% |
| MMMU-Pro | 73.9% |
| ARC-AGI-2 | 68.8% |
关键概念清单
- MRCR v2 = 多针检索评测(Multi-Needle Retrieval,验证长上下文真实可用性)
- context rot = 上下文腐烂(长对话中信息丢失/检索失败)
- adaptive thinking = 自适应思考(模型按任务难度自动调节推理预算)
- effort = 努力档位(low/medium/high/max 四档,控制速度/成本/质量)
- context compaction = 上下文压缩(自动总结旧上下文,让长任务不撞墙)
- ASL-3 = AI Safety Level 3,Anthropic 三级安全等级
- Terminal-Bench = 终端操作评测(agent 在真实终端完成任务的能力)
- MMMU-Pro = 多模态理解进阶评测
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





