mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
1736 字
5 分钟
旗舰模型七强争霸
2026-07-21

王座不再唯一:2026盛夏,旗舰大模型从”一超”杀进”七强”#

七月最后十天,AI圈连着炸了三件事。7月24日,Anthropic发布Claude Opus 5,用一半的价格给到接近旗舰的能力;7月27日晚,月之暗面把2.8万亿参数的Kimi K3权重彻底开源;而DeepSeek V4正式版,传闻就定档在8月3日。再加上谷歌7月21日一口气甩出三款Flash模型、阿里Qwen3.8-Max预览版喊出”仅次于Fable 5”——这个盛夏,比三伏天还热。

更有意思的是榜单。在一份7月20日更新的综合排行里,前五名是这样的:Claude Fable 5(100分)、Claude Opus 4.8(99分)、GPT-5.5 Pro(98分)、GPT-5.6(98分),第五名Kimi K3——一个开源模型——也是98分。第一名和第五名之间,只差了2分。两年前,这个差距是一道怎么也跨不过去的鸿沟。

发生了什么#

一句话:旗舰大模型从”一超”变成了”多强”。闭源三家——Anthropic的Claude、OpenAI的GPT、谷歌的Gemini;开源四家——DeepSeek、Kimi、Qwen、GLM。七家坐上了同一张牌桌,而且手里的牌清一色是”旗舰级”。

列几个硬数据。Claude Opus 5在7月24日发布,API定价每百万输入token 5美元、输出25美元,性能比上一代Opus 4.8大幅提升、价格却一分没涨,等于同样的钱买到半价旗舰。谷歌7月21日发的三款里,Gemini 3.6 Flash成了新主力,Flash-Lite主打极致低价(输入价只要0.3美元),还有一款Cyber专门盯安全漏洞。开源这边更凶:智谱GLM 5.2在7月8日发布,SWE-Bench Pro拿了68.5%,是第一个在最难的智能体编程基准上超过GPT-5和Claude的开源模型;Kimi K3用2.8万亿参数登顶Arena前端编程榜;Qwen3.8-Max则以2.4万亿参数直接叫板闭源天花板。

为什么是现在#

为什么大家不约而同在七月集体出手?三个原因。

第一,“差异化”的红利吃完了。前两年各家还能各占一块山头——你数学强、我代码强、他多模态强。现在所有基准都被刷了个遍,比的是综合能力,谁都没法再靠偏科讨巧,只能硬碰硬。

第二,闭源的压力是真的来了。开源分数一追平,闭源手里就只剩”降价”这一张牌。这就是为什么Opus 5敢把价格砍半、谷歌敢把Flash-Lite压到0.3美元——不是突然良心发现,是Kimi和DeepSeek追到了身后。DeepSeek V4的定价,不到同级GPT的3.5%。

第三,算力和资本需要交代。万亿参数模型的训练成本高到离谱,谁也不敢停,停下半年就可能被踢下牌桌。于是就有了这副”你方唱罢我登场”的场面:8号你发、17号我上、21号你开源、27号我也开源。

横向看对比#

我的判断:天花板还在闭源手里,但差距已经压缩到”一个版本”以内。

在swfte的综合榜单上,Claude Fable 5仍以100分领跑,可98分的Kimi K3已经坐稳第五。这个差距意味着:日常95%的任务,你已经分不出高低。更可怕的是速度——GLM 5.2从发布到在编程基准上超过GPT-5,只用了不到一个月。

和上一代比,这一轮的主题不是”更强”,而是”更便宜”。Opus 5性能比Opus 4.8强了两倍多,价格不变;Gemini 3.6 Flash在保持价格的同时把输出token砍了17%。翻译成人话:同样的钱,买到的智能翻倍了。DeepSeek、Qwen这些开源阵营的性价比就更夸张。

还有个细节值得玩味:闭源开始学开源的打法——Anthropic同时铺进亚马逊Bedrock、谷歌云和微软Foundry;开源阵营则开始大谈”稳定性”和”生态”。两边正在互相抄对方的后路。

谁该关心#

对开发者:这是最好的时代。过去只能”给什么吃什么”,现在可以”点菜”。写代码,GLM 5.2和Kimi K3已经能上生产;控成本,DeepSeek V4和Gemini Flash-Lite能把账单砍掉一个数量级。一条忠告:别把宝压在一家身上,架构里留好抽象层。

对普通用户:红利是间接但实在的。模型价格战会一路传导到你用的AI应用的订阅费和免费额度。你不用懂参数,只要记住——竞争越凶,羊毛越多。

对企业:关键词是”选型”。数据敏感的行业终于有了”开源+私有化”的选项,Kimi K3、GLM 5.2都支持。但也别急着把闭源全换掉,法律、医疗这类高风险场景,闭源旗舰目前还是更稳。

谁不适合凑热闹?如果你的需求只是”聊天解闷”,那随便哪个都够用,不必在选型上浪费精力。

一句话总结#

2026年的盛夏,很可能是大模型从”崇拜王座”走向”群雄割据”的分水岭:天花板依然很高,但地板已经被铺平了。对用户来说,下半年最重要的事不是追最新的模型,而是想清楚自己的场景,挑那个最合适、最能稳定落地的。至于王座?照这个速度,年底前它还得再换一次主人。

参考资料#

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

旗舰模型七强争霸
https://mizuki-eaf.pages.dev/posts/others/旗舰模型七强争霸/
作者
无名之子
发布于
2026-07-21
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录