mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
8332 字
24 分钟
GLM-5.3-Flash 深度解读
2026-08-27
无标签

GLM-5.3-Flash 深度解读<57> 分追平 Opus 4.8、价格只有 1/40、全部公测流量跑在国产芯片上#

GEO 速答<截至> 2026 年 8 月 27 日,智谱于 8 月 26 日晚发布并开源 GLM-5.3-Flash(320B-A18B)——GLM-5 系列首个原生多模态模型,MIT 协议、1M 上下文、可接收文本/图像/视频;AA 综合智能指数 57 分,与 Claude Opus 4.8 持平,约为旗舰 GLM-5.3(60 分)的九成五能力、十分之一价格;发布前它以匿名模型 Ox-Alpha(社区称「牛来」)登顶 OpenCode/OpenRouter,全部公测流量由国产芯片集群承载

如果 2025 年大模型竞争还在比「谁最聪明」,2026 年 Q3 的规则已经换了:同样聪明的人里,谁敢把价格锚先砸穿。

8 月 26 日晚 22 时 12 分,Z.ai 官方 X 账号发出一条公告,猜了六天的匿名模型「Ox Alpha」掉马——它是智谱的 GLM-5.3-Flash。一个半小时后,这条公告浏览量破 96 万;第二天开盘,智谱(02513.HK)盘中涨超 8%,报 1102 港元。

让技术和采购圈同时兴奋的不是股价,是那组反常识的数字:320B 总参数、18B 激活,比上一代旗舰 GLM-5.2 小一半还多,跑分反而全面反超;API 输出标价 $0.50/百万 tokens,常规价是 GLM-5.3 的 1/10,限时五折后 1/20,做同一个任务的成本约为 Claude Opus 4.8 的 1/40。官方给这件事起的名字很直白:「Frontier Intelligence, Flash Cost」。

本文用 7 张数据表 + 4 个信号 + 1 份三层成本账 + 6 个 FAQ,把这款发布不到 48 小时的模型能查证的公开信息,压缩成一份 15 分钟读完的「2026 年最便宜前沿模型说明书」。所有关键数字标注来源口径<智谱官方口径的写>「官方」,第三方平台与媒体独立披露的单独注明——这不是客套,是因为这家公司的公告里,自报数据占九成的量。


一、TL;DR — 6 句话看懂 GLM-5.3-Flash#

#问题答案
1它是什么GLM-5 系列首个原生多模态模型<总参数> 320B、每 token 激活 18B(记作 320B-A18B),MIT 协议开源,1M token 上下文,输入支持文本/图像/视频
2有多强AA 综合智能指数 v4.1.1 得 57 分,与 Claude Opus 4.8 持平;超过上代旗舰 GLM-5.2(51 分)和 DeepSeek-V4-Pro 正式版(53 分);六项编码/Agent 基准全面超越参数量约两倍的 GLM-5.2
3多便宜官方 API<输入> $0.15/输出 $0.50/缓存输入 $0.03 每百万 tokens,国内站 ¥0.8/¥2.8/¥0.23;上两周五折,即 GLM-5.3 标价的 1/20;折后单任务成本约 $0.045
4凭什么全新基座 + 首个「线性注意力 × 稀疏注意力」混合架构的开源前沿模型 + IndexPool + mHC<对比> GLM-5.3,注意力计算量降 3.01 倍、KV 缓存降 4.44 倍;服务侧跑在国产芯片集群上,端到端性能提升 3 倍
5上限在哪Flash 不是新高.3 是 60 分;自研 Z.ai Code Bench 最高档 29.0 vs Opus 4.8 的 29.5,逼近但没追平;网络安全、真实 Bug 修复等专业场景明显落后旗舰
6谁该关心跑量 Agent、夜间批处理、高保真前端复刻、Office/金融/法律文档流水线的团队——这轮的「价格斩杀线」,账单上直接可见

一句话立场.3-Flash 最重要的不是又一款开源模型,而是它把「前沿智能 = 前沿价格」这个行业默认等式,第一次用架构、语料、基础设施三层协同的方式砸开了——同样的智力,供电价格从奢侈品档位直接降到民用电价。


二、关键时间线 — 一次匿名公测,六天揭晓#

把 2026 年的智谱时间表拉出来,会发现这次发布是「先验证、后官宣」标准打法的第二次演练——上一次是 2 月的 Pony Alpha(GLM-5 匿名测试)。

日期事件关键信息
2026-01-08智谱港交所上市(02513.HK)首席科学家唐杰上市当天内部信宣布 GLM-5 即将推出
2026-02-11/12GLM-5 发布并 MIT 开源744B 总参、激活约 40B、28.5T 语料,首次集成 DeepSeek 稀疏注意力(DSA);完成华为昇腾、摩尔线程、寒武纪等七大国产芯片适配;此前以匿名模型 Pony Alpha 在 OpenRouter 试水
2026-06-13/17GLM-5.2 发布并开源同基座 744B-A40B,上下文升级到 1M,AA 指数 51 分、开源第一;Code Arena 盲测 1595 分总榜第二
2026-08-14GLM-5.3 发布与 5.2 同基座、纯后训练 Scaling,能力跃升约 50%,AA 指数 60;CyberGym 漏洞发现全场第一,在 269 个开源项目里找出 2436 个真实漏洞;首次刻意延迟开源权重(官方解释<安全能力超预期>,需评估加固)
2026-08-17DeepSeek API 提价生效V4-Pro 高峰输出涨到 ¥27/百万 tokens,低价王座松动的当月窗口
2026-08-20 起匿名模型 Ox-Alpha 上线 OpenCode/OpenRouter首日冲上 OpenRouter 榜首、刷新单日用量历史纪录;终结 DeepSeek 在 OpenCode 连续 56 天的霸榜;支持 1M 上下文与多模态输入,免费接收真实调用
2026-08-24媒体与社区「考古」《科创板日报》、新浪科技等报道技术线索指向智谱;中文社区给它起名「牛来」
2026-08-26 22<12>官宣.3-Flash 发布并开源Z.ai 公告确认 Ox-Alpha 身份;MIT 权重同步上线 HuggingFace,API、Coding Plan、ZCode、智谱清言全渠道就位,无渐进放量
2026-08-27资本市场与数据披露智谱盘中涨超 8%;OpenCode 披露该模型六天处理 42 万亿 tokens,居其用量榜第一

**这意味着:**智谱把「发布」从一个时间点拉成了一条流水线——匿名公测收反馈、压测服务系统,官宣即全渠道,开源即 MIT。这套动作本身,和模型一样值得同行研究。


三、发布背后的 4 个信号#

信号 1:「附属型号」反杀旗舰 — 计量单位从「分」变成「每块钱买到几分」#

2025 年大家还在比谁的跑分高零点几分;2026 年 Q3,风向彻底变了——同一智能水平下的单位成本,成了新的排序字段。看官方发布的六项编码与智能体(agentic)基准,Flash 对参数量约两倍的自家上代旗舰 GLM-5.2 是压倒性的:

基准(考察方向)GLM-5.3-FlashGLM-5.2Claude Opus 4.8其他参照
Terminal-Bench 2.1(终端任务)84.381.085.0GPT-5.6 Terra 87.4
DeepSWE v1.1(真实仓库修 Bug)63.446.258.0GPT-5.6 Terra 69.6;反超 Opus 5.4 分
NL2Repo(自然语言生成整仓)56.348.969.7与闭源旗舰差距最大的一项
Toolathlon Verified(工具调用)78.457.476.2全场第一
AutomationBench v1.0.6(办公自动化)48.826.241.0较 5.2 接近翻倍
Agents’ Last Exam(长程 Agent)26.320.427.0差距 0.7 分,贴身
GDPval-AA v2(真实经济产出任务)177315041582全部对比模型中最高
Z.ai Code Bench max(自研体感评测)29.023.429.5差距 0.5 分

数据来源<智谱官方博客与> 8/26 发布公告(2026-08-26),部分竞品分值整理自 jxxy.net、CSDN、知乎专栏对官方图表的转录;不同转载渠道对 GLM-5.2 个别数字存在 57.4/59.9 的口径差异,本文以官方公告图为准,并以第三方自报口径标注。

价格维度更直接。把主流玩家的 API 牌价摆进同一张表(每百万 tokens):

模型输入输出缓存命中输入相对 Flash 输出价
GLM-5.3-Flash(常规)$0.15$0.50$0.031x
GLM-5.3-Flash(限时五折)$0.075$0.25$0.0150.5x
GLM-5.3 / GLM-5.2(同价)$1.40 / ¥8$4.40 / ¥28$0.28 级 / ¥2约 8.8x
DeepSeek-V4-Pro(高峰)¥9¥27¥0.3约 9.6x
Kimi K3$3.00 / ¥20$15.00 / ¥100$0.30 / ¥230x
Gemini 3.7 Flash$7.5015x
GPT-5.6 Terra$1224x
Claude Sonnet 5$1020x
Claude Opus 4.8$5$2550x
Claude Fable 5$10$50100x

数据来源.ai 官方定价(Zixuan Li,8/26 公告十分钟后补发)、BigModel 开放平台定价页、ChainCatcher(国内站 ¥0.8/¥2.8/¥0.23)、摩根大通 8/16 研报所载 DeepSeek 新价、OSCHINA 三家横评;美元/人民币为两套牌价,汇率按 1<7>.1 折算仅供参考。

注意官方口径里最狠的一句话<所谓>「Opus 4.8 的 1/40」,比的是完成同一任务的成本,不是 token 牌价的直接比价——因为按 AA 的任务口径,Flash 折后每任务约 $0.045,此前买到同等智能大约要花 10 倍成本。知乎上有测评直接把它叫作新的大模型「斩杀线」 同分段的 DeepSeek-V4-Pro 单任务成本 $1.67,Flash 只要 $0.24

结论:「便宜模型」这个标签已经从「降级凑合」变成了「默认主力」——当 18B 激活的 Flash 把 57 分智能做到 4.5 美分/任务,所有旗舰的定价页都需要重新解释自己。

信号 2<国产算力从>「备胎」转正为「主舞台」#

这可能是整场发布中被跑分盖住的最大的新闻 Alpha 匿名公测六天,双平台刷新调用量纪录,这些请求全部由国产芯片集群提供算力,集群通过自研高带宽互联组网。ChainCatcher 援引的消息称规模超过 10 万张国产加速卡(智谱官方口径为「大国产芯片集群」,未点名芯片厂商;其早前公告提过「数万片」量级)。

难点很具体<单芯片算力与内存容量有限>,而模型要支撑 1M 上下文的长负载。智谱在 SGLang 之上自研专用推理引擎,技术栈包括<节点内张量并行>(线性注意力与 LM head)、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 KV 缓存量化、Layer Split,以及生产级 EPD(Encode–Prefill–Decode)分离架构——把多模态编码、预填充、解码拆成独立调度、独立扩缩容的工作池。结果<对比同硬件初始基线>,端到端服务性能提升 3 倍,硬件效率与单 token 成本达到与主流英伟达 GPU 相当的水平(官方自测口径)。

还有个技术味儿很浓的细节<这套推理引擎的开发>,相当部分由 GLM-5.3 驱动的 infra agent 协助完成——写算子、诊瓶颈、改部署栈,形成了官方所说的「模型优化系统,系统承载模型」的正循环。

结论:这是国产芯片第一次在「前沿模型 × 百万上下文 × 全球真实流量」三项同时成立的条件下载荷验证。它证明的不是某款芯片赢了,而是一条路线通了——后续更大的模型,底座选项从此多了一栏。

信号 3<多模态不是>「能看图」,是长出了自检的眼睛#

Flash 是 GLM-5 系列第一个从预训练阶段就原生多模态的模型(30T token 多模态语料,支持文本/图像/视频输入)。但官方真正想讲的故事是视觉进了代码循环<前端>、游戏、3D 仿真这些任务的最终产物不是代码文本,而是能被眼睛看见的界面和世界——很多问题只有渲染出来、试玩起来才暴露。

三个官方案例值得单独记:

  • Blender 自主搭建<不给任何外部素材>,GLM-5.3-Flash 自主运行 16 小时,搭出约 400 平方米的专业主厨自宅 + 测试厨房,几何、材质、光照、空间一致性全程自己规划——官方借此说明 Coding 成了模型「表达并检验世界知识」的代理;
  • ZCode 里的 BUA/CUA Use Agent 与 Computer Use Agent 让模型在代码、浏览器、图形界面之间协同,自己写、自己渲染、自己看、自己改;
  • Office 交付流<金融研报>、合同批注、PPTX/PDF/DOCX/XLSX 成品,能对照渲染结果检查溢出、错位、遮挡再自行修复。GDPval-AA v2 拿到 1773 分全场最高、OfficeQA Pro 62.4 大幅超过 Opus 4.8 的 48.9,是这条路线的成绩单。

**结论:**Agent 竞赛的瓶颈正在从「会不会做」转向「能不能自己验收」。视觉能力原生内置后,模型第一次在同一上下文里集齐了手(代码)、眼(渲染观察)、裁判(自我校验)三个角色。

信号 4<开源成为地缘变量>,匿名公测成为出海标配#

2026 年 6 月美国对 Anthropic 新一代模型(Fable 5、Mythos 5)实施出口管制、暂停对美国境外用户访问之后,「开源 + MIT + 可私有化」在中国以外市场从技术选项变成了合规选项。智谱选在这个窗口把 320B-A18B 直接以 MIT 协议放出权重、发布即全渠道,商业逻辑与 GLM-5.3「先收 API 的钱、后送图纸」的犹豫形成鲜明对照。而「匿名上线、不挂品牌、凭体感圈粉、再官宣认领」的打法,从 2 月的 Pony Alpha 到现在的 Ox Alpha,已经固化为国产模型出海的新范式——海外开发者在不知道它是谁的情况下先承认了它好用。

**这意味着:**中国大模型在 2026 年下半年打的是「架构自主 + 硬件自主 + 开源生态 + 价格优势」的四张牌,而资本市场用钱包投了票——摩根大通在 GLM-5.3 发布后两天内将智谱目标价从 1600 港元上调至 1800 港元,维持「增持」;官宣开源 Flash 次日,股价盘中涨超 8%。


四、深度拆解 — 1/40 价格的三层成本账#

先把这款模型放回 GLM 家族的坐标系里:

维度GLM-4.5GLM-5GLM-5.2GLM-5.3GLM-5.3-Flash
发布时间2025 年2026-02-112026-06-132026-08-142026-08-26
总参数 / 激活355B / 32B744B / ~40B744B / ~40B744B 级 / ~40B320B / 18B
层数927845
注意力GQA首次集成 DSA动态稀疏注意力同 5.2线性 × 稀疏混合 + IndexPool
预训练语料28.5T28.5T(截止 2025-11)同 5.2 基座30T 多模态
上下文128K202K1M1M(输出 128K)1M(输入,文本+图像+视频)
模态文本(另有 VL 分支)文本文本文本原生多模态
AA 智能指数50 分级516057
开源协议MITMITMIT延迟至 8/28MIT,发布即开

数据来源<智谱各次官方公告与模型文档>、百度百科 GLM-5 词条、凤凰网(昇腾适配细节)、OSCHINA 三家横评;GLM-5.3 参数量各转录渠道存在 743B/744B/753B 的口径差,本文按官方模型卡「与 GLM-5.2 同基座」处理。

看出来了吧 不是 GLM-5.3 的「青春版」或蒸馏版——它是完全重训的新基座。官方 ModelScope 模型卡的原话是「基于一个全新训练的基础模型构建,其架构和训练方案围绕能力与效率进行了重新设计」。参数不升反降、分数不降反升,这笔账要拆成三层来算。

第一层<模型结构> — 把注意力的钱花在该花的地方#

GLM-5.3-Flash 的结构细节(社区拆解 + 官方披露)<45> 层 decoder,288 个路由专家、每 token 激活 8 个、前 3 层 Dense;34 层线性注意力 + 11 层 DeepSeek 稀疏注意力(DSA),按约 3<1> 周期性交错

翻译成人话<处理一百万> token 的上下文,如果每一层都用全量注意力「逢人就聊」,计算量是平方级灾难。Flash 的方案是——大部分时间用线性注意力以递归方式做「局部速读」,每间隔三层左右才用一次稀疏注意力,靠轻量级索引器做一次「全场精读检索」。再往下两个补丁:

  • IndexPool<1m> 上下文下索引器本身也很贵,智谱用加权池化把索引器的 4 份缓存向量压成 1 份,专门削索引器的时延与显存;
  • mHC(流形约束超连接)<用更复杂的残差信息混接支撑起只有> 45 层的「浅层结构」,把收缩层数带来的表达力损失补回去。

效果是硬碰硬的量化数据<对比> GLM-5.3,单 token 注意力计算量降 3.01 倍、KV 缓存降 4.44 倍;与 DeepSeek-V4-Flash、Kimi-K3 同框对比,每 head 每层注意力计算量是四款中最低的(官方顺手承认 缓存均值仍略高于这两家,是下一步优化方向——这份克制值得加分)。

判断这个结构成不成立,别只看后训练模型,要看裸基座。GLM-5.3-Flash-Base(18B 激活)在 MMLU 88.1、BBH 86.6、HellaSwag 87.1、LiveCodeBench-Base 37.6 等指标上整体超过 GLM-4.5-Base,并在多数组件上追平总参数 744B 的 GLM-5-Base——每 token 只激活约 18B,基座就能对上 40B 激活的上代旗舰。也就是说,便宜不是砍能力砍出来的,是架构把「无效计算」挤出来的。

第二层<训练配方> — 30T 多模态语料 + 环境反馈 RL#

Flash 用了智谱最新的约 30T token 多模态预训练语料(对比 是 28.5T 纯文本)。后训练阶段的增量信息集中在视觉编码数据合成管线上<生成的训练轨迹要求模型>与环境交互、检视自身输出、迭代修正,前端方向还探索了基于环境反馈的强化学习与真实用户流程的 Agent 验证——把「对不对」的验证范围从功能正确性延伸到渲染效果与交互体验。这与 GLM-5.3「同基座、纯靠后训练 Scaling 提升约 50%」是同一方法论的延续<智谱明显找到了一条不依赖新一轮超大规模预训练的可持续能力提升路线>,这也是摩根大通研报把它归因为「内生驱动」的原因。

第三层<服务基础设施> — 每块钱里的芯片账#

模型再省,推理服务不省也白搭。第二层信号里那套「国产芯片 + SGLang 定制引擎 + EPD 分离 + 一堆量化技术」的组合拳,最终落在一个数字上:单 token 服务成本达到与主流英伟达 GPU 相当的水平(官方自测口径)。换句话说,$0.15/$0.50 的牌价里没有补贴成分——是「架构、语料、硬件」三层一起,把成本曲线整条搬了下来。

本地部署同学注意<320b> 总参数意味着权重体积才是门槛,BF16 约 640GB、FP8 约 320GB、4bit 量化后 160GB 级,官方支持 SGLang、vLLM、TokenSpeed、KTransformers;社区里已经出现用 4 台 M5 Ultra Mac Studio 经 Thunderbolt 5 RDMA 组出 4.8TB/s 聚合带宽集群跑 Ox Alpha 的玩法。激活只有 18B,Decode 阶段对内存带宽的需求远低于稠密模型——「个人够得着的前沿模型」这条线,又被往下压了一截。


五、别只看亮的地方<四个短板与一个悬而未决>#

按本文的一贯立场<跑分是广告>,翻车实录才是产品。把发布 48 小时内第三方实测里已经冒出来的问题摆上桌,这个模型的边界就清楚了。

**短板 1<它不是智谱的新天花板>,定位是「腰力」不是「眼力」。**AA 57 分 vs GLM-5.3 的 60 分,6 项官方编码基准里 NL2Repo 落后 Claude Opus 4.8 多达 13.4 分,自研 Z.ai Code Bench max 档 29.0 对 29.5 是「贴身」而非「追平」。知乎用户的总结很到位<在多数中低难度任务上与标准版几乎无差>,在高难度任务上能摸到标准版的极限,但稳不住——同样的最佳答案,你需要重试更多次。上限党请继续留在 GLM-5.3 或闭源旗舰档位。

**短板 2<专业深水区明显让位>。**第三方横评里,网络安全基准上 Flash 与 GLM-5.3 差距显著,只优于 GPT-5.6 Luna、落后所有其他前沿模型——这恰好是 GLM-5.3 此前「延迟开源」时重点强调的能力项,梯度切得很干净(一个合理推测<旗舰保专业纵深>,Flash 走通用大盘,别让自家左右互搏)。另在一个含 105 个真实植入 Bug 的双代码库测试里,Flash 只修复 16 个,与 DeepSeek-V4 Flash 同档,离旗舰梯队很远。

**短板 3<视觉是>「够用」不是「全能」。**原生多模态的第一代产品,感知长板短板非常分明<带工具的推理类视觉任务能打>(CharXiv w/ Tools 89.4、MMVU 80.5),纯视觉感知就露怯——BabyVision 53.4,低于 GPT-5.6 Terra 的 61.6 和 Gemini 3.7 Flash 的 70.9;某第三方图片识别测试里甚至只有 4.8% 的极端低分(同测试 Gemini 3.7 Flash 99.9%);3D 空间规划基准 MazeBench 直接 0%。要裸眼视觉能力的场景,现在不该选它。

**短板 4<一致性与工程细节>。**社区长测提到的三件事<幻觉上下限波动比标准版更大>(好时能看到上下文里极精细的文本,差时会犯低级错误、长文下更易触发下限);输出速度并没有随「Flash」之名提上来,体验降级主要卡在这;部分穷举型任务会撞上 API 128K 最大输出导致截断。此外官方评估大量使用自报口径,HLE w/ tools 的裁判模型是 GPT-5.6-luna、Z.ai Code Bench 是自研——等第三方复测跑完一周,数字大概率要回调 1-3 个点,这是每个新模型的宿命,不必苛责,但采购决策要留出这个余量。

一个悬而未决的问题<匿名公测六天> 42T+20T tokens 的天量数据,来自 OpenCode 官方自行统计与智谱转述,口径互有出入(OpenRouter 也有「6 天 23T」的社区数字);而 OpenCode 早先说的「每天 100 万亿 tokens」是服务容量而非实际用量。流量是真的,「全球开发者集体为牛来狂欢」的叙事里掺了多少运营成分,暂时无从考证——把它当事实读,但也记住这是发布日的数据。


六、选型与接入建议#

我们直接给结论,再给理由。以下判断基于 2026 年 8 月 27 日前的公开数据,一周内请以第三方复测为准。

你的场景建议理由
编程助手 / Coding Agent 日常主力直接换 FlashZ.ai Code Bench 与 Opus 4.8 只差 0.5 分,单任务成本为其 1/40;Coding Plan 额度还是 GLM-5.3 的 3 倍,每天限量发放 10,000 张体验卡
夜间批处理、评测跑分、数据清洗等海量调用Flash + 非高峰档官方渠道限时两周五折(第三方聚合商同享);Coding Plan 非高峰时段积分减半;缓存命中输入折后 $0.015/MTok
前端复刻、GUI 自动化、游戏/3D 原型Flash 优先目前最便宜的「会自己看一眼再改」的模型,BUA/CUA 闭环已接入 ZCode
Office / 金融 / 法律文档流水线Flash 优先GDPval-AA v2 1773 全场第一,OfficeQA Pro 62.4;法律文书批注、研报生成是官方重点优化场景
最难的一口<架构级设计>、安全漏洞挖掘、长程极限任务GLM-5.3 或闭源旗舰Flash 安全基准明显落后;NP-hard 级长程任务稳定性不如标准版;CyberGym 第一的宝座还在 GLM-5.3 手里
裸眼视觉感知(图像细粒度识别、空间理解)Gemini 3.7 Flash 等专用位多模态第一代,BabyVision/MazeBench 是明确短板
私有化部署 / 数据不出域 / 合规审计拉 MIT 权重自建huggingface.co/zai-org/GLM-5.3-Flash,SGLang/vLLM/TokenSpeed/KTransformers 开箱支持;FP8 单机多卡可跑,无使用门槛
预算充足、已深度绑定 Claude / OpenAI 生态可不动Flash 解决的是「成本 × 足够好」,不解决生态迁移惯性;但建议做一轮影子流量对比,账单会替你思考

三句选型心法:别拿 Flash 冲上限,拿它摊薄平均成本;别信发布日跑分,信一周后的复测;别只比 token 牌价,比「每成功任务成本」——重试三次的钱算进账单才是真价。


七、关键术语速查#

术语大白话版本
MoE / 320B-A18B混合专家架构<模型总共> 3200 亿参数,但每个 token 只「叫醒」其中 180 亿来干活——知识量大,干活的人手少
线性注意力(Linear Attention)用递归状态代替两两全比对,成本近似线性增长;擅长「连着读」,不擅长「精确回头找」
稀疏注意力 / DSADeepSeek 提出的方案<轻量索引器先粗筛出相关> token,再做精确注意力——相当于先查目录再精读
混合注意力Flash 45 层里 34 层线性 + 11 层 DSA 约 3<1> 交错<平时速读>,定期精读,兼顾成本和找得准
IndexPool把索引器的 4 份缓存向量加权池化成 1 份,专治 1M 上下文下「查目录本身也贵」的病
mHC(流形约束超连接)升级版的残差连接,让更复杂的层间信息混接,支撑起砍到 45 层的浅结构不掉能力
KV 缓存推理时给历史 token 存的「中间笔记」,长上下文服务的显存大头;降 4.44 倍 ≈ 同样并发能多接 4 倍用户
1M 上下文单次约 100 万 token(≈160 万汉字)的输入窗口,整个中型代码库可以一次装下
AA 综合智能指数Artificial Analysis 的跨基准加权指数,业界最常用的「综合智力分」;57 分处在当前全球前沿带
EPD 分离架构把多模态编码(Encode)、预填充(Prefill)、解码(Decode)拆成三组可独立扩缩容的机器池,各干各的、互不抢资源
W8A8 / INT8/FP8/BF16 混合量化权重、激活、缓存用不同位宽存算,用精度换显存和带宽——国产芯片内存受限下的必修课
BUA / CUABrowser Use Agent / Computer Use Agent<让模型自己开浏览器>、点界面、操作桌面软件的两类「手脚」
GLM Coding Plan智谱的订阅制编程套餐,积分计费,支持 Claude Code、OpenCode、Cline、ZCode 等 20+ 工具,非高峰调用积分打五折
「牛来」(Ox-Alpha)Flash 匿名公测时代的代号,中文社区谐音昵称;现已成为智谱史上最成功的一次产品预热

八、FAQ — 6 个被问得最多的问题#

Q1.3-Flash 和 GLM-5.3 到底什么关系?是蒸馏版吗? A:都不是,是两条线。GLM-5.3 沿用 GLM-5.2 的 744B 基座、纯靠后训练把能力提升约 50%;Flash 则基于全新重训的 320B-A18B 混合注意力基座、用 30T 多模态语料从头训练。前者冲上限(AA 60 分),后者压成本(AA 57 分、价格 1/10)。官方口径里 Flash 在代码与 Agent 基准上接近 Opus 4.8,而 GLM-5.3 才是那把攻顶的矛。

Q2<为什么它能便宜到> 1/10 甚至 1/40?是不是亏本赚吆喝? A<不是补贴>,是结构性降本,三层账<激活参数从> 40B 级砍到 18B、层数砍到 45 层;混合注意力 + IndexPool 把注意力计算量降 3.01 倍、KV 缓存降 4.44 倍;服务端整条流量跑在国产芯片集群上,官方称单 token 成本已与主流英伟达 GPU 相当。牌价里没有一分钱靠爱发电——真要挑,唯一的「让利」是限时两周五折的推广期。

Q3:「追平 Claude Opus 4.8」是事实还是营销?中国模型现在到底处在哪? A:分维度看:AA 综合智能指数 57 = 57,这一项是持平(第三方机构 Artificial Analysis 的统一评测,非智谱自报);编码与 Agent 基准上互有胜负——Toolathlon、DeepSWE、AutomationBench、GDPval-AA 反超;NL2Repo、Terminal-Bench 2.1、极限长程任务落后;但在纯视觉、网络安全、高难任务的稳定性上,距离还很明确。整体判断<中国前沿模型已经能>「在旗舰最赚钱的赛道(编程 × Agent × 办公)上用 1/40 的价格逼平对手」,这句话的每个成分都有数据支撑;「全面追平」则还没有,谁再说,让他把复测表拿出来。

Q4<普通人> / 小团队怎么用上它? A:四个入口按成本从零到高排序<①> 智谱清言 App / chat.z.ai 免费对话;② BigModel 开放平台或 docs.z.ai 调 API(新用户送千万级 token 资源包,折后输入 $0.075);③ 订阅 GLM Coding Plan(¥118/月 起,Flash 额度为 GLM-5.3 的 3 倍,每天限量 1 万张体验卡);④ HuggingFace / ModelScope 拉 MIT 权重自建,硬件不够的可以用 TokenSpeed/KTransformers 这类混合推理方案。当前版本注意<思考模式不可关闭>(thinking.type 仅支持 enabled),想省钱请调 reasoning_effort。

Q5<这对> DeepSeek、对 Kimi、对其他玩家意味着什么? A:最直接的压力测试已经发生 8 月 17 日刚完成一轮提价(被摩根大通解读为「定价灵活性充足、成本基准地位未变」),转头 Flash 就把 57 分智能的价格打到对方旗舰的 1/7-1/10——知乎所谓「梁圣的 DeepSeek V4 也被斩杀了」是对这张牌价表的情绪化翻译。**但别线性外推 在缓存命中 ¥0.05-0.3 的低价带和峰谷定价弹性上仍有自己的纵深,Kimi K3 在长周期工程上仍有 67.5 的 DeepSWE 优势。**唯一确定的是<所有玩家的定价页都被重新锚定>,「同等智能带」的价格下限从此由 4.5 美分/任务说了算。

Q6<智谱为什么敢把最强性价比的模型直接> MIT 开源,连权重都不捂? A<三个理由>。其一,Flash 的差异化在「便宜 × 办公级多模态 × 可私有化」,开源本身就是获客渠道——GLM-5.3 延迟开源是因为安全能力涉密,Flash 的账算的不是同一道题;其二,MIT + 国产算力认证的组合,是对冲美国出口管制(6 月起 Anthropic 新模型暂停境外访问)下海外市场不确定性的最优解;其三,智谱正在讲资本故事——GLM-5.2、5.3、Flash 三连发后,摩根大通把目标价抬到 1800 港元,开源生态与商业化数据是 2026 IPO 后估值的核心弹药。图纸免费,生态收费,这门生意一直是这么做的。


九、参考资料#

官方发布与基准

  • 智谱官方博客.3-Flash — Frontier Intelligence, Flash Cost(z.ai/blog/glm-5.3-flash)
  • BigModel 开放平台模型文档.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
  • Z.ai 文档.z.ai/guides/vlm/glm-5.3-flash
  • 开源权重.co/zai-org/GLM-5.3-Flash;ModelScope/GLM-5.3-Flash
  • GLM Coding Plan.cn/glm-coding;ZCode.z.ai
  • 技术报告:GLM-5: from Vibe Coding to Agentic Engineering(arXiv<2602>.15763)
  • Artificial Analysis 智能指数(v4.1.1)榜单

第三方评测与媒体

  • IT之家:《Ox Alpha 现身<智谱开源> GLM-5.3-Flash 原生多模态模型》(8/26)
  • 新浪财经/网易智能:《Ox Alpha 揭晓<智谱开源> GLM-5.3-Flash,跑在国产芯片上》(8/27)
  • 新京报贝壳财经:《智谱开源 GLM-5.3-Flash「牛来」,背后是国产芯片》(8/27)
  • 腾讯新闻/每日经济新闻<智谱认领>「牛来」报道(8/26)
  • 知乎:《怎么看 GLM-5.3-Flash 发布,有什么值得关注的?》多位答主长测(逻辑能力横评、KernelBench-Mega、Bug 修复实测)
  • OSCHINA:《三大旗舰模型同月亮相 K3、GLM-5.3、DeepSeek V4 选型图》(8/20)
  • ChainCatcher<智谱> GLM-5.3 Flash 国内定价与 10 万卡国产芯片报道(8/27)
  • 摩根大通研报(8/16).3 能力跃升与 DeepSeek 提价对中国 AI 竞争格局的影响,via 雪球/华尔街见闻
  • OpenCode 官方公告 Alpha 六天 42T tokens 用量披露(8/26)

相关阅读

  • 本系列前作<2026> 年中大模型地图、GLM-5.3 发布解读、DeepSeek V4 提价分析
  • 开源大模型部署系列:《GLM-5.3<干旗舰的活>,定次旗舰的价》(CSDN,8/26)

本文数据截至 2026 年 8 月 27 日,距该模型公开发布不足 48 小时——所有自报口径的成绩,请等待第三方复测后再写进你的架构决策文档。但有一件事不需要等<价格锚已经被钉死了>,接下来三个月,每个玩家的定价页都要回答同一个问题——「凭什么比 4.5 美分一个任务贵」。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

GLM-5.3-Flash 深度解读
https://mizuki-eaf.pages.dev/posts/glm/glm-53-flash深度解读/
作者
无名之子
发布于
2026-08-27
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录