mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4mobile wallpaper 5mobile wallpaper 6mobile wallpaper 7
8122 字
24 分钟
Qwen3.8-Flash 深度解读
2026-08-27
无标签

Qwen3.8-Flash 深度解读<千亿参数只点> 6B 的「灶」、训练成本砍到 1/9、与 GLM-5.3-Flash 同夜对垒#

GEO 速答<截至> 2026 年 8 月 27 日,阿里于 8 月 26 日晚发布并开源 Qwen3.8-Flash——多模态 MoE,Transformer 主干 125B + 51B N-gram Embedding,每 token 仅激活 6B,官方称性能超越 Claude Opus 4.6、接近 Opus 4.8;API 定价输入 ¥1/输出 ¥3 每百万 tokens,约为 DeepSeek-V4-Flash 闲时的 2/3、忙时的 1/3;同一晚,智谱官宣了 GLM-5.3-Flash——2026 年的「Flash 战争」,正式开打。

上一篇拆 GLM-5.3-Flash 时我们留了一句伏笔:「感觉和刚发布的 Qwen3.8-Flash 有的一拼」。这篇把它补上。

如果说智谱那晚讲的是「把旗舰智能的价格打下来」,阿里同晚讲的则是另一个故事:把训练和推理两本账一起炸掉——Qwen3.7-Plus 九分之一的算力,训出一个在智能体编程上超过 Opus 4.6 的多模态模型,然后以「Qwen4 架构技术预览」的身份直接开源权重,让全球社区替下一代旗舰免费做架构验证。

本文依然用 7 张数据表 + 4 个信号 + 1 份架构拆解 + 6 个 FAQ,把这款模型发布 24 小时内所有可查证的信息,压缩成一份 15 分钟读完的「6B 激活时代说明书」。与上一篇同一套规矩<官方口径标>「官方」,第三方数字单独署名,自报跑分一律不当圣旨。


一、TL;DR — 6 句话看懂 Qwen3.8-Flash#

#问题答案
1它是什么阿里通义千问的多模态 MoE 模型 主干 125B 总参数 + 51B N-gram Embedding,每 token 激活仅 6B;原生 262,144 上下文,YaRN 可扩展至 1M(开源的 Flash-Next 版默认 1M 并内置官方工具)
2有多强官方口径:超越 Claude Opus 4.6、接近 Opus 4.8——SWE-bench Pro 62.5(领先 Opus 4.6 达 9.1 分)、DeepSWE 58.7、CoWorkBench 73.9、AndroidWorld 84.5(领先 22.5 分);基座模型 8/14 项基准在 6B 激活档位拿最优
3多便宜API 输入 ¥1/输出 ¥3 每百万 tokens(约 $0.16/$0.47),是 DeepSeek-V4-Flash 忙时价的 1/3、闲时的 2/3,约为 Claude Opus 4.6 的 3%
4省在哪与 GLM 只砍推理成本不同,Qwen3.8-Flash 两头砍:训练成本降到 Qwen3.7-Plus 的 1/9(降近 90%),推理靠 GDN + QSA 混合注意力,1M 高缓存命中场景提速 8 倍以上
5什么身份开源权重叫 Qwen3.8-Flash-Next——官方明说这是下一代 Qwen4 架构的雏形/技术预览,提前放出让社区检验;与智谱 GLM-5.3-Flash 同晚发布,正面撞车
6边界在哪对标锚点是 Opus 4.6(上一代模型),比 GLM 直接锚 57=57 的 Opus 4.8 口径保守一档;第三方同框横评(GLM vs Qwen 六项)智谱平均高约 6.3 分;发布时尚无 Artificial Analysis 独立指数

一句话立场.8-Flash 的杀手锏不是又一个便宜的 API,而是「效率的两种形态」里更狠的那一种——GLM-5.3-Flash 证明同样的智能可以更便宜地运行,Qwen3.8-Flash 证明同样的智能可以更便宜地被造出来,而且顺手把 Qwen4 的架构验证外包给了全世界。


二、关键时间线 — Qwen3.8 的「三周闪电战」#

单看 8 月 26 日会看不懂这场发布,必须把 Qwen3.8 家族三周的动作连起来读——这是一次教科书式的「饱和式发布」。

日期事件关键信息
2026-08-03Qwen3.8-Max API 版上线云端旗舰:¥12/¥36 每百万 tokens(缓存命中 ¥1.5),国际价 $2/$6;1M 上下文、强制思考、文本+图像+视频
2026-08-12Qwen3.8-2.4T-A95B 开放权重Qwen 家族首个破万亿参数的开源<2>.4T 总参、激活约 95B(512 专家选 10+1);BF16 权重约 4.9TB、FP8 约 2.4TB;许可证改为自定义条款(MAU >1 亿或月收入 >$2000 万需标注,超 $5000 万另行授权);PaperBench 93.0、OSWorld-Verified 86.1 第一;同一晚 DeepSeek V4-Pro 正式版与 Grok 4.6 也扎堆上线
2026-08-14Qwen3.8-27B 开源 + OpenSandbox 一日双发27B 稠密原生多模态,Apache 2.0 真宽松;量化 17.9GB 进 24GB 显存,被叫「本地 Opus 4.6」;AA 指数 52 追平 GPT-5.6 Luna;开源两天下载破百万、登顶 HuggingFace Trending;NVIDIA 全线(RTX/DGX Spark/Jetson)+ 昇腾等九款国产芯片 Day-0 适配;同日 SpaceX 宣布 600 亿美元收购 Cursor,「600 亿 vs 0 美元」成为路线分水岭话题
2026-08-17DeepSeek 提价生效V4-Flash 高峰输出涨至 ¥9、V4-Pro 至 ¥27——旧「低价斩杀线」主动让位
2026-08-20阿里 FY2027 Q1 财报阿里云外部收入同比 +45%,创 22 个季度新高;AI 收入连续 12 个季度三位数增长;Q2 资本开支 676.78 亿元(+75%),3800 亿三年计划已投 1900 亿
2026-08-26 20:39-21<35>Qwen3.8-Flash 发布官方定调「千亿总参、6B 激活、效率全球新基准」;千问 AI 平台 API 定价 ¥1/¥3
2026-08-26 晚首发上线「千问办公」标准模式内置,官方称可覆盖 95% 日常办公任务;模型与 Harness 框架协同优化
2026-08-26 22:00-23<00>与 GLM-5.3-Flash 同夜对台戏智谱 22<12> 官宣 320B-A18B;阿里 23<00> 在 HuggingFace/ModelScope 放出 Qwen3.8-Flash-Next 权重与 FP8 版本

数据来源、界面新闻、新京报、紫牛新闻、上证报(8/26-8/27);掘金、CSDN、搜狐科技(8/12-8/16);什么值得买/快科技(8/25-8/26);DeepSeek 技术社区 AI 日报(8/21);摩根大通研报(8/16,华尔街见闻)。

**这意味着:**智谱用「匿名公测六天」预热一款模型,阿里用「三周四连发」铺一个家族——Max 立能力上限、2.4T 立开源招牌、27B 立本地斩杀线、Flash 立价格地板。四款模型指向同一个终点


三、发布背后的 4 个信号#

信号 1<效率战争进入第二战场> — 从「推理便宜」打到「训练便宜」#

2025 年到 2026 上半年,中国模型的成本故事全在推理侧 的 MLA/MoE、智谱的混合注意力,都是「同一个模型,跑起来更省」。Qwen3.8-Flash 把战火烧到了训练侧——官方口径<达到与> Qwen3.7-Plus 相近的性能,只消耗九分之一的训练资源

这个差别不是营销措辞,是护城河性质的差别<推理降本摊薄的是服务账单>,训练降本压缩的是试错成本——同样的预算,可以多做 9 次架构迭代、9 轮后训练 Scaling。智谱靠 GLM-5.3 证明「同基座后训练能涨 50%」,阿里靠 Qwen3.8 证明「新架构能把造模型的门票打掉一个数量级」。摩根大通评估中国 AI 竞争的那句话放这里正合适:可持续的成本优势,必须建立在结构性效率之上,而非激进的定价意愿。

佐证来自裸基座,这是最难造假的一段<仅完成预训练的> Qwen3.8-Flash-Next-Base,在 6B 激活档位下于 14 个 benchmark 中拿下 8 个最优(含 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM、MMMU);未经后训练的基座,通用、数学(GSM8K)、编程基础能力已经超过体积 3 倍的 Qwen3.7-Plus 基座。后训练只是把这份底子放大 Pro 62.5、DeepSWE 58.7、JobBench 超 Opus 4.6 近 20 分。

基准(官方自报)Qwen3.8-Flash对比对象分差
SWE-bench Pro(智能体编程)62.5Claude Opus 4.6+9.1
DeepSWE v1.1(真实仓库)58.7GLM-5.3-Flash(63.4)/ Gemini 3.7 Flash(65.3)同档偏下
CoWorkBench(长程专业任务)73.9DeepSeek-V4-Flash超越
Toolathlon Verified(真实工具调用)约 73.5(第三方收录口径)DeepSeek-V4-Flash、GLM-5.3-Flash(78.4)超前者、略逊后者
JobBench(专业工作任务)Claude Opus 4.6+近 20
AndroidWorld(移动端 Agent)84.5Claude Opus 4.6+22.5
MathVision w/ CI(视觉数学推理)95.7Claude Opus 4.6+25.1
ERQA(具身智能问答)Claude Opus 4.6+31.5

数据来源<阿里官方发布材料>(经紫牛新闻、快科技转录,基准绝对值多为截图,本文仅转录可比对数字);第三方对比来自 DataLearner、llm-stats 对 Qwen3.8-Flash-Next 与 GLM-5.3-Flash 的收录页。注意<以上绝大多数为厂商自报口径>,官方图表未转录部分以分差计。

信号 2<双> Flash 之夜 — 中国模型的「斩杀线」的内战打响#

8 月 26 日晚 20<40>,界面新闻发出阿里发布的快讯;22<12>,智谱 Z.ai 的官宣帖登顶 X 热帖;23<00>,双方在 HuggingFace 的权重几乎前后脚落地。两款「Flash」在同一晚、以几乎相同的价格(¥0.8/2.8 vs ¥1/3)、针对同一批场景(编程 Agent + 办公 + 多模态)开卖——这在一年前是不可想象的场面<彼时> Flash 档位指的是「旗舰阉割版」,如今它是各家真正的走量主力。

把两位主角放上秤台(第三方 DataLearner 同框收录,6 项):

基准GLM-5.3-FlashQwen3.8-Flash-Next胜方
DeepSWE63.458.7智谱 +4.7
NL2Repo56.348.1智谱 +8.2
Toolathlon Verified78.473.5智谱 +4.9
HLE(带工具口径不同)55.335.9智谱(注<测试条件不一致>,仅供参考)
Agents’ Last Exam26.324.3智谱 +2(llm-stats 收录结果与之相左,待复测)
CharXiv-R(多模态)89.490.6阿里 +1.2

结构上的差异比分数更有意思:**GLM 用 3 倍于对手的体量和原生 1M,买的是「严谨与长程」;Qwen 用 6B 激活和 125B 体量,买的是「吞吐、成本与训练效率」。**头条号的算法圈观察者说得更直接:「GLM Flash 稳压 Qwen Flash,两者不在一个量级——体量差了近乎三倍」;但反过来,论部署门槛,125B+ 外挂 51B 的 Qwen 又比 320B 的智谱「友好太多」。威易网的三 Flash 横评(把 DeepSeek-V4-Flash-Vision-Exp 也拉上)给了各自的人设:Qwen 是吞吐与性价比卷王,GLM 是长链路 Agent 特长生,DeepSeek 是轻量视觉务实派。

**结论:**2026 下半年前沿模型的门票,已经不再由「谁最强」发放,而是由「谁能在每一块钱、每一瓦特、每一次迭代里塞进更多智能」发放——这场战争里没有阉割版,Flash 就是主战场。

信号 3 的「分布式研发」 — 用开源社区当架构测试组#

阿里这次把话说得前所未有地白:Qwen3.8-Flash-Next 是 Qwen4 系列模型的雏形/技术预览,开源是为了「在基于此构建 Qwen4 完整家族之前,先让全球社区检验这套架构」。这不是做公益——这是把千万开发者的微调、量化、部署实践,变成自己架构验证的免费分布式测试网。27B 的前例就在三周前 的深度量化配方、RTX 5090 上 115 t/s 的实测、vLLM/llama.cpp 的 Day-0 适配、社区甚至统计出「前 4 层 + 后 12 层最值钱」的分层量化规律——这些反馈,任何内部测试组都攒不出这个密度。

而 Qwen 敢这么玩的底气来自生态复利<累计开源> 460+ 款模型、全球下载突破 30 亿次、衍生模型超 30 万个,HuggingFace 夏季报告用整章论述「Qwen 已成全球开源基座」。当芯片厂商、推理框架、量化工具都围绕你的模型架构做适配,你卖的就不是 token,是产业位置

“As a 27B model, it performs on par with Opus 4.6 on benchmarks.” — testingcatalog(社区对 27B 的评价,同样适用于理解 Flash 路线)

信号 4<模型回到场景> — 「千问办公」与云报表上的闭环#

阿里的发布路径带着鲜明的体用结构 不只是 API 货架上的一个新 SKU,而是当晚就嵌进「千问办公」的标准模式——官方称可完成 95% 的日常办公任务,且 Qwen 团队与千问办公团队对模型和 Harness 协同联合优化。这层「模型 × 自家工作环境」的耦合,恰恰是第三方评测最容易翻车、也最难被竞品复制的地带。

商业闭环同样摆在明面上<财报里阿里云> AI 收入连续 12 个季度三位数增长、3800 亿算力投入已兑现 1900 亿——训练成本降 90% 省下来的每一分钱,都会直接改善这条资本开支曲线的回报率。对阿里,Flash 是「AI 规模化的水电煤」;对智谱,Flash 是身家性命;同一款档位的产品,背后是两种公司命运。这也是为什么威易网的选型结论把 Qwen 留给「高并发、海量吞吐、降本增效」——它从来都是为一整片云设计的。


四、深度拆解 — 四大支柱与「外挂记忆」的算术#

先看家族坐标,再逐柱拆解。

维度Qwen3.8-Max(2.4T)Qwen3.8-27BQwen3.8-Flash / Flash-Next
发布时间8/3 API、8/12 权重8/14 权重8/26 发布、23<00> 权重
架构MoE,512 专家选 10+1Dense 稠密MoE + N-gram Embedding 外挂
总参/激活2.4T / ~95B27B / 27B(全激活)125B + 51B / 6B
模态纯文本(开源版)原生文本+图像+视频原生多模态
上下文262K→1.01M262K→1M262K 原生→1M(Next 默认 1M)
最大输出128K128K 级128K
许可证自定义条款Apache 2.0发布报道未注明,以模型卡为准
AA 指数5852截至发稿未见独立评测
API 价(国内)¥12 / ¥36未主推¥1 / ¥3
角色能力上限、旗舰叙事本地部署斩杀线云端走量、办公主力、Qwen4 架构预览

数据来源<界面新闻>、IT之家、掘金、什么值得买、Artificial Analysis 比较页(8/26 前收录)。

翻译成人话,这张表的读法是:**Max 负责「能做多强」,27B 负责「要多便携」,Flash 负责「要多便宜」——三条线共享同一套混合注意力骨架,这是阿里版「架构中台」。**Flash 的四大技术支柱,每一柱都指向一个具体的成本项:

支柱 1<注意力> — GDN + QSA,「速读」与「精查」分工#

Attention 采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN(门控线性递归)负责高效压缩历史信息、维持「读过就忘不掉但也不存全文」的状态;QSA 则通过轻量级索引器(Indexer)在 micro-block 粒度上筛选重要上下文——不是逐 token 挑,而是以小块为单位粗筛,显著压低长序列开销。官方公布的工程数字<面对> 1M token,QSA 的 Attention Kernel 在 Prefill 与 Decode 阶段分别最高实现 7.6× 与 4.9× 加速;媒体口径补充<高缓存命中的> 1M 长上下文实际服务场景,整体可提速 8 倍以上(官方)。

与智谱「34 层线性 + 11 层 DSA」的 3<1> 硬交错配比对照,两者哲学相同(线性打底、稀疏点睛),细节路线不同 系做 token 粒度的精确检索,阿里做 block 粒度的粗筛——赌的是「1M 上下文里真正重要的段落成块出现」这个经验假设。

支柱 2<信息主干道> — Gated Residual,把 1 条残差拆成 4 条#

Gated Residual(GR)机制把传统 Transformer 的单条残差流,扩展为 4 条并行分支,以动态门控决定信息的读写路径;官方特别强调残差状态支持 FP8 存储,直接削减访存带宽需求——对内存墙比计算墙更紧的推理硬件,这一条的价值不亚于注意力改革。效果是双向的<信息传递更高效>,训练也更稳定(GDN 一脉的线性注意力素以训练不稳著称,GR 是给它配的「减震器」)。

支柱 3:「外挂记忆」— 51B N-gram Embedding,不占计算预算的容量#

这是四柱里最小巧也最 inventive 的一件<在> 125B Transformer 主干之外,挂一张 51B 参数的 N-gram 嵌入「记忆指南手册」——利用局部上下文做查表扩展,为模型提供更高效的查址寻路。关键在于,这张表在每次 token 计算时无需参与,且可整体卸载至主机内存(Host Memory),通过异步 Prefetch 与计算重叠,不长期占用 GPU 显存。

说透一点 扩容靠「多养专家」,但专家权重必须常驻显存;N-gram Embedding 扩容的权重可以住在内存里,用时再搬——等于把「参数量」从 GPU 账本上摘下来,挂到了便宜的 DDR 账本上。对部署端的潜台词<显存需求主要跟> 125B 走,而容量红利来自额外的 51B。智谱砍层数省计算,阿里扩查表省显存,一个减分子、一个换分母,都是 2026 年「智能密度」竞赛的招。

支柱 4<优化器与配平> — Muon + 重新拟合的 Scaling Law#

训练侧换用 Muon Optimizer(基于矩阵正交化的现代优化器),针对正交化精度、参数分工、融合矩阵拆分做了工程化改造;并为这套全新架构重新拟合了 Scaling Law——这句轻描淡写很要紧<旧配方预测不了新算力价格>,敢重训一条曲线,说明阿里打算把这代架构一路 Scale 到 Qwen4 的更大尺寸,Flash 只是这条曲线上的第一个量产点。

把四柱合起来算总账,才看得懂官方那句「训练成本 1/9」<注意力混合砍计算主干>、GR 砍带宽、N-gram 砍显存、Muon 砍迭代次数、Scaling Law 砍试错——五个成本项,逐项过刀。


五、别只看亮的地方<五个短板>#

按老规矩,亮点讲完翻底牌。Qwen3.8-Flash 发布不足 24 小时,以下每一条都有出处,但同样要等复测。

**短板 1<锚点降级>——它对标的是 Opus 4.6,不是 4.8。**官方全部基准比较的假想敌是 Claude Opus 4.6——一款 2025 年的上一代旗舰;「接近 Opus 4.8」只出现在定性描述里,没有对应的同框表格。对比智谱同晚「AA 57 = Opus 4.8 57」的第三方硬锚,阿里的成绩单保守了一个身位。这不是说它在撒谎,而是说:**它真正的对手位(与 GLM-5.3-Flash、Gemini 3.7 Flash 同档)还没有被独立评测盖章。**截至发稿,Artificial Analysis 未收录 Qwen3.8-Flash 的独立指数——57/58 分之争,结论留白。

**短板 2<六项同框>,目前 1 胜 4 负 1 平。**DataLearner 收录的 GLM vs Qwen 直接对比 +4.7、NL2Repo +8.2、Toolathlon +4.9、Agents’ Last Exam +2 均归智谱,阿里只在 CharXiv 上 +1.2 小胜,llm-stats 的收录口径还有分歧(HLE 测试条件不对等)。在「最难的编程长程任务」这一 Flash 们的主 selling point 上,6B 激活确实还没打赢 18B 激活——物理规律还在工作,体量差近三倍不是架构差能完全抹平的。

短板 3:「能想」是家族体质,Flash 存疑。三周前的 27B 暴露过同一问题 全套评测它生成了约 1.6 亿输出 tokens(GPT-5.6 Luna 为 1.3 亿),LocalLLaMA 的评价是 “very slow because of its dense nature and long thinking time”,Simon Willison 让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。Flash 是 MoE 不是 Dense,单 token 计算更低,但 Qwen 团队用「长思考换智能」的训练取向会不会以「高 token 消耗」的形式传导到推理账单上,要等第三方任务级实测——¥3/百万输出看着便宜,任务级成本 = 单价 × 消耗量,后一项还未验证。

**短板 4<高并发与稳定性>,正是低激活架构的必答题。**6B 激活意味着吞吐上限漂亮,但也意味着每次前向的「决策厚度」有限——新浪博主谢小斌和 @Tech森 的提醒属于同一类:**低激活算力能否稳住高并发、稀疏 MoE 的输出波动、复杂任务的稳定性,需要开发者实测,纸面跑分不算数。**智谱至少还有 42T tokens 公测流量做背书,阿里这台的「公测数据」发布时是零。

短板 5<协议与服务细则留白>,别把「开源」读成「 Apache 全家桶」。发布当晚各家报道均未注明 Flash 权重许可证,而家族前例并不统一.8-Max 用的是自定义协议(MAU/营收触发商业条款),只有 27B 是干净 Apache 2.0;API 的缓存计价、Batch 折扣、限流参数也尚未见全量表。私有化部署团队的老规矩<先读> License 文件,再动 GPU。另外一个容易被忽略的反差.3-Flash 国内站牌价(¥0.8/¥2.8)在数字上略低于 Qwen(¥1/¥3)且有限时五折——号称性价比之王的阿里,这次的挂牌价第一次被智谱压了半个身位。


六、选型建议 — 双 Flash 对决,到底怎么选#

先给双雄速查卡:

维度Qwen3.8-FlashGLM-5.3-Flash
体量125B + 51B 外挂 / 激活 6B320B / 激活 18B
独立指数未见 AA 收录(发稿时)AA 57,与 Opus 4.8 持平
原生上下文262K(YaRN→1M)1M 原生
国内牌价¥1 / ¥3¥0.8 / ¥2.8(限时五折)
训练成本叙事上代的 1/9未提(主打推理降本 3-4.4 倍)
实测背书发布即开源,零公测流量6 天 60T+ tokens 匿名公测
许可证待确认(Max 系有自定义前例)MIT
生态位千问办公内置、阿里云全栈Coding Plan、ZCode、国产芯片集群

再按场景给结论(判断基于 8/27 前公开数据,一周后以复测为准):

你的场景建议理由
海量高并发 API、客服/内容流水线、数据抽取Qwen3.8-Flash6B 激活的吞吐经济性 + ¥3 输出价 + 云厂商 SLA;威易网横评的默认选项
日常办公自动化、文档/PPT/表格产出Qwen3.8-Flash(千问办公)官方口径 95% 日常办公覆盖,模型 × Harness 联合优化是它的主场
移动端/具身/GUI Agent(手机操作、机器人)Qwen3.8-FlashAndroidWorld 84.5、ERQA 领先 31.5 分,多模态 Agent 是四柱架构的直接受益项
长链路编码 Agent、大仓库重构、严谨工具流GLM-5.3-Flash六项同框 4 胜、原生 1M、公测流量淬炼过
安全敏感、需可审计私有化GLM-5.3-Flash(MIT)或等 Qwen 许可证落地许可条款清晰度当前智谱占优;Qwen 若给 Apache 2.0 则天平翻转,需盯模型卡
预算极致的批处理(夜间/闲时)两家都测,按任务成本签¥2.8 vs ¥3 的牌价差可忽略,真实差距在 token 消耗率与重试率,拿你的任务各跑一天
只想本地玩Qwen3.8-27B 仍是甜点位17.9GB 量化进 4090;Flash 的 125B 权重 FP8 也要 ~125GB 级,高内存工作站才行,51B N-gram 卸载吃 DDR 内存

三句心法,沿用上一篇并加一句:别拿 6B 冲上限,拿它做「次数」;别信厂商的锚点,自己换基准;别比牌价比任务——尤其是把「思考长度」这一隐形变量算进账单。


七、关键术语速查#

术语大白话版本
GDN(Gated DeltaNet)门控线性注意力<用>「递推状态」记住读过的内容,成本近线性;负责速读,不存原文全文
QSA(Qwen Sparse Attention)阿里自研稀疏注意力<轻量索引器按> micro-block(小块) 粒度挑出该精读的上下文;Prefill/Decode 最高加速 7.6×/4.9×
Gated Residual(GR)把Transformer的1条残差「主干道」拆成 4 条并行分支,用门控动态读写;还能 FP8 存状态,省带宽
N-gram Embedding51B 参数的「大词典」外挂<按局部片段查表补充容量>,不参与每 token 矩阵运算,可放内存、异步预取
Muon Optimizer基于矩阵正交化的新一代优化器,替代 Adam 家族;小模型/新架构上收敛更快,阿里为其重做了工程细节
YaRN位置编码外推技术<把原生> 262K 的「视野」拉长到 1M 的常规手段,零训练成本的长上下文升级
MTP(Multi-Token Prediction)一次预测多个未来 token + 投机解码;27B 内置(接受率 84-92%),本地推理能跑快的关键
Dense vs MoE27B 稠密「全员到岗」<部署简单但每> token 算力固定;Flash 稀疏「点名上岗」<省算力和带宽>,但显存驻留不变
「智能密度」每分钱/每瓦特/每 GB 显存里装多少有效智能——2026 年模型竞争的新计分方式
CoWorkBench / JobBench专业工作类基准<模拟办公室任务链与职业任务>(简历、报告、合同),Flash 的两大得分区
「Next」后缀Qwen 的架构试验田标识——Flash-Next 即 Qwen4 架构的技术预览,现网生产版以 Qwen3.8-Flash 提供服务
千问办公阿里的 AI 生产力平台(8 月财报电话会重点),Flash 首发嵌入其标准模式
OpenSandbox阿里 8/14 开源的 Agent 沙箱(代码/网页/完整桌面三模式,5 语言 SDK),与 27B 组成「本地 Agent 四件套」的另一半

八、FAQ — 6 个被问得最多的问题#

Q1.8-Flash 和 Qwen3.8-27B 都便宜,普通开发者到底该用哪个? A<两条路>,不冲突。要云端 API、高并发、办公流水线 → Flash(¥1/¥3,MoE 6B 激活,吞吐经济性最好);要本地跑、数据不出域、单卡工作站 → 27B(Apache 2.0,量化 17.9GB 进 24GB 显存,一张 4090 当奶牛)。能力档位上,官方口径 Flash 更接近 Opus 4.8、27B 对标 Opus 4.6,但 27B 有已被 AA 认证的 52 分和海量社区实测,Flash 的同级认证还没落地——急上生产选证据多的,不急可以等一周。

Q2.8-Flash-Next 和 Qwen3.8-Flash 是什么关系? A<同一套架构的两个投放形态>Next = 开源权重版,Qwen4 架构的技术预览,默认 1M 上下文、内置官方工具,8/26 23<00> 已上 HuggingFace/ModelScope(含 FP8 版);Flash = 千问 AI 平台上的现网服务版。**阿里官方原话<提前释出结构改动>,让社区在 Qwen4 完整家族构建前先检验它。**翻译<你下的是权重>,同时也是替 Qwen4 免费做 QA——愿意与否,取决于你觉得这份「参与感」值不值电费。

Q3<做> Coding Agent,今晚该把主力切到哪个 Flash? A<拆场景>。长链路、大仓库、多步工具编排、GLM Coding Plan 已订阅 → GLM-5.3-Flash(六项同框 4 胜、原生 1M、42T tokens 公测淬炼);轻量高频、IDE 内联补全、夜间批处理、预算卡死 → Qwen3.8-Flash(6B 激活的单位经济性更狠)。最稳的做法上周就写过:两三家 Flash 各跑一天真实任务,统计「每成功任务成本 + 一次通过率」,谁赢听账单的。

Q4<训练成本降> 90%,对整个行业意味着什么? A<意味着三件事>。其一,前沿能力的复刻成本跌了一个数量级——DeepSeek 当年用 MLA 干过一轮的事,Qwen 用「GDN+QSA+GR+N-gram+Muon」组合拳再干一轮,后来者的门票价被共同下拉;其二,试错节奏变快,同样的预算够训 9 版,模型迭代的瓶颈从算力排队变成想法排队;其三,对闭源阵营最难堪的推论:**智谱与阿里如今互相用十分之一的价格贴身肉搏,说明他们眼里的「利润」已经让位于「分发」,前沿模型的超额利润期正在中国厂商之间互相终结。**摩根大通的框架<纯低价不可持续>,结构性效率才可持续——两家各占一半,所以两家都活着。

Q5<怎么用上它>?有什么坑? A:途径三件套<①> 千问办公(标准模式已内置,免费/订阅入口);② 千问 AI 平台 API(¥1/¥3,即将全面开放,以平台页为准);③ HuggingFace / ModelScope 拉权重(搜 Qwen/Qwen3.8-Flash-Next)。三个坑提前标注:许可证以模型卡为准,别按 27B 的 Apache 2.0 惯性假设;原生 262K、扩到 1M 靠 YaRN,超长任务先看效果衰减再看宣传;评测若用非官方 Harness,分数可能比官方口径低——知乎那篇换芯指南的原话<新模型对自家壳子普遍存在过拟合>

Q6<同一晚智谱发> GLM-5.3-Flash,是不是故意的?阿里不怕被压分吗? A<大概率是半故意的>。两家都在抢「8 月最后一周」的发布窗口,DeepSeek 提价后的低价真空、Kimi K2.5 月底退役的换芯潮、九月云栖/秋季硬件季的流量,都是必须抢的滩头。被 GLM 压分这个风险,阿里的对冲清晰可见<不跟你比编码长程>,把战场拉到「训练成本 1/9 + Qwen4 雏形 + 云端生态」这三个 GLM 没有维度的维度上。同夜对垒的真正输家,是还挂着旧牌价的所有第三方 Flash——Gemini 3.7 Flash 的 $3.75 促销价(12/31 后恢复 $7.5)、Kimi K3 的 ¥100 输出,在一夜间都变得需要解释。

**一句收口:智谱证明「前沿智能不必有前沿价格」,阿里这次补的下半句是——「前沿智能也不必有三倍算力」。**两句话合在一起,才是 2026 年 Q3 真正的战报。


九、参考资料#

官方发布与基准

  • Qwen 官方技术博客.ai/blog?id=qwen3.8-flash-next;技术报告见 QwenLM/Qwen3.8-Flash-Next GitHub 仓库
  • 开源权重.co/Qwen/Qwen3.8-Flash-Next;ModelScope/Qwen3.8-Flash-Next(含 FP8 版)
  • 千问 AI 平台 API 定价<阿里云百炼>/千问 AI平台定价页(¥1/¥3 口径来自官方发布)
  • 「千问办公」入口与说明<阿里官方发布材料>(8/26)
  • Artificial Analysis 智能指数 v4.1.1(Qwen3.8-Max 58、Qwen3.8-27B 52 收录页)

第三方评测与媒体

  • IT之家/新浪财经/凤凰网:《阿里通义 Qwen3.8-Flash 发布开源<125b> 参数 MoE,训练成本仅为前代 1/9》(8/26)
  • 界面新闻:《阿里千问正式发布 Qwen3.8-Flash》(8/26)
  • 新京报贝壳财经、上海证券报、紫牛新闻、潮新闻、广州日报<8>/26-8/27 发布报道(四大架构支柱与基准分差的集中来源)
  • 什么值得买/快科技:《超越 V4 Flash<千问> Qwen3.8-Flash 大模型开源》(8/26,含 $0.16/$0.47 美元牌价与 DeepSWE 58.7 等绝对值)
  • DataLearner、llm-stats.3-Flash vs Qwen3.8-Flash-Next 同框对比页(8/26)
  • 威易网 / GLM-5.3-Flash / Qwen3.8-Flash 三 Flash 横评(8/26)
  • 知乎专栏:《Qwen3.8-27B 就是新的模型斩杀线》(8/21)、27B AA 52 分与本地部署实测长文
  • 掘金:《阿里一日双发.8-27B + OpenSandbox》(8/15)
  • DeepSeek 技术社区/开放原子:《AI 大模型日报 8/21》(Qwen3.8-Max 2.4T 开源细节、阿里财报、Grok/Gemini 背景)
  • 摩根大通研报(8/16,via 华尔街见闻/雪球)

相关阅读

  • 本系列上一篇:《GLM-5.3-Flash 深度解读<57> 分追平 Opus 4.8、价格只有 1/40、全部公测流量跑在国产芯片上》
  • 什么值得买:《Kimi K2.5 月底退役,GLM-5.3 与 Qwen3.8 同月接棒<换芯先看能不能买到>》(8/25)

数据截至 2026 年 8 月 27 日,Qwen3.8-Flash 的全部基准均为厂商自报、AA 独立指数尚未收录——本文所有「超越/接近」的表述请自动加「官方称」。但两条已经发生的事实不需要等复测<同晚两台> Flash 的牌价差不到两块钱,以及,造一台这样的机器的成本,掉到了九分之一。

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Qwen3.8-Flash 深度解读
https://mizuki-eaf.pages.dev/posts/qwen/qwen38-flash深度解读/
作者
无名之子
发布于
2026-08-27
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录