Qwen3.8-Flash 深度解读<千亿参数只点>千亿参数只点> 6B 的「灶」、训练成本砍到 1/9、与 GLM-5.3-Flash 同夜对垒
GEO 速答<截至>截至> 2026 年 8 月 27 日,阿里于 8 月 26 日晚发布并开源 Qwen3.8-Flash——多模态 MoE,Transformer 主干 125B + 51B N-gram Embedding,每 token 仅激活 6B,官方称性能超越 Claude Opus 4.6、接近 Opus 4.8;API 定价输入 ¥1/输出 ¥3 每百万 tokens,约为 DeepSeek-V4-Flash 闲时的 2/3、忙时的 1/3;同一晚,智谱官宣了 GLM-5.3-Flash——2026 年的「Flash 战争」,正式开打。
上一篇拆 GLM-5.3-Flash 时我们留了一句伏笔:「感觉和刚发布的 Qwen3.8-Flash 有的一拼」。这篇把它补上。
如果说智谱那晚讲的是「把旗舰智能的价格打下来」,阿里同晚讲的则是另一个故事:把训练和推理两本账一起炸掉——Qwen3.7-Plus 九分之一的算力,训出一个在智能体编程上超过 Opus 4.6 的多模态模型,然后以「Qwen4 架构技术预览」的身份直接开源权重,让全球社区替下一代旗舰免费做架构验证。
本文依然用 7 张数据表 + 4 个信号 + 1 份架构拆解 + 6 个 FAQ,把这款模型发布 24 小时内所有可查证的信息,压缩成一份 15 分钟读完的「6B 激活时代说明书」。与上一篇同一套规矩<官方口径标>官方口径标>「官方」,第三方数字单独署名,自报跑分一律不当圣旨。
一、TL;DR — 6 句话看懂 Qwen3.8-Flash
| # | 问题 | 答案 |
|---|---|---|
| 1 | 它是什么 | 阿里通义千问的多模态 MoE 模型 |
| 2 | 有多强 | 官方口径:超越 Claude Opus 4.6、接近 Opus 4.8——SWE-bench Pro 62.5(领先 Opus 4.6 达 9.1 分)、DeepSWE 58.7、CoWorkBench 73.9、AndroidWorld 84.5(领先 22.5 分);基座模型 8/14 项基准在 6B 激活档位拿最优 |
| 3 | 多便宜 | API 输入 ¥1/输出 ¥3 每百万 tokens(约 $0.16/$0.47),是 DeepSeek-V4-Flash 忙时价的 1/3、闲时的 2/3,约为 Claude Opus 4.6 的 3% |
| 4 | 省在哪 | 与 GLM 只砍推理成本不同,Qwen3.8-Flash 两头砍:训练成本降到 Qwen3.7-Plus 的 1/9(降近 90%),推理靠 GDN + QSA 混合注意力,1M 高缓存命中场景提速 8 倍以上 |
| 5 | 什么身份 | 开源权重叫 Qwen3.8-Flash-Next——官方明说这是下一代 Qwen4 架构的雏形/技术预览,提前放出让社区检验;与智谱 GLM-5.3-Flash 同晚发布,正面撞车 |
| 6 | 边界在哪 | 对标锚点是 Opus 4.6(上一代模型),比 GLM 直接锚 57=57 的 Opus 4.8 口径保守一档;第三方同框横评(GLM vs Qwen 六项)智谱平均高约 6.3 分;发布时尚无 Artificial Analysis 独立指数 |
一句话立场
二、关键时间线 — Qwen3.8 的「三周闪电战」
单看 8 月 26 日会看不懂这场发布,必须把 Qwen3.8 家族三周的动作连起来读——这是一次教科书式的「饱和式发布」。
| 日期 | 事件 | 关键信息 |
|---|---|---|
| 2026-08-03 | Qwen3.8-Max API 版上线 | 云端旗舰:¥12/¥36 每百万 tokens(缓存命中 ¥1.5),国际价 $2/$6;1M 上下文、强制思考、文本+图像+视频 |
| 2026-08-12 | Qwen3.8-2.4T-A95B 开放权重 | Qwen 家族首个破万亿参数的开源<2>2>.4T 总参、激活约 95B(512 专家选 10+1);BF16 权重约 4.9TB、FP8 约 2.4TB;许可证改为自定义条款(MAU >1 亿或月收入 >$2000 万需标注,超 $5000 万另行授权);PaperBench 93.0、OSWorld-Verified 86.1 第一;同一晚 DeepSeek V4-Pro 正式版与 Grok 4.6 也扎堆上线 |
| 2026-08-14 | Qwen3.8-27B 开源 + OpenSandbox 一日双发 | 27B 稠密原生多模态,Apache 2.0 真宽松;量化 17.9GB 进 24GB 显存,被叫「本地 Opus 4.6」;AA 指数 52 追平 GPT-5.6 Luna;开源两天下载破百万、登顶 HuggingFace Trending;NVIDIA 全线(RTX/DGX Spark/Jetson)+ 昇腾等九款国产芯片 Day-0 适配;同日 SpaceX 宣布 600 亿美元收购 Cursor,「600 亿 vs 0 美元」成为路线分水岭话题 |
| 2026-08-17 | DeepSeek 提价生效 | V4-Flash 高峰输出涨至 ¥9、V4-Pro 至 ¥27——旧「低价斩杀线」主动让位 |
| 2026-08-20 | 阿里 FY2027 Q1 财报 | 阿里云外部收入同比 +45%,创 22 个季度新高;AI 收入连续 12 个季度三位数增长;Q2 资本开支 676.78 亿元(+75%),3800 亿三年计划已投 1900 亿 |
| 2026-08-26 20:39-21<35>35> | Qwen3.8-Flash 发布 | 官方定调「千亿总参、6B 激活、效率全球新基准」;千问 AI 平台 API 定价 ¥1/¥3 |
| 2026-08-26 晚 | 首发上线「千问办公」 | 标准模式内置,官方称可覆盖 95% 日常办公任务;模型与 Harness 框架协同优化 |
| 2026-08-26 22:00-23<00>00> | 与 GLM-5.3-Flash 同夜对台戏 | 智谱 22<12>12> 官宣 320B-A18B;阿里 23<00>00> 在 HuggingFace/ModelScope 放出 Qwen3.8-Flash-Next 权重与 FP8 版本 |
数据来源
、界面新闻、新京报、紫牛新闻、上证报(8/26-8/27);掘金、CSDN、搜狐科技(8/12-8/16);什么值得买/快科技(8/25-8/26);DeepSeek 技术社区 AI 日报(8/21);摩根大通研报(8/16,华尔街见闻)。
**这意味着:**智谱用「匿名公测六天」预热一款模型,阿里用「三周四连发」铺一个家族——Max 立能力上限、2.4T 立开源招牌、27B 立本地斩杀线、Flash 立价格地板。四款模型指向同一个终点
三、发布背后的 4 个信号
信号 1<效率战争进入第二战场>效率战争进入第二战场> — 从「推理便宜」打到「训练便宜」
2025 年到 2026 上半年,中国模型的成本故事全在推理侧
这个差别不是营销措辞,是护城河性质的差别<推理降本摊薄的是服务账单>推理降本摊薄的是服务账单>,训练降本压缩的是试错成本——同样的预算,可以多做 9 次架构迭代、9 轮后训练 Scaling。智谱靠 GLM-5.3 证明「同基座后训练能涨 50%」,阿里靠 Qwen3.8 证明「新架构能把造模型的门票打掉一个数量级」。摩根大通评估中国 AI 竞争的那句话放这里正合适:可持续的成本优势,必须建立在结构性效率之上,而非激进的定价意愿。
佐证来自裸基座,这是最难造假的一段<仅完成预训练的>仅完成预训练的> Qwen3.8-Flash-Next-Base,在 6B 激活档位下于 14 个 benchmark 中拿下 8 个最优(含 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM、MMMU);未经后训练的基座,通用、数学(GSM8K)、编程基础能力已经超过体积 3 倍的 Qwen3.7-Plus 基座。后训练只是把这份底子放大
| 基准(官方自报) | Qwen3.8-Flash | 对比对象 | 分差 |
|---|---|---|---|
| SWE-bench Pro(智能体编程) | 62.5 | Claude Opus 4.6 | +9.1 |
| DeepSWE v1.1(真实仓库) | 58.7 | GLM-5.3-Flash(63.4)/ Gemini 3.7 Flash(65.3) | 同档偏下 |
| CoWorkBench(长程专业任务) | 73.9 | DeepSeek-V4-Flash | 超越 |
| Toolathlon Verified(真实工具调用) | 约 73.5(第三方收录口径) | DeepSeek-V4-Flash、GLM-5.3-Flash(78.4) | 超前者、略逊后者 |
| JobBench(专业工作任务) | — | Claude Opus 4.6 | +近 20 |
| AndroidWorld(移动端 Agent) | 84.5 | Claude Opus 4.6 | +22.5 |
| MathVision w/ CI(视觉数学推理) | 95.7 | Claude Opus 4.6 | +25.1 |
| ERQA(具身智能问答) | — | Claude Opus 4.6 | +31.5 |
数据来源<阿里官方发布材料>阿里官方发布材料>(经紫牛新闻、快科技转录,基准绝对值多为截图,本文仅转录可比对数字);第三方对比来自 DataLearner、llm-stats 对 Qwen3.8-Flash-Next 与 GLM-5.3-Flash 的收录页。注意<以上绝大多数为厂商自报口径>以上绝大多数为厂商自报口径>,官方图表未转录部分以分差计。
信号 2<双>双> Flash 之夜 — 中国模型的「斩杀线」的内战打响
8 月 26 日晚 20<40>40>,界面新闻发出阿里发布的快讯;22<12>12>,智谱 Z.ai 的官宣帖登顶 X 热帖;23<00>00>,双方在 HuggingFace 的权重几乎前后脚落地。两款「Flash」在同一晚、以几乎相同的价格(¥0.8/2.8 vs ¥1/3)、针对同一批场景(编程 Agent + 办公 + 多模态)开卖——这在一年前是不可想象的场面<彼时>彼时> Flash 档位指的是「旗舰阉割版」,如今它是各家真正的走量主力。
把两位主角放上秤台(第三方 DataLearner 同框收录,6 项):
| 基准 | GLM-5.3-Flash | Qwen3.8-Flash-Next | 胜方 |
|---|---|---|---|
| DeepSWE | 63.4 | 58.7 | 智谱 +4.7 |
| NL2Repo | 56.3 | 48.1 | 智谱 +8.2 |
| Toolathlon Verified | 78.4 | 73.5 | 智谱 +4.9 |
| HLE(带工具口径不同) | 55.3 | 35.9 | 智谱(注<测试条件不一致>测试条件不一致>,仅供参考) |
| Agents’ Last Exam | 26.3 | 24.3 | 智谱 +2(llm-stats 收录结果与之相左,待复测) |
| CharXiv-R(多模态) | 89.4 | 90.6 | 阿里 +1.2 |
结构上的差异比分数更有意思:**GLM 用 3 倍于对手的体量和原生 1M,买的是「严谨与长程」;Qwen 用 6B 激活和 125B 体量,买的是「吞吐、成本与训练效率」。**头条号的算法圈观察者说得更直接:「GLM Flash 稳压 Qwen Flash,两者不在一个量级——体量差了近乎三倍」;但反过来,论部署门槛,125B+ 外挂 51B 的 Qwen 又比 320B 的智谱「友好太多」。威易网的三 Flash 横评(把 DeepSeek-V4-Flash-Vision-Exp 也拉上)给了各自的人设:Qwen 是吞吐与性价比卷王,GLM 是长链路 Agent 特长生,DeepSeek 是轻量视觉务实派。
**结论:**2026 下半年前沿模型的门票,已经不再由「谁最强」发放,而是由「谁能在每一块钱、每一瓦特、每一次迭代里塞进更多智能」发放——这场战争里没有阉割版,Flash 就是主战场。
信号 3 的「分布式研发」 — 用开源社区当架构测试组
阿里这次把话说得前所未有地白:Qwen3.8-Flash-Next 是 Qwen4 系列模型的雏形/技术预览,开源是为了「在基于此构建 Qwen4 完整家族之前,先让全球社区检验这套架构」。这不是做公益——这是把千万开发者的微调、量化、部署实践,变成自己架构验证的免费分布式测试网。27B 的前例就在三周前
而 Qwen 敢这么玩的底气来自生态复利<累计开源>累计开源> 460+ 款模型、全球下载突破 30 亿次、衍生模型超 30 万个,HuggingFace 夏季报告用整章论述「Qwen 已成全球开源基座」。当芯片厂商、推理框架、量化工具都围绕你的模型架构做适配,你卖的就不是 token,是产业位置。
“As a 27B model, it performs on par with Opus 4.6 on benchmarks.” — testingcatalog(社区对 27B 的评价,同样适用于理解 Flash 路线)
信号 4<模型回到场景>模型回到场景> — 「千问办公」与云报表上的闭环
阿里的发布路径带着鲜明的体用结构
商业闭环同样摆在明面上<财报里阿里云>财报里阿里云> AI 收入连续 12 个季度三位数增长、3800 亿算力投入已兑现 1900 亿——训练成本降 90% 省下来的每一分钱,都会直接改善这条资本开支曲线的回报率。对阿里,Flash 是「AI 规模化的水电煤」;对智谱,Flash 是身家性命;同一款档位的产品,背后是两种公司命运。这也是为什么威易网的选型结论把 Qwen 留给「高并发、海量吞吐、降本增效」——它从来都是为一整片云设计的。
四、深度拆解 — 四大支柱与「外挂记忆」的算术
先看家族坐标,再逐柱拆解。
| 维度 | Qwen3.8-Max(2.4T) | Qwen3.8-27B | Qwen3.8-Flash / Flash-Next |
|---|---|---|---|
| 发布时间 | 8/3 API、8/12 权重 | 8/14 权重 | 8/26 发布、23<00>00> 权重 |
| 架构 | MoE,512 专家选 10+1 | Dense 稠密 | MoE + N-gram Embedding 外挂 |
| 总参/激活 | 2.4T / ~95B | 27B / 27B(全激活) | 125B + 51B / 6B |
| 模态 | 纯文本(开源版) | 原生文本+图像+视频 | 原生多模态 |
| 上下文 | 262K→1.01M | 262K→1M | 262K 原生→1M(Next 默认 1M) |
| 最大输出 | 128K | 128K 级 | 128K |
| 许可证 | 自定义条款 | Apache 2.0 | 发布报道未注明,以模型卡为准 |
| AA 指数 | 58 | 52 | 截至发稿未见独立评测 |
| API 价(国内) | ¥12 / ¥36 | 未主推 | ¥1 / ¥3 |
| 角色 | 能力上限、旗舰叙事 | 本地部署斩杀线 | 云端走量、办公主力、Qwen4 架构预览 |
数据来源<界面新闻>界面新闻>、IT之家、掘金、什么值得买、Artificial Analysis 比较页(8/26 前收录)。
翻译成人话,这张表的读法是:**Max 负责「能做多强」,27B 负责「要多便携」,Flash 负责「要多便宜」——三条线共享同一套混合注意力骨架,这是阿里版「架构中台」。**Flash 的四大技术支柱,每一柱都指向一个具体的成本项:
支柱 1<注意力>注意力> — GDN + QSA,「速读」与「精查」分工
Attention 采用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN(门控线性递归)负责高效压缩历史信息、维持「读过就忘不掉但也不存全文」的状态;QSA 则通过轻量级索引器(Indexer)在 micro-block 粒度上筛选重要上下文——不是逐 token 挑,而是以小块为单位粗筛,显著压低长序列开销。官方公布的工程数字<面对>面对> 1M token,QSA 的 Attention Kernel 在 Prefill 与 Decode 阶段分别最高实现 7.6× 与 4.9× 加速;媒体口径补充<高缓存命中的>高缓存命中的> 1M 长上下文实际服务场景,整体可提速 8 倍以上(官方)。
与智谱「34 层线性 + 11 层 DSA」的 3<1>1> 硬交错配比对照,两者哲学相同(线性打底、稀疏点睛),细节路线不同
支柱 2<信息主干道>信息主干道> — Gated Residual,把 1 条残差拆成 4 条
Gated Residual(GR)机制把传统 Transformer 的单条残差流,扩展为 4 条并行分支,以动态门控决定信息的读写路径;官方特别强调残差状态支持 FP8 存储,直接削减访存带宽需求——对内存墙比计算墙更紧的推理硬件,这一条的价值不亚于注意力改革。效果是双向的<信息传递更高效>信息传递更高效>,训练也更稳定(GDN 一脉的线性注意力素以训练不稳著称,GR 是给它配的「减震器」)。
支柱 3:「外挂记忆」— 51B N-gram Embedding,不占计算预算的容量
这是四柱里最小巧也最 inventive 的一件<在>在> 125B Transformer 主干之外,挂一张 51B 参数的 N-gram 嵌入「记忆指南手册」——利用局部上下文做查表扩展,为模型提供更高效的查址寻路。关键在于,这张表在每次 token 计算时无需参与,且可整体卸载至主机内存(Host Memory),通过异步 Prefetch 与计算重叠,不长期占用 GPU 显存。
说透一点
支柱 4<优化器与配平>优化器与配平> — Muon + 重新拟合的 Scaling Law
训练侧换用 Muon Optimizer(基于矩阵正交化的现代优化器),针对正交化精度、参数分工、融合矩阵拆分做了工程化改造;并为这套全新架构重新拟合了 Scaling Law——这句轻描淡写很要紧<旧配方预测不了新算力价格>旧配方预测不了新算力价格>,敢重训一条曲线,说明阿里打算把这代架构一路 Scale 到 Qwen4 的更大尺寸,Flash 只是这条曲线上的第一个量产点。
把四柱合起来算总账,才看得懂官方那句「训练成本 1/9」<注意力混合砍计算主干>注意力混合砍计算主干>、GR 砍带宽、N-gram 砍显存、Muon 砍迭代次数、Scaling Law 砍试错——五个成本项,逐项过刀。
五、别只看亮的地方<五个短板>五个短板>
按老规矩,亮点讲完翻底牌。Qwen3.8-Flash 发布不足 24 小时,以下每一条都有出处,但同样要等复测。
**短板 1<锚点降级>锚点降级>——它对标的是 Opus 4.6,不是 4.8。**官方全部基准比较的假想敌是 Claude Opus 4.6——一款 2025 年的上一代旗舰;「接近 Opus 4.8」只出现在定性描述里,没有对应的同框表格。对比智谱同晚「AA 57 = Opus 4.8 57」的第三方硬锚,阿里的成绩单保守了一个身位。这不是说它在撒谎,而是说:**它真正的对手位(与 GLM-5.3-Flash、Gemini 3.7 Flash 同档)还没有被独立评测盖章。**截至发稿,Artificial Analysis 未收录 Qwen3.8-Flash 的独立指数——57/58 分之争,结论留白。
**短板 2<六项同框>六项同框>,目前 1 胜 4 负 1 平。**DataLearner 收录的 GLM vs Qwen 直接对比
短板 3:「能想」是家族体质,Flash 存疑。三周前的 27B 暴露过同一问题
**短板 4<高并发与稳定性>高并发与稳定性>,正是低激活架构的必答题。**6B 激活意味着吞吐上限漂亮,但也意味着每次前向的「决策厚度」有限——新浪博主谢小斌和 @Tech森 的提醒属于同一类:**低激活算力能否稳住高并发、稀疏 MoE 的输出波动、复杂任务的稳定性,需要开发者实测,纸面跑分不算数。**智谱至少还有 42T tokens 公测流量做背书,阿里这台的「公测数据」发布时是零。
短板 5<协议与服务细则留白>协议与服务细则留白>,别把「开源」读成「 Apache 全家桶」。发布当晚各家报道均未注明 Flash 权重许可证,而家族前例并不统一
六、选型建议 — 双 Flash 对决,到底怎么选
先给双雄速查卡:
| 维度 | Qwen3.8-Flash | GLM-5.3-Flash |
|---|---|---|
| 体量 | 125B + 51B 外挂 / 激活 6B | 320B / 激活 18B |
| 独立指数 | 未见 AA 收录(发稿时) | AA 57,与 Opus 4.8 持平 |
| 原生上下文 | 262K(YaRN→1M) | 1M 原生 |
| 国内牌价 | ¥1 / ¥3 | ¥0.8 / ¥2.8(限时五折) |
| 训练成本叙事 | 上代的 1/9 | 未提(主打推理降本 3-4.4 倍) |
| 实测背书 | 发布即开源,零公测流量 | 6 天 60T+ tokens 匿名公测 |
| 许可证 | 待确认(Max 系有自定义前例) | MIT |
| 生态位 | 千问办公内置、阿里云全栈 | Coding Plan、ZCode、国产芯片集群 |
再按场景给结论(判断基于 8/27 前公开数据,一周后以复测为准):
| 你的场景 | 建议 | 理由 |
|---|---|---|
| 海量高并发 API、客服/内容流水线、数据抽取 | Qwen3.8-Flash | 6B 激活的吞吐经济性 + ¥3 输出价 + 云厂商 SLA;威易网横评的默认选项 |
| 日常办公自动化、文档/PPT/表格产出 | Qwen3.8-Flash(千问办公) | 官方口径 95% 日常办公覆盖,模型 × Harness 联合优化是它的主场 |
| 移动端/具身/GUI Agent(手机操作、机器人) | Qwen3.8-Flash | AndroidWorld 84.5、ERQA 领先 31.5 分,多模态 Agent 是四柱架构的直接受益项 |
| 长链路编码 Agent、大仓库重构、严谨工具流 | GLM-5.3-Flash | 六项同框 4 胜、原生 1M、公测流量淬炼过 |
| 安全敏感、需可审计私有化 | GLM-5.3-Flash(MIT)或等 Qwen 许可证落地 | 许可条款清晰度当前智谱占优;Qwen 若给 Apache 2.0 则天平翻转,需盯模型卡 |
| 预算极致的批处理(夜间/闲时) | 两家都测,按任务成本签 | ¥2.8 vs ¥3 的牌价差可忽略,真实差距在 token 消耗率与重试率,拿你的任务各跑一天 |
| 只想本地玩 | Qwen3.8-27B 仍是甜点位 | 17.9GB 量化进 4090;Flash 的 125B 权重 FP8 也要 ~125GB 级,高内存工作站才行,51B N-gram 卸载吃 DDR 内存 |
三句心法,沿用上一篇并加一句:别拿 6B 冲上限,拿它做「次数」;别信厂商的锚点,自己换基准;别比牌价比任务——尤其是把「思考长度」这一隐形变量算进账单。
七、关键术语速查
| 术语 | 大白话版本 |
|---|---|
| GDN(Gated DeltaNet) | 门控线性注意力<用>用>「递推状态」记住读过的内容,成本近线性;负责速读,不存原文全文 |
| QSA(Qwen Sparse Attention) | 阿里自研稀疏注意力<轻量索引器按>轻量索引器按> micro-block(小块) 粒度挑出该精读的上下文;Prefill/Decode 最高加速 7.6×/4.9× |
| Gated Residual(GR) | 把Transformer的1条残差「主干道」拆成 4 条并行分支,用门控动态读写;还能 FP8 存状态,省带宽 |
| N-gram Embedding | 51B 参数的「大词典」外挂<按局部片段查表补充容量>按局部片段查表补充容量>,不参与每 token 矩阵运算,可放内存、异步预取 |
| Muon Optimizer | 基于矩阵正交化的新一代优化器,替代 Adam 家族;小模型/新架构上收敛更快,阿里为其重做了工程细节 |
| YaRN | 位置编码外推技术<把原生>把原生> 262K 的「视野」拉长到 1M 的常规手段,零训练成本的长上下文升级 |
| MTP(Multi-Token Prediction) | 一次预测多个未来 token + 投机解码;27B 内置(接受率 84-92%),本地推理能跑快的关键 |
| Dense vs MoE | 27B 稠密「全员到岗」<部署简单但每>部署简单但每> token 算力固定;Flash 稀疏「点名上岗」<省算力和带宽>省算力和带宽>,但显存驻留不变 |
| 「智能密度」 | 每分钱/每瓦特/每 GB 显存里装多少有效智能——2026 年模型竞争的新计分方式 |
| CoWorkBench / JobBench | 专业工作类基准<模拟办公室任务链与职业任务>模拟办公室任务链与职业任务>(简历、报告、合同),Flash 的两大得分区 |
| 「Next」后缀 | Qwen 的架构试验田标识——Flash-Next 即 Qwen4 架构的技术预览,现网生产版以 Qwen3.8-Flash 提供服务 |
| 千问办公 | 阿里的 AI 生产力平台(8 月财报电话会重点),Flash 首发嵌入其标准模式 |
| OpenSandbox | 阿里 8/14 开源的 Agent 沙箱(代码/网页/完整桌面三模式,5 语言 SDK),与 27B 组成「本地 Agent 四件套」的另一半 |
八、FAQ — 6 个被问得最多的问题
Q1
Q2
Q3<做>做> Coding Agent,今晚该把主力切到哪个 Flash? A<拆场景>拆场景>。长链路、大仓库、多步工具编排、GLM Coding Plan 已订阅 → GLM-5.3-Flash(六项同框 4 胜、原生 1M、42T tokens 公测淬炼);轻量高频、IDE 内联补全、夜间批处理、预算卡死 → Qwen3.8-Flash(6B 激活的单位经济性更狠)。最稳的做法上周就写过:两三家 Flash 各跑一天真实任务,统计「每成功任务成本 + 一次通过率」,谁赢听账单的。
Q4<训练成本降>训练成本降> 90%,对整个行业意味着什么? A<意味着三件事>意味着三件事>。其一,前沿能力的复刻成本跌了一个数量级——DeepSeek 当年用 MLA 干过一轮的事,Qwen 用「GDN+QSA+GR+N-gram+Muon」组合拳再干一轮,后来者的门票价被共同下拉;其二,试错节奏变快,同样的预算够训 9 版,模型迭代的瓶颈从算力排队变成想法排队;其三,对闭源阵营最难堪的推论:**智谱与阿里如今互相用十分之一的价格贴身肉搏,说明他们眼里的「利润」已经让位于「分发」,前沿模型的超额利润期正在中国厂商之间互相终结。**摩根大通的框架<纯低价不可持续>纯低价不可持续>,结构性效率才可持续——两家各占一半,所以两家都活着。
Q5<怎么用上它>怎么用上它>?有什么坑? A:途径三件套<①>①> 千问办公(标准模式已内置,免费/订阅入口);② 千问 AI 平台 API(¥1/¥3,即将全面开放,以平台页为准);③ HuggingFace / ModelScope 拉权重(搜 Qwen/Qwen3.8-Flash-Next)。三个坑提前标注:许可证以模型卡为准,别按 27B 的 Apache 2.0 惯性假设;原生 262K、扩到 1M 靠 YaRN,超长任务先看效果衰减再看宣传;评测若用非官方 Harness,分数可能比官方口径低——知乎那篇换芯指南的原话<新模型对自家壳子普遍存在过拟合>新模型对自家壳子普遍存在过拟合>。
Q6<同一晚智谱发>同一晚智谱发> GLM-5.3-Flash,是不是故意的?阿里不怕被压分吗? A<大概率是半故意的>大概率是半故意的>。两家都在抢「8 月最后一周」的发布窗口,DeepSeek 提价后的低价真空、Kimi K2.5 月底退役的换芯潮、九月云栖/秋季硬件季的流量,都是必须抢的滩头。被 GLM 压分这个风险,阿里的对冲清晰可见<不跟你比编码长程>不跟你比编码长程>,把战场拉到「训练成本 1/9 + Qwen4 雏形 + 云端生态」这三个 GLM 没有维度的维度上。同夜对垒的真正输家,是还挂着旧牌价的所有第三方 Flash——Gemini 3.7 Flash 的 $3.75 促销价(12/31 后恢复 $7.5)、Kimi K3 的 ¥100 输出,在一夜间都变得需要解释。
**一句收口:智谱证明「前沿智能不必有前沿价格」,阿里这次补的下半句是——「前沿智能也不必有三倍算力」。**两句话合在一起,才是 2026 年 Q3 真正的战报。
九、参考资料
官方发布与基准
- Qwen 官方技术博客
.ai/blog?id=qwen3.8-flash-next;技术报告见 QwenLM/Qwen3.8-Flash-Next GitHub 仓库 - 开源权重
.co/Qwen/Qwen3.8-Flash-Next;ModelScope /Qwen3.8-Flash-Next(含 FP8 版) - 千问 AI 平台 API 定价<阿里云百炼>阿里云百炼>/千问 AI平台定价页(¥1/¥3 口径来自官方发布)
- 「千问办公」入口与说明<阿里官方发布材料>阿里官方发布材料>(8/26)
- Artificial Analysis 智能指数 v4.1.1(Qwen3.8-Max 58、Qwen3.8-27B 52 收录页)
第三方评测与媒体
- IT之家/新浪财经/凤凰网:《阿里通义 Qwen3.8-Flash 发布开源<125b>125b> 参数 MoE,训练成本仅为前代 1/9》(8/26)
- 界面新闻:《阿里千问正式发布 Qwen3.8-Flash》(8/26)
- 新京报贝壳财经、上海证券报、紫牛新闻、潮新闻、广州日报<8>8>/26-8/27 发布报道(四大架构支柱与基准分差的集中来源)
- 什么值得买/快科技:《超越 V4 Flash<千问>千问> Qwen3.8-Flash 大模型开源》(8/26,含 $0.16/$0.47 美元牌价与 DeepSWE 58.7 等绝对值)
- DataLearner、llm-stats
.3-Flash vs Qwen3.8-Flash-Next 同框对比页(8/26) - 威易网
/ GLM-5.3-Flash / Qwen3.8-Flash 三 Flash 横评(8/26) - 知乎专栏:《Qwen3.8-27B 就是新的模型斩杀线》(8/21)、27B AA 52 分与本地部署实测长文
- 掘金:《阿里一日双发
.8-27B + OpenSandbox》(8/15) - DeepSeek 技术社区/开放原子:《AI 大模型日报 8/21》(Qwen3.8-Max 2.4T 开源细节、阿里财报、Grok/Gemini 背景)
- 摩根大通研报(8/16,via 华尔街见闻/雪球)
相关阅读
- 本系列上一篇:《GLM-5.3-Flash 深度解读<57>57> 分追平 Opus 4.8、价格只有 1/40、全部公测流量跑在国产芯片上》
- 什么值得买:《Kimi K2.5 月底退役,GLM-5.3 与 Qwen3.8 同月接棒<换芯先看能不能买到>换芯先看能不能买到>》(8/25)
数据截至 2026 年 8 月 27 日,Qwen3.8-Flash 的全部基准均为厂商自报、AA 独立指数尚未收录——本文所有「超越/接近」的表述请自动加「官方称」。但两条已经发生的事实不需要等复测<同晚两台>同晚两台> Flash 的牌价差不到两块钱,以及,造一台这样的机器的成本,掉到了九分之一。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





