通义万相 2.7:把”导演审美”写进模型的国产之光
更新时间:2026 年 8 月 5 日 | 厂商:阿里巴巴通义实验室 | 定位:全模态视觉生成(图像/视频/音频)
一、模型概述
通义万相(Wan)是阿里巴巴通义实验室研发的视觉生成大模型。当前 API 旗舰为 Wan 2.7 系列(2026 年 4 月发布),涵盖文生视频、图生视频、参考生视频、视频编辑四大专业模型;开源侧止步于 Wan 2.2(2025 年 8 月,MoE 架构 27B 参数/14B 激活),是业界最早采用 MoE 的视频模型之一,并首创”电影美学控制系统”。2026 年 4 月,阿里 ATH AI 创新单元的 Happy Horse 1.0 登顶 Artificial Analysis 视频生成竞技场(与 Wan 为独立模型线)。
二、核心能力
1. 四大专业模型(Wan 2.7 主线)
| 模型 | 功能 |
|---|---|
| wan2.7-t2v | 文生视频 |
| wan2.7-i2v | 图生视频(首帧/尾帧控制) |
| wan2.7-r2v | 参考生视频(角色/物体/音色一致 + 声音克隆) |
| wan2.7-videoedit | 指令式视频编辑(局部重绘) |
2. 输出规格
- 标准版支持 2K 分辨率,Pro 版最高 4K(4096×4096)
- 视频最长约 15 秒,电影级画质
- 文生图、文生视频、图生视频、视频编辑全覆盖
3. 音画同步
- 生成视频时同步匹配人声、音效与口型,音视频一体化创作
4. 高级控制
- 角色一致性保持、运镜控制、首尾帧控制、局部视频重绘
- 电影美学控制系统(Wan 2.2 首创):光影、色彩、构图、微表情贴近专业电影水平
- 支持中英文及全球 12 种主流语言提示词理解
5. 开源生态(Wan 2.1 / 2.2)
- 权重已在 GitHub、HuggingFace、魔搭社区开源
- Wan 2.2:MoE 27B(激活 14B),文生/图生/统一视频生成三模型
- 本地部署门槛:14B 全精度需 40GB+ 显存,量化后 24GB 消费卡可跑;另有 1.3B 轻量版(8GB 显存可跑)
- Apache 2.0 许可,无商用限制——开源视频模型中最宽松的授权之一
三、版本时间线
| 时间 | 版本 | 要点 |
|---|---|---|
| 2024 中 | Wan 1.x | 通义万相初代 |
| 2025.07 | - | 入选”2025 全球百大 AI 应用”;支持央视春晚等国家级项目 |
| 2025.08 | Wan 2.2(开源) | MoE 27B、电影美学控制系统 |
| 2026.04 | Wan 2.7 | 四模型家族、2K/4K、音画同步、声音克隆 |
| 2026.04 | Happy Horse 1.0 | 阿里 ATH 单元,登顶 Video Arena(独立模型线) |
四、接入方式
- 普通用户:通义 App(原千问 App)、通义万相官网
- 开发者:阿里云百炼(Model Studio)API
- 开源社区:魔搭(ModelScope)、HuggingFace、GitHub 权重下载
五、优势与短板
✅ 优势
- MoE 架构高效,消费级显卡可本地部署(量化后)
- 电影美学控制(光影/构图/微表情)独有特色,画质审美在线
- 参考生视频 + 声音克隆,角色与音色双锚定
- 开源许可最宽松(Apache 2.0),商用无忧
⚠️ 短板
- 官方开源止步 2.2,2.5/2.6/2.7 权重未开源
- 单次视频 15 秒,长叙事需拼接
- 中文语境强、英文与海外审美略有差距(相对 Veo/FLUX)
六、适用场景
- 广告、品牌短片(电影质感要求高)
- 电商内容、产品动画(首尾帧控制)
- 角色 IP 内容(参考生视频 + 声音克隆)
- 本地部署 / 私有化需求的开发者
- 中文语境短视频与营销内容
七、技术深析:MoE 与电影美学控制系统
- MoE 架构(Wan 2.2 起):业界最早采用 MoE 的视频模型之一——27B 总参数 / 14B 激活参数,用”稀疏激活”在相近算力下获得更大模型容量,兼顾质量与效率;
- 电影美学控制系统(业界首创):把光影、色彩、构图、微表情等电影美学要素作为显式控制信号注入生成过程,而非单纯”提示词里写风格”——模型内部有一套”导演审美”先验;
- Composer 组合式生成框架:将配色、布局、风格等设计元素拆解重组,支持局部编辑与尾帧指定,实现从”演”到”导”的控制跨越;
- 四大专业模型分工(Wan 2.7):t2v(文生)/ i2v(图生,首尾帧控制)/ r2v(参考生,角色+音色)/ videoedit(指令式视频编辑)——不同任务各司其职,接口与定价独立;
- 音画同步:人声、音效与画面口型同步生成,支持 12 种语言提示词理解。
八、版本演进全记录(Wan 1.0 → 2.7)
| 版本 | 时间 | 关键节点 |
|---|---|---|
| Wan 1.x | 2024 | 通义万相系列起步(文生图为主) |
| Wan 2.1 | 2025 前中期 | 开源(14B / 1.3B),Apache 2.0 |
| Wan 2.2 | 2025.08 | 开源旗舰:MoE 27B/14B、电影美学控制系统(开源止步点) |
| Wan 2.5 / 2.6 | 2025 后期-2026 初 | API 迭代(未开源权重) |
| Wan 2.7 | 2026.04 | 现役 API 旗舰:四大专业模型、2K/4K、音画同步 |
| Happy Horse 1.0 | 2026.04 | 阿里 ATH AI 创新单元独立模型线,登顶 Video Arena(与 Wan 分开) |
⚠️ 注意:官方开源止步于 Wan 2.2;网上流传的”Wan 3.0 开源/4K/30 秒”信息经核实为第三方预测,阿里官方未发布 Wan 3.0。
九、开源 vs API 怎么选
| 维度 | 开源(Wan 2.2) | API(Wan 2.7) |
|---|---|---|
| 能力 | 文生/图生视频,720p/81 帧 | 四大专业模型,2K/4K,首尾帧/参考/编辑 |
| 成本 | 仅算力(Apache 2.0 无授权费) | 按量计费 |
| 部署 | 本地/私有化(24GB 显卡可量化跑) | 免部署,随用随调 |
| 适用 | 数据敏感、批量生产、二次开发 | 最新能力、快速上线、影视级需求 |
推荐:追求最新能力与影视级输出走 API;需要私有化、高频、成本可控走开源 Wan 2.2。
十、接入与使用
- 网页端:通义万相官网(tongyi.aliyun.com/wanxiang)与通义 App(集成万相,含”AI 小剧场”玩法);
- API:阿里云百炼平台,支持函数计算部署视觉生成应用;
- 开源:GitHub / HuggingFace / 魔搭社区获取 Wan 2.1/2.2 权重与推理代码;
- 海外:已接入 inference.sh、Eachlabs 等海外 AI 平台提供 API。
十一、与可灵 / Seedance 对比
| 维度 | 万相 2.7 | 可灵 3.0 | Seedance 2.5 |
|---|---|---|---|
| 单次时长 | 15 秒 | 15 秒 | 30 秒(3 分钟超长) |
| 分辨率 | 2K/4K(Pro) | 1080p | 1080p |
| 美学控制 | 电影美学控制系统(独家) | 智能分镜 | 多参考+编辑 |
| 开源 | ✅(2.2 Apache 2.0) | ❌ | ❌ |
| 中文 | 优秀 | 优秀 | 优秀 |
| 声音克隆 | ✅(r2v) | ✅(音色绑定) | 有限 |
结论:万相的最大差异化是”开源+电影美学+4K”组合;行业事件上,其曾为央视春晚等国家级项目提供技术支持,复杂物理规律模拟与动态场景生成稳定性经受过验证。
十二、风险与注意事项
- 开源落后一代:本地只能拿到 Wan 2.2,最新 2.7 能力需 API;
- 模型线易混淆:通义万相(创作)与阿里妈妈”AI 万相”(电商经营智能体)是两个产品,别搞混;
- “Wan 3.0”传闻:以官方发布为准,勿轻信第三方规格表;
- 版权合规:参考生视频(r2v)涉及真人/品牌素材时需授权。
十三、常见问题 FAQ
Q1:万相有免费体验吗? 通义 App 与官网提供免费额度,可体验文生/图生视频;API 与 4K 档位按量付费。
Q2:开源版能商用吗? Wan 2.2 采用 Apache 2.0 许可,无商用限制,可放心用于商业项目与二次开发。
Q3:怎么保持角色一致性? 使用 r2v(参考生视频)上传角色图片/视频,可同时绑定音色;i2v 支持首尾帧精确控制。
Q4:支持哪些语言? 中英文及全球 12 种主流语言提示词理解,输出音画同步。
Q5:Happy Horse 是什么? 阿里 ATH AI 创新单元的独立视频模型(与 Wan 分开),2026 年 4 月登顶 Artificial Analysis 视频竞技场;有报道称其能力被市场高度关注,但产品化路径未明。
资料来源:阿里云百炼、通义万相官方、Wan-Video GitHub/HuggingFace、行业评测。数据截至 2026-08-05。
如果这篇文章对你有帮助,欢迎分享给更多人!
部分信息可能已经过时





