Wan 3.0 评测:我体验了其 30 秒 AI 视频工作流

GoEnhance AI

我查看了 Wan 3.0,因为它承诺提供比 AI 视频质量的小幅提升更有用的东西:一个更长、更完整的创作工作流。

WAN 3.0 REVIEW.jpg

公开测试版信息显示,它支持 30 秒生成、多达 20 个参考素材、原生音频、文档输入、更强的连贯性以及针对性的视频编辑。我还准备了三个高难度提示词,以测试它在精美演示之外的实际表现。

我的简短评价:对于短剧、广告、产品视频以及其他需要多个精彩镜头的项目,Wan 3.0 非常值得一试。它最大的优势在于将工作流的多个环节整合在了一起。

对于任何选择 AI 视频生成器的人来说,关键问题在于这些额外的控制功能是否能产生更实用的结果,而不仅仅是功能列表的堆砌。

不过,它目前仍处于公开测试阶段。我不建议期望每一个 30 秒的片段都能在无需重新生成或编辑的情况下直接发布。

1. Wan 3.0 评测:简要总结

对于希望在一个平台上实现更长片段、多个参考文件、同步音效和编辑控制的创作者来说,Wan 3.0 正成为一个强有力的选择。

评测要点我的看法
最适合AI 短剧、广告、电商视频、产品演示和教学内容
最强功能单次生成时长可达 30 秒
最实用的工作流升级将图像、视频、音频和文档作为参考素材整合
不太适合对连贯性或文本错误零容忍的一键式最终视频
最大局限性更长的片段仍会增加画面漂移和小错误的几率
我的结论前景广阔且实用,但请做好多次生成的准备

2. 什么是 Wan 3.0?

Wan 3.0.webp

Wan 3.0 是阿里巴巴推出的全新多模态 AI 视频生成与编辑模型。根据本文所参考的发布信息,公开测试版于 2026 年 8 月 6 日开放。Wan 官方网站是了解当前产品体验和可用性的最佳渠道。

它不仅接受文本提示词。据公告,其输入支持文本、图像、视频、音频以及 DOC、XLS、PPT、PDF 和 Markdown 等文档。

该模型支持 480P、720P 和 1080P 输出。单次生成时长最长可达 30 秒,系统还能根据提示词推荐合适的时长。

Wan 3.0 同时也被定位为视频编辑器。用户可以在保留现有片段主体结构的同时,更改人物、产品、服装、背景、台词或选定的时间范围。

立即尝试 Wan 3.0
  1. 令我印象深刻的地方

完整的 30 秒生成

30 秒的限制是我首先注意到的功能。

30-SECOND GENERATION.jpg

五到十秒足以完成一个动作或视觉特效。而 30 秒则为模型提供了足够的空间来展示角色出场、冲突、回应和结局。

这可以减少拼接多个短片段的需求。它还有助于避免在分别生成的镜头之间经常出现的面部变化、服装重置、道具漂移、声音中断以及重复的情绪起伏。

更长并不自动意味着更连贯。尽管如此,我宁愿从一个连贯的 30 秒尝试开始,并修复薄弱环节,也不愿从不相关的片段中重新构建整个序列。

多达 20 个参考素材

据报道,Wan 3.0 在一个任务中可以使用多达 20 个参考素材。

20 REFERENCE ASSETS.jpg

这非常有用,因为严肃的视频提示词通常需要比文本所能承载的更多的信息。创作者可以提供角色图像、产品照片、场景参考、动作视频、音乐和品牌文档,而不是在一段长文中描述所有内容。

参考类型我的使用场景
文本故事、动作、镜头运动、氛围和风格
图像角色、服装、产品、场景和视觉识别
视频动作、表演、镜头语言、节奏或剪辑结构
音频对话、音乐、音效和时序
PPT、PDF、DOC、XLS 或 MD产品事实、课程、报告或故事信息

公告的文件限制为每个文件 100 MB 和 50 页。由于服务仍处于测试阶段,在上传生产文件前应再次核实这些限制和支持的格式。

更好的角色和场景控制

Wan 3.0 旨在保持面部、发型、体型、服装、配饰、产品包装、道具和光影在整个序列中的稳定性。

当镜头改变距离时,这一点尤为重要。角色在特写镜头中可能看起来很正常,但在广角镜头中却变成了另一个人。当某人走到柱子后面再出现时,也会发生同样的问题。

对于短剧和多角色视频,连贯性比完美的单帧画面更有价值。如果主角在场景中途变了样,那么一个漂亮的开场镜头也无济于事。

更实用的镜头和故事控制

该模型预计能够理解推拉镜头、平移、追踪镜头、过肩视角、特写、广角、前景过渡、蒙太奇序列以及音乐驱动的剪辑。

我感兴趣的不是它能识别多少镜头术语。我想知道的是,镜头是否有助于按正确的顺序揭示信息,以及在镜头移动后,场景逻辑是否依然合理。

这就是为什么我的测试提示词之一使用了没有剪辑的连续空中追逐镜头。当镜头从未离开场景时,隐藏破碎的道路或被替换的汽车要困难得多。

视频原生音效

Wan 3.0 可以同时生成对话、唇形动作、环境音、动作特效、音乐和画面。

这可以节省短剧、广告和社交视频的制作时间。创作者可能不再需要导出静音视频、寻找单独的音效、录制配音并事后修复口型同步。

在使用音频之前,我仍会仔细聆听。公开测试报告指出,在语音质量、空间音频以及动作与音效的匹配度方面,仍有改进空间。

针对性视频编辑

编辑功能可能比从头开始生成更有用。

Wan 3.0 旨在保留原始构图、运动、时序、剪辑、对话、字幕、景深和色彩,同时仅更改请求的部分。

例如,创作者可以替换产品、更换服装、更新背景、重写一行台词或修复几秒钟的瑕疵。这比因为一个细节失败而丢弃一个大部分都很成功的 30 秒片段要好得多。

文档可作为视频输入

据报道,Wan 3.0 可以读取 PPT、Word、PDF、Excel 和 Markdown 文件。

这开启了一种不同的工作流。产品团队可以将演示文稿与产品图像结合起来。教师可以使用课程文档。营销团队可以同时提供品牌信息和视觉参考。

该模型不仅仅是试图将句子变成片段,它还在尝试将现有信息转化为视频草稿。

  1. Wan 3.0 定价

公布的 API 价格基于成功生成的视频时长。

分辨率每秒价格15 秒成本30 秒成本
480P¥0.30¥4.50¥9.00
720P¥0.60¥9.00¥18.00
1080P¥1.20¥18.00¥36.00

单次 30 秒生成的定价对于测试来说是合理的。预算的增长主要源于反复尝试。

如果我需要生成八次才能得到一个可用的 1080P 片段,实际成本将远高于表中显示的 ¥36。我会先在较低分辨率下测试提示词,然后再将最佳设置迁移到 1080P。

定价和访问权限在测试期间可能会发生变化。在评估实际项目之前,请查看 阿里云百炼模型服务视频生成文档和百炼控制台。

  1. Wan 3.0 的优缺点

优点

  • 单个片段最长可达 30 秒。
  • 文本、图像、视频、音频和文档可以作为参考协同工作。
  • 多达 20 个素材让创作者对角色、产品和风格拥有更多控制权。
  • 原生音效可以减少单独的配音和音频处理工作。
  • 针对性编辑可以在仅有部分瑕疵时挽救一个好的片段。
  • 文档输入使该模型在娱乐视频之外也具有实用价值。

缺点

  • 更长的片段增加了面部、道具和场景漂移的可能性。
  • 快速打斗和身体重叠仍可能产生手部或肢体错误。
  • 小字、包装文案和字幕可能无法保持准确。
  • 音频可能存在同步问题,且缺乏自然的深度或空间感。
  • 同一个提示词可能需要多次尝试。
  • 公开测试版的定价、访问权限和 API 细节可能会发生变化。
  1. Wan 3.0 的最佳使用场景
使用场景Wan 3.0 的适配方式
AI 短剧构建一个包含对话、角色参考和连贯镜头运动的 20-30 秒场景
动画故事在多个镜头中保持 2D、3D、奇幻或游戏风格角色的统一
产品广告结合产品照片、模特参考、音乐和预设的产品展示
电商视频将产品图像和描述转化为短演示或卖点片段
教学内容将 PPT、PDF、Word 文件或报告转换为视觉讲解
产品演示在一个序列中展示结构、设置、使用方法和物理交互
局部视频修复替换人物、道具、台词或薄弱的时间段,无需重做整个视频
电影预演在制作前探索场景、镜头规划、氛围和动作
音乐视频使用音乐来引导运动、剪辑和视觉氛围

我认为最好的用户是那些已经拥有有用素材的人。当创作者带来角色图像、产品参考、文档或现有视频时,Wan 3.0 的意义远大于仅仅想要一个随机的电影感片段。

  1. 什么是 Agent Team?

Agent Team 是围绕 Wan 3.0 构建的工作流,它本身并非模型。

不同的智能体可以分别担任编剧、导演、艺术总监、分镜师和视频生成器。用户提供想法、文档或网页,系统将其拆解为故事节拍、镜头、角色、场景和素材。

这看起来比单一提示词更适合完整的视频项目。该功能目前描述为仅限受邀使用,因此我不会将其视为已全面开放。

  1. Wan 3.0 的不足之处

30 秒让错误有更多出现的时间

更长的生成时长很有价值,但也给了模型更多丢失细节的机会。

面部可能变模糊,道具数量可能改变,车辆可能从物体后方以错误的位置返回,或者背景可能缓慢地自我重构。我会比检查开场镜头更仔细地检查每个长片段的后半部分。

复杂的接触仍是难题

手部动作、打斗、产品使用以及多人触碰对于任何视频模型来说都是困难的。

Wan 3.0 可能创造出正确的整体动作,却错过了精确的接触点。这对于快速概念视频是可以接受的,但对于需要展示精确物理步骤的产品演示来说则不然。

文本需要人工核对

小标签、字幕、标志和产品包装仍可能出错。

对于商业视频,除非生成的文案经过逐帧核对,否则我会使用该模型制作场景,并在之后添加重要的文本。

原生音频并非最终音频

音频生成是一个有用的捷径,而不是成品音效的保证。

对话可能感觉与面部略有脱节,环境音可能缺乏深度,冲击音效可能无法在精确的帧点落下。重要的广告活动可能仍需要专业的配音、音乐或音频清理。

  1. 我接下来要测试的内容

我为这次 Wan 3.0 评测准备了三个压力测试提示词。由于我尚未验证它们的输出文件,我将它们视为测试计划,而非已发布的实测结果。

测试 1:肌肉车变身为泰坦

一辆布满灰尘的肌肉车在废弃的桥上疾驰,通过可见的液压和机械阶段进行变形,锚定在道路上,并开火发射胸部安装的能量炮。

此测试检查部件到部件的变形、重量、后坐力、火花、烟雾、破坏以及因果关系。主要问题在于最终的机器人是否仍然感觉是由原始汽车构建的,而不是看起来像是一个替代品。

测试 2:废弃地铁中的近身格斗

一名粉色头发的女性与一名大型保安打斗,手持摄像机在柱子、长椅和静止的火车之间跟随他们。

此测试检查在快速重叠过程中的身份、服装、肢体、接触、身体重量和环境稳定性。最困难的时刻是角色互相遮挡或经过柱子后方时。

测试 3:12 秒一镜到底的拉力赛追逐

一辆红色拉力赛车穿过三个雪地发夹弯,空中摄像机在不剪辑的情况下跟随。汽车消失在石桥下方,在正确的道路上返回,避开一块巨石,并到达安全的直道。

这是我最信任的测试。它检查道路拓扑、镜头连贯性、车辆物理、完全遮挡、物体恒存、声音进程,以及汽车在被隐藏后是否以同一辆车的身份返回。

对于所有三个测试,我将比较提示词遵循度、主体连贯性、运动、物理因果关系、镜头控制、音频以及获得一个可用结果所需的尝试次数。

10. 最终结论:Wan 3.0 值得尝试吗?

如果你需要的不仅仅是一个短视觉特效,Wan 3.0 是值得尝试的。

它最好的理念不仅仅是 30 秒生成,而是长视频、多个参考素材、原生音效、文档理解和针对性编辑的结合。

我会将其用于短剧草稿、产品概念、电商视频、教学内容和预演。对于精确的产品动作、小字文本、复杂的打斗以及任何必须在第一次生成时就准确无误的项目,我会更加谨慎。

我的最终评价:Wan 3.0 看起来有能力制作完整场景的初稿,而不仅仅是一个吸引人的镜头。这是一个有意义的进步,即使创作者仍需要对结果进行审查、重新生成和编辑。

11. Wan 3.0 评测常见问题解答

什么是 Wan 3.0?

Wan 3.0 是阿里巴巴的多模态 AI 视频生成与编辑模型。它接受文本、图像、视频、音频和多种文档格式。

Wan 3.0 可以生成多长时间的视频?

单次生成的最长时长为 30 秒。

Wan 3.0 API 的费用是多少?

公布的价格为:480P 每秒 ¥0.30,720P 每秒 ¥0.60,1080P 每秒 ¥1.20。测试版定价可能会有变动。

Wan 3.0 可以生成音频吗?

Wan 3.0 旨在与视频一起生成对话、唇形动作、环境音、动作特效和音乐。

Wan 3.0 可以读取文档吗?

公告的输入支持 DOC、XLS、PPT、PDF 和 Markdown 文件。规定限制为每个文件 100 MB 和 50 页。

Wan 3.0 是开源的吗?

本文所参考的信息并未正式确认 Wan 3.0 模型权重已发布。请查看 Wan 官方 GitHub 组织以获取阿里巴巴公开发布的 Wan 仓库;托管的公开测试版或 API 不应与开源权重发布混淆。

什么是 Wan 3.0 Agent Team?

Agent Team 是围绕 Wan 3.0 构建的多智能体视频工作流。它可以将工作分配给编剧、导演、艺术总监、分镜师和视频生成器等角色。