Wan 3.0 評測:我實測了它 30 秒的 AI 影片工作流程
我測試了 Wan 3.0,因為它承諾提供比 AI 影片品質的小幅提升更有用的功能:一個更長且更完整的創作工作流程。

公開測試版資訊顯示,它支援 30 秒生成、最多 20 個參考素材、原生音訊、文件輸入、更強的連貫性以及針對性的影片編輯。我還準備了三個高難度提示詞,看看除了精美的演示之外,它在實際測試中的表現如何。
我的快速評價:對於短劇、廣告、產品影片以及其他需要多個吸引人鏡頭的專案,Wan 3.0 非常值得一試。它最大的優勢在於整合了工作流程中的多個環節。
對於任何選擇 AI 影片生成器的人來說,關鍵問題在於這些額外的控制功能是否能產生更實用的結果,而不僅僅是功能列表的堆砌。
不過,這仍然是一個公開測試版模型。我不會期望每一個 30 秒的片段都能在不進行二次生成或編輯的情況下直接發布。
1. Wan 3.0 評測:總結 (TL;DR)
Wan 3.0 正成為創作者的強大選擇,適合那些希望在同一個平台上獲得更長片段、多個參考檔案、同步音效和編輯控制功能的使用者。
| 評測要點 | 我的看法 |
|---|---|
| 最適合 | AI 短劇、廣告、電商影片、產品演示和教學內容 |
| 最強功能 | 單次生成長達 30 秒 |
| 最實用的工作流程升級 | 結合圖像、影片、音訊和文件作為參考 |
| 不太適合 | 無法容忍連續性錯誤或文字錯誤的一鍵式最終影片 |
| 最大限制 | 更長的片段仍會增加畫面漂移和小錯誤的機率 |
| 我的結論 | 前景廣闊且實用,但請做好多次生成的心理準備 |
2. 什麼是 Wan 3.0?
Wan 3.0 是阿里巴巴推出的全新多模態 AI 影片生成與編輯模型。根據本文審閱的發布資訊,公開測試版於 2026 年 8 月 6 日開放。Wan 官方網站是了解當前產品體驗和可用性的最佳途徑。
它不僅接受文字提示詞。已公布的輸入格式包括文字、圖像、影片、音訊以及 DOC、XLS、PPT、PDF 和 Markdown 等文件。
該模型支援 480P、720P 和 1080P 輸出。單次生成可長達 30 秒,系統還能根據提示詞建議合適的時長。
Wan 3.0 也被定位為影片編輯器。使用者可以在保留現有片段主體結構的同時,更改人物、產品、服裝、背景、對話台詞或選定的時間範圍。
- 讓我印象深刻的地方
完整的 30 秒生成
30 秒的限制是我首先注意到的功能。

五到十秒足以完成一個動作或視覺特效。而 30 秒則為模型提供了足夠的空間來呈現角色出場、問題發生、回應以及結局。
這可以減少拼接多個短片段的需求。它還有助於避免在分開生成的鏡頭之間經常出現的面部變化、服裝重置、道具漂移、聲音中斷以及重複的情緒起點等問題。
更長並不自動意味著更連貫。不過,我寧願從一個連貫的 30 秒嘗試開始,並修復薄弱環節,也不願從不相關的片段中重新構建整個序列。
最多 20 個參考素材
據報導,Wan 3.0 在單個任務中最多可以使用 20 個參考素材。

這非常實用,因為嚴肅的影片提示詞通常需要比文字所能承載的更多資訊。創作者可以提供角色圖像、產品照片、場景參考、動作影片、音樂和品牌文件,而不是在一個長段落中描述所有內容。
| 參考類型 | 我的用途 |
|---|---|
| 文字 | 故事、動作、鏡頭運動、氛圍和風格 |
| 圖像 | 角色、服裝、產品、場景和視覺識別 |
| 影片 | 動作、表演、鏡頭語言、節奏或剪輯結構 |
| 音訊 | 對話、音樂、音效和時機 |
| PPT、PDF、DOC、XLS 或 MD | 產品事實、課程、報告或故事資訊 |
已公布的檔案限制為每個檔案 100 MB 和 50 頁。由於該服務仍處於測試階段,在進行生產上傳之前,應再次確認這些限制和支援的格式。
更好的角色和場景控制
Wan 3.0 旨在保持面部、髮型、體型、服裝、配飾、產品包裝、道具和燈光在整個序列中的穩定性。
當鏡頭改變距離時,這一點尤為重要。角色在特寫鏡頭中可能看起來很正確,但在遠景鏡頭中卻變成了另一個人。當有人走到柱子後面又走出來時,也會發生同樣的問題。
對於短劇和多角色影片,連貫性比單一完美的畫面更有價值。如果主角在場景中途變了樣,那麼一個漂亮的開場鏡頭也無濟於事。
更實用的鏡頭和故事控制
該模型預計能理解推鏡、拉鏡、平移、跟拍、過肩鏡頭、特寫、遠景、前景過渡、蒙太奇序列和音樂驅動的剪輯。
我感興趣的不是它識別的鏡頭術語數量。我想知道的是,鏡頭是否有助於按正確順序揭示資訊,以及場景在移動後是否仍然合理。
這就是為什麼我的一個測試提示詞使用了沒有剪輯的連續空中追逐。當鏡頭從未離開場景時,隱藏破碎的道路或替換的汽車要困難得多。
影片原生音效
Wan 3.0 可以同時生成對話、唇部動作、環境音、動作特效、音樂和圖像。
這可以節省短劇、廣告和社交媒體短片的製作時間。創作者可能不再需要匯出靜音影片、尋找單獨的音效、錄製語音並在事後修復唇形同步。
在使用這些音訊之前,我仍會仔細聆聽。公開測試版的報告指出,在語音品質、空間音效以及動作與效果的匹配度方面,仍有改進空間。
針對性影片編輯
編輯功能可能比從零開始生成更有用。
Wan 3.0 旨在保留原始構圖、運動、時機、剪輯、對話、字幕、景深和色彩,同時僅更改請求的部分。
例如,創作者可以替換產品、更換服裝、更新背景、重寫一句台詞或修復幾秒鐘的瑕疵。這比因為一個細節失敗而放棄一個基本成功的 30 秒片段要好得多。
文件可作為影片輸入
據報導,Wan 3.0 可以讀取 PPT、Word、PDF、Excel 和 Markdown 檔案。
這開啟了一種不同的工作流程。產品團隊可以將簡報與產品圖像結合。教師可以使用課程文件。行銷團隊可以同時提供品牌資訊和視覺參考。
該模型不僅僅是試圖將句子變成片段,它還試圖將現有資訊轉化為影片草稿。
- Wan 3.0 定價
已公布的 API 定價基於成功生成的影片時長。
| 解析度 | 每秒價格 | 15 秒成本 | 30 秒成本 |
|---|---|---|---|
| 480P | ¥0.30 | ¥4.50 | ¥9.00 |
| 720P | ¥0.60 | ¥9.00 | ¥18.00 |
| 1080P | ¥1.20 | ¥18.00 | ¥36.00 |
單次 30 秒生成的價格對於測試來說是合理的。重複嘗試才是預算增加的地方。
如果我需要生成八次才能得到一個可用的 1080P 片段,實際成本將遠高於表中顯示的 ¥36。我會先以較低的解析度測試提示詞,然後再將最佳設定轉移到 1080P。
定價和存取權限可能會在測試期間發生變化。在評估實際專案之前,請查看 阿里雲百煉影片生成文件和百煉控制台。
- Wan 3.0 優缺點
優點
- 單個片段最長可達 30 秒。
- 文字、圖像、影片、音訊和文件可以作為參考協同工作。
- 最多 20 個素材讓創作者能更好地控制角色、產品和風格。
- 原生音效可減少單獨的配音和音訊處理工作。
- 針對性編輯可以在僅有部分瑕疵時挽救一個好的片段。
- 文件輸入使該模型在娛樂影片之外也具有實用價值。
缺點
- 更長的片段增加了面部、道具和場景漂移的機會。
- 快速的打鬥和重疊的身體部位仍可能產生手部或肢體錯誤。
- 小字、包裝文案和字幕可能無法保持準確。
- 音訊可能同步,但感覺不夠自然或缺乏空間感。
- 同一個提示詞可能需要多次嘗試。
- 公開測試版的定價、存取權限和 API 細節可能會變動。
- Wan 3.0 的最佳應用場景
| 應用場景 | Wan 3.0 的契合度 |
|---|---|
| AI 短劇 | 製作包含對話、角色參考和連貫鏡頭運動的 20 到 30 秒場景 |
| 動畫故事 | 在多個鏡頭中保持 2D、3D、奇幻或遊戲風格的角色一致性 |
| 產品廣告 | 結合產品照片、模特參考、音樂和規劃好的產品展示 |
| 電商影片 | 將產品圖像和描述轉化為簡短的演示或賣點片段 |
| 教學內容 | 將 PPT、PDF、Word 檔案或報告轉換為視覺化解釋 |
| 產品演示 | 在一個序列中展示結構、設定、使用方法和物理互動 |
| 局部影片修復 | 替換人物、道具、台詞或薄弱的時間範圍,無需重做整個影片 |
| 電影預覽 | 在製作前探索場景、鏡頭規劃、氛圍和動作 |
| 音樂影片 | 使用音樂來引導運動、剪輯和視覺氛圍 |
我認為最好的使用者是那些已經擁有實用素材的人。當創作者帶來角色圖像、產品參考、文件或現有影片時,Wan 3.0 的意義比僅僅想要一個隨機的電影感片段要大得多。
- 什麼是 Agent Team?
Agent Team 是圍繞 Wan 3.0 構建的工作流程,它並非模型本身。
不同的代理可以分別擔任編劇、導演、藝術總監、分鏡師和影片生成師。使用者提供想法、文件或網頁,系統將其拆解為故事節奏、鏡頭、角色、場景和素材。
這看起來比單一提示詞更適合完整的影片專案。該功能目前描述為僅限受邀使用,因此我不會將其視為已全面開放。
- Wan 3.0 的不足之處
三十秒讓錯誤有更多出現的時間
更長的生成時間很有價值,但也給了模型更多丟失細節的機會。
面部可能會變形、道具數量可能會改變、車輛可能會在物體後面以錯誤的位置返回,或者背景可能會緩慢地自我重構。我會比開場更仔細地檢查每個長片段的後半部分。
複雜的接觸仍是難題
手部動作、打鬥、產品使用以及多人相互接觸對任何影片模型來說都是困難的。
Wan 3.0 可能會創造出正確的整體動作,但卻錯過了精確的接觸點。這對於快速的概念影片是可以接受的,但對於需要展示精確物理步驟的產品演示來說則不然。
文字需要人工檢查
小標籤、字幕、標誌和產品包裝仍然可能出錯。
對於商業影片,除非生成的文字經過逐幀檢查,否則我會使用模型來製作場景,並在事後添加重要文字。
原生音訊不等於最終音訊
音訊生成是一個實用的捷徑,而不是成品音訊的保證。
對話可能感覺與面部略有脫節,環境音可能缺乏深度,衝擊效果可能無法在精確的幀數上落地。重要的宣傳活動可能仍然需要語音、音樂或音訊清理。
- 我接下來要測試的內容
我為這次 Wan 3.0 評測準備了三個壓力測試提示詞。我尚未驗證它們的輸出檔案,因此我將它們視為測試計畫,而非已發布的實測結果。
測試 1:肌肉車變身為泰坦
一輛滿是灰塵的肌肉車在廢棄的橋上飛馳,經過可見的液壓和機械階段變形,將自己固定在道路上,並發射胸部安裝的能量炮。
此測試檢查部件到部件的變形、重量、後座力、火花、煙霧、破壞以及因果關係。主要問題在於最終的機器人是否仍然感覺是由原始汽車構建的,而不是看起來像是被替換了。
測試 2:廢棄地鐵中的近身格鬥
一名粉紅色頭髮的女性與一名大型保安人員搏鬥,手持攝影機在柱子、長椅和靜止的火車之間跟隨他們。
此測試檢查在快速重疊期間的身分、服裝、肢體、接觸、體重和環境穩定性。最困難的時刻是角色相互遮擋或經過柱子後面時。
測試 3:12 秒一鏡到底的拉力賽追逐
一輛紅色拉力賽車在三個雪地髮夾彎中移動,空中攝影機在不剪輯的情況下跟隨。汽車消失在石橋下方,在正確的道路上返回,避開一塊巨石,並到達安全的路段。
這是我最信任的測試。它檢查道路拓樸、鏡頭連續性、車輛物理、完全遮擋、物體恆存性、聲音進展,以及汽車在隱藏後是否以同一輛車返回。
對於這三個測試,我將比較提示詞遵循度、主體一致性、運動、物理因果關係、鏡頭控制、音訊以及獲得一個可用結果所需的嘗試次數。
10. 最終結論:Wan 3.0 值得嘗試嗎?
如果您需要的不仅仅是一個短暫的視覺特效,Wan 3.0 非常值得嘗試。
它最好的想法不僅僅是 30 秒生成,而是更長影片、多個參考素材、原生音效、文件理解和針對性編輯的結合。
我會將其用於短劇草稿、產品概念、電商影片、教學內容和預覽。對於精確的產品動作、小文字、複雜的打鬥以及任何必須在第一次生成時就正確的專案,我會更加謹慎。
我的最終評價:Wan 3.0 看起來有能力製作完整場景的初稿,而不僅僅是一個吸引人的鏡頭。這是一個有意義的進步,即使創作者仍然需要審閱、重新生成和編輯結果。
11. Wan 3.0 評測常見問題解答
什麼是 Wan 3.0?
Wan 3.0 是阿里巴巴的多模態 AI 影片生成與編輯模型。它接受文字、圖像、影片、音訊和多種文件格式。
Wan 3.0 可以生成多長的影片?
單次生成的最大時長為 30 秒。
Wan 3.0 API 的費用是多少?
已公布的價格為:480P 每秒 ¥0.30,720P 每秒 ¥0.60,1080P 每秒 ¥1.20。測試版定價可能會變動。
Wan 3.0 可以生成音訊嗎?
Wan 3.0 旨在與影片一起生成對話、唇部動作、環境音、動作特效和音樂。
Wan 3.0 可以讀取文件嗎?
已公布的輸入格式包括 DOC、XLS、PPT、PDF 和 Markdown 檔案。規定的限制為每個檔案 100 MB 和 50 頁。
Wan 3.0 是開源的嗎?
本文審閱的資訊並未正式確認 Wan 3.0 模型權重已發布。請查看 Wan 官方 GitHub 組織以了解阿里巴巴公開發布的 Wan 儲存庫;託管的公開測試版或 API 不應與開源權重發布混為一談。
什麼是 Wan 3.0 Agent Team?
Agent Team 是圍繞 Wan 3.0 的多代理影片工作流程。它可以將工作分配給編劇、導演、藝術總監、分鏡師和影片生成師等角色。



