Wan 3.0 評測:我實測了它 30 秒的 AI 影片工作流程

GoEnhance AI

我測試了 Wan 3.0,因為它承諾提供比 AI 影片品質的小幅提升更有用的功能:一個更長且更完整的創作工作流程。

WAN 3.0 REVIEW.jpg

公開測試版資訊顯示,它支援 30 秒生成、最多 20 個參考素材、原生音訊、文件輸入、更強的連貫性以及針對性的影片編輯。我還準備了三個高難度提示詞,看看除了精美的演示之外,它在實際測試中的表現如何。

我的快速評價:對於短劇、廣告、產品影片以及其他需要多個吸引人鏡頭的專案,Wan 3.0 非常值得一試。它最大的優勢在於整合了工作流程中的多個環節。

對於任何選擇 AI 影片生成器的人來說,關鍵問題在於這些額外的控制功能是否能產生更實用的結果,而不僅僅是功能列表的堆砌。

不過,這仍然是一個公開測試版模型。我不會期望每一個 30 秒的片段都能在不進行二次生成或編輯的情況下直接發布。

1. Wan 3.0 評測:總結 (TL;DR)

Wan 3.0 正成為創作者的強大選擇,適合那些希望在同一個平台上獲得更長片段、多個參考檔案、同步音效和編輯控制功能的使用者。

評測要點我的看法
最適合AI 短劇、廣告、電商影片、產品演示和教學內容
最強功能單次生成長達 30 秒
最實用的工作流程升級結合圖像、影片、音訊和文件作為參考
不太適合無法容忍連續性錯誤或文字錯誤的一鍵式最終影片
最大限制更長的片段仍會增加畫面漂移和小錯誤的機率
我的結論前景廣闊且實用,但請做好多次生成的心理準備

2. 什麼是 Wan 3.0?

Wan 3.0.webp

Wan 3.0 是阿里巴巴推出的全新多模態 AI 影片生成與編輯模型。根據本文審閱的發布資訊,公開測試版於 2026 年 8 月 6 日開放。Wan 官方網站是了解當前產品體驗和可用性的最佳途徑。

它不僅接受文字提示詞。已公布的輸入格式包括文字、圖像、影片、音訊以及 DOC、XLS、PPT、PDF 和 Markdown 等文件。

該模型支援 480P、720P 和 1080P 輸出。單次生成可長達 30 秒,系統還能根據提示詞建議合適的時長。

Wan 3.0 也被定位為影片編輯器。使用者可以在保留現有片段主體結構的同時,更改人物、產品、服裝、背景、對話台詞或選定的時間範圍。

立即試用 Wan 3.0
  1. 讓我印象深刻的地方

完整的 30 秒生成

30 秒的限制是我首先注意到的功能。

30-SECOND GENERATION.jpg

五到十秒足以完成一個動作或視覺特效。而 30 秒則為模型提供了足夠的空間來呈現角色出場、問題發生、回應以及結局。

這可以減少拼接多個短片段的需求。它還有助於避免在分開生成的鏡頭之間經常出現的面部變化、服裝重置、道具漂移、聲音中斷以及重複的情緒起點等問題。

更長並不自動意味著更連貫。不過,我寧願從一個連貫的 30 秒嘗試開始,並修復薄弱環節,也不願從不相關的片段中重新構建整個序列。

最多 20 個參考素材

據報導,Wan 3.0 在單個任務中最多可以使用 20 個參考素材。

20 REFERENCE ASSETS.jpg

這非常實用,因為嚴肅的影片提示詞通常需要比文字所能承載的更多資訊。創作者可以提供角色圖像、產品照片、場景參考、動作影片、音樂和品牌文件,而不是在一個長段落中描述所有內容。

參考類型我的用途
文字故事、動作、鏡頭運動、氛圍和風格
圖像角色、服裝、產品、場景和視覺識別
影片動作、表演、鏡頭語言、節奏或剪輯結構
音訊對話、音樂、音效和時機
PPT、PDF、DOC、XLS 或 MD產品事實、課程、報告或故事資訊

已公布的檔案限制為每個檔案 100 MB 和 50 頁。由於該服務仍處於測試階段,在進行生產上傳之前,應再次確認這些限制和支援的格式。

更好的角色和場景控制

Wan 3.0 旨在保持面部、髮型、體型、服裝、配飾、產品包裝、道具和燈光在整個序列中的穩定性。

當鏡頭改變距離時,這一點尤為重要。角色在特寫鏡頭中可能看起來很正確,但在遠景鏡頭中卻變成了另一個人。當有人走到柱子後面又走出來時,也會發生同樣的問題。

對於短劇和多角色影片,連貫性比單一完美的畫面更有價值。如果主角在場景中途變了樣,那麼一個漂亮的開場鏡頭也無濟於事。

更實用的鏡頭和故事控制

該模型預計能理解推鏡、拉鏡、平移、跟拍、過肩鏡頭、特寫、遠景、前景過渡、蒙太奇序列和音樂驅動的剪輯。

我感興趣的不是它識別的鏡頭術語數量。我想知道的是,鏡頭是否有助於按正確順序揭示資訊,以及場景在移動後是否仍然合理。

這就是為什麼我的一個測試提示詞使用了沒有剪輯的連續空中追逐。當鏡頭從未離開場景時,隱藏破碎的道路或替換的汽車要困難得多。

影片原生音效

Wan 3.0 可以同時生成對話、唇部動作、環境音、動作特效、音樂和圖像。

這可以節省短劇、廣告和社交媒體短片的製作時間。創作者可能不再需要匯出靜音影片、尋找單獨的音效、錄製語音並在事後修復唇形同步。

在使用這些音訊之前,我仍會仔細聆聽。公開測試版的報告指出,在語音品質、空間音效以及動作與效果的匹配度方面,仍有改進空間。

針對性影片編輯

編輯功能可能比從零開始生成更有用。

Wan 3.0 旨在保留原始構圖、運動、時機、剪輯、對話、字幕、景深和色彩,同時僅更改請求的部分。

例如,創作者可以替換產品、更換服裝、更新背景、重寫一句台詞或修復幾秒鐘的瑕疵。這比因為一個細節失敗而放棄一個基本成功的 30 秒片段要好得多。

文件可作為影片輸入

據報導,Wan 3.0 可以讀取 PPT、Word、PDF、Excel 和 Markdown 檔案。

這開啟了一種不同的工作流程。產品團隊可以將簡報與產品圖像結合。教師可以使用課程文件。行銷團隊可以同時提供品牌資訊和視覺參考。

該模型不僅僅是試圖將句子變成片段,它還試圖將現有資訊轉化為影片草稿。

  1. Wan 3.0 定價

已公布的 API 定價基於成功生成的影片時長。

解析度每秒價格15 秒成本30 秒成本
480P¥0.30¥4.50¥9.00
720P¥0.60¥9.00¥18.00
1080P¥1.20¥18.00¥36.00

單次 30 秒生成的價格對於測試來說是合理的。重複嘗試才是預算增加的地方。

如果我需要生成八次才能得到一個可用的 1080P 片段,實際成本將遠高於表中顯示的 ¥36。我會先以較低的解析度測試提示詞,然後再將最佳設定轉移到 1080P。

定價和存取權限可能會在測試期間發生變化。在評估實際專案之前,請查看 阿里雲百煉影片生成文件和百煉控制台。

  1. Wan 3.0 優缺點

優點

  • 單個片段最長可達 30 秒。
  • 文字、圖像、影片、音訊和文件可以作為參考協同工作。
  • 最多 20 個素材讓創作者能更好地控制角色、產品和風格。
  • 原生音效可減少單獨的配音和音訊處理工作。
  • 針對性編輯可以在僅有部分瑕疵時挽救一個好的片段。
  • 文件輸入使該模型在娛樂影片之外也具有實用價值。

缺點

  • 更長的片段增加了面部、道具和場景漂移的機會。
  • 快速的打鬥和重疊的身體部位仍可能產生手部或肢體錯誤。
  • 小字、包裝文案和字幕可能無法保持準確。
  • 音訊可能同步,但感覺不夠自然或缺乏空間感。
  • 同一個提示詞可能需要多次嘗試。
  • 公開測試版的定價、存取權限和 API 細節可能會變動。
  1. Wan 3.0 的最佳應用場景
應用場景Wan 3.0 的契合度
AI 短劇製作包含對話、角色參考和連貫鏡頭運動的 20 到 30 秒場景
動畫故事在多個鏡頭中保持 2D、3D、奇幻或遊戲風格的角色一致性
產品廣告結合產品照片、模特參考、音樂和規劃好的產品展示
電商影片將產品圖像和描述轉化為簡短的演示或賣點片段
教學內容將 PPT、PDF、Word 檔案或報告轉換為視覺化解釋
產品演示在一個序列中展示結構、設定、使用方法和物理互動
局部影片修復替換人物、道具、台詞或薄弱的時間範圍,無需重做整個影片
電影預覽在製作前探索場景、鏡頭規劃、氛圍和動作
音樂影片使用音樂來引導運動、剪輯和視覺氛圍

我認為最好的使用者是那些已經擁有實用素材的人。當創作者帶來角色圖像、產品參考、文件或現有影片時,Wan 3.0 的意義比僅僅想要一個隨機的電影感片段要大得多。

  1. 什麼是 Agent Team?

Agent Team 是圍繞 Wan 3.0 構建的工作流程,它並非模型本身。

不同的代理可以分別擔任編劇、導演、藝術總監、分鏡師和影片生成師。使用者提供想法、文件或網頁,系統將其拆解為故事節奏、鏡頭、角色、場景和素材。

這看起來比單一提示詞更適合完整的影片專案。該功能目前描述為僅限受邀使用,因此我不會將其視為已全面開放。

  1. Wan 3.0 的不足之處

三十秒讓錯誤有更多出現的時間

更長的生成時間很有價值,但也給了模型更多丟失細節的機會。

面部可能會變形、道具數量可能會改變、車輛可能會在物體後面以錯誤的位置返回,或者背景可能會緩慢地自我重構。我會比開場更仔細地檢查每個長片段的後半部分。

複雜的接觸仍是難題

手部動作、打鬥、產品使用以及多人相互接觸對任何影片模型來說都是困難的。

Wan 3.0 可能會創造出正確的整體動作,但卻錯過了精確的接觸點。這對於快速的概念影片是可以接受的,但對於需要展示精確物理步驟的產品演示來說則不然。

文字需要人工檢查

小標籤、字幕、標誌和產品包裝仍然可能出錯。

對於商業影片,除非生成的文字經過逐幀檢查,否則我會使用模型來製作場景,並在事後添加重要文字。

原生音訊不等於最終音訊

音訊生成是一個實用的捷徑,而不是成品音訊的保證。

對話可能感覺與面部略有脫節,環境音可能缺乏深度,衝擊效果可能無法在精確的幀數上落地。重要的宣傳活動可能仍然需要語音、音樂或音訊清理。

  1. 我接下來要測試的內容

我為這次 Wan 3.0 評測準備了三個壓力測試提示詞。我尚未驗證它們的輸出檔案,因此我將它們視為測試計畫,而非已發布的實測結果。

測試 1:肌肉車變身為泰坦

一輛滿是灰塵的肌肉車在廢棄的橋上飛馳,經過可見的液壓和機械階段變形,將自己固定在道路上,並發射胸部安裝的能量炮。

此測試檢查部件到部件的變形、重量、後座力、火花、煙霧、破壞以及因果關係。主要問題在於最終的機器人是否仍然感覺是由原始汽車構建的,而不是看起來像是被替換了。

測試 2:廢棄地鐵中的近身格鬥

一名粉紅色頭髮的女性與一名大型保安人員搏鬥,手持攝影機在柱子、長椅和靜止的火車之間跟隨他們。

此測試檢查在快速重疊期間的身分、服裝、肢體、接觸、體重和環境穩定性。最困難的時刻是角色相互遮擋或經過柱子後面時。

測試 3:12 秒一鏡到底的拉力賽追逐

一輛紅色拉力賽車在三個雪地髮夾彎中移動,空中攝影機在不剪輯的情況下跟隨。汽車消失在石橋下方,在正確的道路上返回,避開一塊巨石,並到達安全的路段。

這是我最信任的測試。它檢查道路拓樸、鏡頭連續性、車輛物理、完全遮擋、物體恆存性、聲音進展,以及汽車在隱藏後是否以同一輛車返回。

對於這三個測試,我將比較提示詞遵循度、主體一致性、運動、物理因果關係、鏡頭控制、音訊以及獲得一個可用結果所需的嘗試次數。

10. 最終結論:Wan 3.0 值得嘗試嗎?

如果您需要的不仅仅是一個短暫的視覺特效,Wan 3.0 非常值得嘗試。

它最好的想法不僅僅是 30 秒生成,而是更長影片、多個參考素材、原生音效、文件理解和針對性編輯的結合。

我會將其用於短劇草稿、產品概念、電商影片、教學內容和預覽。對於精確的產品動作、小文字、複雜的打鬥以及任何必須在第一次生成時就正確的專案,我會更加謹慎。

我的最終評價:Wan 3.0 看起來有能力製作完整場景的初稿,而不僅僅是一個吸引人的鏡頭。這是一個有意義的進步,即使創作者仍然需要審閱、重新生成和編輯結果。

11. Wan 3.0 評測常見問題解答

什麼是 Wan 3.0?

Wan 3.0 是阿里巴巴的多模態 AI 影片生成與編輯模型。它接受文字、圖像、影片、音訊和多種文件格式。

Wan 3.0 可以生成多長的影片?

單次生成的最大時長為 30 秒。

Wan 3.0 API 的費用是多少?

已公布的價格為:480P 每秒 ¥0.30,720P 每秒 ¥0.60,1080P 每秒 ¥1.20。測試版定價可能會變動。

Wan 3.0 可以生成音訊嗎?

Wan 3.0 旨在與影片一起生成對話、唇部動作、環境音、動作特效和音樂。

Wan 3.0 可以讀取文件嗎?

已公布的輸入格式包括 DOC、XLS、PPT、PDF 和 Markdown 檔案。規定的限制為每個檔案 100 MB 和 50 頁。

Wan 3.0 是開源的嗎?

本文審閱的資訊並未正式確認 Wan 3.0 模型權重已發布。請查看 Wan 官方 GitHub 組織以了解阿里巴巴公開發布的 Wan 儲存庫;託管的公開測試版或 API 不應與開源權重發布混為一談。

什麼是 Wan 3.0 Agent Team?

Agent Team 是圍繞 Wan 3.0 的多代理影片工作流程。它可以將工作分配給編劇、導演、藝術總監、分鏡師和影片生成師等角色。