由 Alibaba 出品官方网站

Wan 2.5 提示词

阿里的视频模型,以紧密音画同步立身——每个画面节拍都带着自己的声音同帧落地,一次生成。

video

关于 Wan 2.5

Wan 2.5 是阿里巴巴的视频生成模型(通义万相),立身之本是音画同步。声音不是事后贴上去的——它与画面锁定生成:门在关上的那一帧砰响,台词落在口型上,脚步声恰好踩在脚落地的瞬间。

这种「紧」让 Wan 成为音频时机就是全部意义的内容的务实之选:口播片段、带旁白的产品演示、音乐性瞬间,以及任何「声音慢半拍就穿帮」的场景。它的画面表现同样在线,但同步才是整个模型围绕构建的轴心。

因此写好 Wan 的提示词,意味着把声音和画面写成同一份脚本,而不是两份。每个画面节拍都配好音频提示的提示词,产出的片段像刻意剪辑过的;只描述画面的提示词,等于把音轨交给运气。下方画廊收录了经过验证的 Wan 提示词及真实输出——研究那些跑通的提示词是如何把两条轨交织在一起的。

如何写好 Wan 2.5 提示词

  1. 1写成对的节拍:每个画面事件在同一句话里带上它的声音——「火柴擦燃,嗤的一声锐响」「她的高跟鞋嗒嗒敲过大理石门厅」。成对出现正是同步引擎咬合的位置。
  2. 2用「当……时」「随着……」把声音焊在画面上:「随着卷帘门落下,街道噪声骤然闷成一片嗡鸣」。时间连接词就是伪装成叙述的同步指令。
  3. 3台词和歌词放进引号,让音频落在「说出口」的瞬间——带引号的句子给模型一个可供对齐口型与时机的精确语料。
  4. 4刻意分层混音:先点名前景声,再给背后的环境底噪——「近距离收音的铅笔沙沙声,底下是图书馆的寂静」。两个点名的声层胜过一团含糊的氛围。
  5. 5描述每个声音的质感,而不只是有无:「隔着墙的闷响」「楼梯间的回声」「贴耳且干净」。质感词直接引导音频本身的渲染。
  6. 6每个片段只设一个音频焦点。一次干脆的同步瞬间——一声关门、一记鼓点、一句台词——比什么都想同步的全景声场更显紧凑。

常见问题

Wan 2.5 最擅长什么?

紧密的音画同步——声音与画面锁定生成的片段,撞击、语音、音乐都精准落帧。当音频时机就是片段的意义所在——从带旁白的演示到音乐性瞬间——它是强势之选。

怎样为 Wan 2.5 写带声音的提示词?

把声音和画面写进同一份脚本:每个画面节拍在同一句里配上音频提示,用「当」「随着」等时间词焊接两者,台词一律放引号。本页的验证提示词展示了两条轨如何交织。

Wan 2.5 是和视频一起生成音频的吗?

是——音频在同一次生成中产出,与画面同步锁定,而非事后叠加。这正是「写明该听到什么、何时听到」的提示词胜过只描述画面的原因。

在哪里可以试用这些 Wan 提示词?

Wan 可通过阿里的通义万相平台使用,开发者可经阿里云百炼(Model Studio)接入。从本页复制任意提示词粘贴过去,把音画配对改成你自己的场景即可。