1. 准备两张清楚的人物照片

每张一位成年人,脸部清楚、光线均匀。支持 JPG、PNG、WebP,每张不超过 10 MB,宽高均至少 240 像素。避免过小的人脸、大幅侧脸和过度滤镜。

2. 安排左右位置

第一张照片放在左侧,第二张放在右侧,可通过交换按钮调整。此处预览的是原始照片,最终视频需生成后才能查看。

3. 决定唱什么,用什么语言

“让 AI 写词”可用英文或普通话创作短词;“自己填歌词”则演唱你输入的原文。每句换一行,左右人物依次交替。选择“跟随歌词语言”会保留原文,中英混写也可以。请根据视频时长精简歌词;实际发音、歌词和口型可能有偏差。

4. 选择画面比例、清晰度与时长

默认是竖屏 9:16、480p、5 秒。可选 720p 获得更清晰的画面,10 秒或 15 秒能容纳更多歌词和表演。

画面比例与清晰度、时长放在一起,默认竖屏 9:16。也可选 16:9、4:3、1:1、3:4,或让模型自动适配。画面比例不影响点数用量。

规格点数
480p · 5 秒80
480p · 10 秒160
480p · 15 秒240
720p · 5 秒160
720p · 10 秒320
720p · 15 秒480

5. 登录并确认点数用量

确认两位人物同意使用其照片,使用邮箱和密码或 Google 登录,按需购买点数套餐。登录或购买后,照片、歌词和设置可在同一浏览器恢复。点数长期有效,无需订阅。

6. 提交生成,稍后查看

通常需要 1–5 分钟,排队时可能更久。提交后任务会保存到“我的视频”,可以离开页面。浏览器等待超时不代表任务失败。

7. 试听并下载

播放成片并打开声音,检查人物、歌词和表演,再下载 MP4。人声与伴奏由 AI 生成;自定义歌词也可能出现遗漏、发音或口型偏差。已成功完成的作品再生成一个版本,会再次使用点数。

效果或任务出现问题时

确认技术失败后会退回预留点数。若视频完成,但人物或动作与预期不同,可以先看 选图建议,再换用更清楚的照片。任务仍在核查时,请提供编号联系客服,避免重复提交。

视频使用 Wan 3.0模型生成,提供上表所列的四种规格组合。