图片转视频
把一张属于你的图片动成一段带同步音频的五秒片子。
图片转视频把一张静止的图片变成一段带声音的五秒片子。它需要有效的订阅,而且只对属于你的图片有效。
开始一次渲染
生成视频 按钮在图库图片上出现的条件有两个:这张图是你的,并且它还没有配过视频。你能在两个地方找到它。
- 在聊天里某张 AI 生成的图片下面,和 编辑图片 与 删除图片 同一行动作里。
- 在角色的图库上,任何一张属于你的图片上。
如果一张图所属的角色是你创建的,或者这张图是你自己生成的,那它就属于你。从「片刻」里没有入口,而头像只能通过图库来做成动画。
每次生成花 120,000 点数。 扣款发生在成片被挂到图库条目上的时候,所以渲染 失败是不花钱的——但 再次生成 是一次全价的新生成,不是对第一次的重试。
AI 视频导演
这个对话框是一个分镜策划器,不是一张预设清单。
设计几个方案,或者直接跳去自己写
设计 3 个方案 把图片送去一次 AI 处理,它会研究这张图并提出三个不同的五秒镜头——每个都有一个标题、一段主体动作、一个镜头运动、一档幅度和一个声音方向。挑中一个,它就把各项控件填好;重新设计 再要三个。
这是一次额外的 AI 调用,按它自己的词元用量计费,并在你的订阅额度还够时免收。自己写 主体动作 就完全跳过它。
指导动作
设定什么在动、动得多强,以及镜头做什么。
指导声音
选一种声音模式,如果你想让角色说话,就把确切的台词打进去。
生成
渲染会把进度流式地走过 directing、rendering 和 uploading 几个阶段。
动作控件
| 控件 | 选项 |
|---|---|
| 主体动作 | 自由文字,最多 1,200 个字符 |
| 动作幅度 | 轻微 · 自然 · 明显 |
| 镜头运动 | AI 自动选择 · 固定镜头 · 缓慢推近 · 缓慢拉远 · 向左平移 · 向右平移 · 向上摇镜 · 向下摇镜 · 轻微手持感 |
| 输出画幅 | 保持原图 · 人像 3:4 · 横屏 16:9 · 竖屏 9:16 · 方形 1:1 |
| 结尾帧(可选) | 同一个角色图库里的另一张图 |
选了结尾帧会改变镜头的走法:从开头到结尾的过渡会接管镜头路径,好让片子落在第二张图上。
声音
模型在视频内部生成音频,和画面上发生的事同步——环境声、拟音、音乐和角色的发声。它不是事后加上去的配乐。
| 声音设计 | 你会得到什么 |
|---|---|
| AI 自动搭配 | 模型从图片和动作里挑出声音的方向 |
| 环境音与拟音 | 环境,以及那些在动的东西发出的声音 |
| 背景音乐 | 铺在镜头下面的音乐 |
| 角色声音 | 角色发出声音——如果你写了台词,它还会把台词说出来 |
| 静音 | 没有音频 |
模式底下有四个文本框,每个都只在能起作用时才出现:
| 字段 | 上限 | 什么时候显示 |
|---|---|---|
| 声音方向 | 500 个字符 | 模式不是 静音 的时候 |
| 指定台词(可选) | 500 个字符 | 模式是 AI 自动搭配 或 角色声音 |
| 语气与音色 | 160 个字符 | 你打了台词之后 |
| 台词语言 | 80 个字符 | 你打了台词之后 |
把 指定台词 留空,模型就不会自己编台词——这正是那句占位提示里「避免编造台词」的意思。
出来的是什么
| 属性 | 值 |
|---|---|
| 时长 | 正好 5 秒 |
| 帧率 | 24 fps |
| 格式 | 带音轨的 MP4 |
| 保持原图 画幅 | 保住原图的比例,面积大约 1280 × 720 像素,并向 32 像素的网格取整 |
| 人像 3:4 | 832 × 1120 |
| 横屏 16:9 | 1248 × 704 |
| 竖屏 9:16 | 704 × 1248 |
| 方形 1:1 | 960 × 960 |
每段片子都是五秒。没有长度这个设置。
成人内容
视频这一步不会在你出发的那张图之上再加一层内容过滤。对话框自己的宣传语就是这么说的:「符合要求的成人内容不受限制」。
渲染期间
每个账号同时只跑一次渲染。 第一次还在跑的时候开第二次,会得到「还有一个视频正在生成中,请等它完成后再开始新的。」
关掉对话框不会取消任何东西:「生成会在后台继续。重新打开此窗口即可查看进度。」完成时没有通知——重新打开那张图去看。服务端在 10 分钟后会放弃一次渲染。
做好的视频
视频挂在那一张图库图片上。图片的动作行会多出 显示视频 / 显示图片 用来来回切换,而任何能看到这张图库图片的人都能播放这段视频。只有你有生成和删除这两个动作。
删除视频是永久的。 它会移除那段片子、删掉存下来的文件,并把静止图片还回来。 不退任何费用,再把这张图做成动画是一次全新的 120,000 点数渲染。