文生视频
用文字导演一场戏
描述主体、运镜、动作与声音,再选择最适合这次创作的视频模型。
输出控制
渲染前设置模型、时长与画幅。
Hailuo 3 · Native 2K video with synchronized audio and multimodal reference control.
0/7000
4s5 秒15s
2K固定
水印
在导出视频上添加服务商水印。
需消耗积分:40
请先描述要生成的场景。
最近渲染
新任务会在渲染过程中实时更新。
MiniMax H3 文生视频怎么用
文生视频是进入 MiniMax H3 最快的方式。你写一段导演式的描述,H3 一次性渲染出整个镜头——主体、运镜、光线,以及与画面匹配的立体声轨——原生 2K 输出。没有单独的配音步骤,也不需要额外放大。模型把提示词当作导演阐述而不是关键词堆砌,所以你对运动和构图描述得越精确,结果越接近预期。
写出 H3 能真正执行的提示词
- 1
先说清主体和场景
开头就交代画面里是谁、在哪。"一个穿霓虹黄夹克的女人走在夜市里"给了 H3 具体锚点,"一个人在外面"没有。
- 2
描述镜头,不只是场景
H3 对镜头语言直接响应。写"缓慢推镜""手持跟拍""固定全景"。不写的话模型会自己选运动方式,每次结果都不一样。
- 3
把你想听到的声音也写进去
声音和画面一起生成,所以要点名。"雨点打在帆布棚上,远处人声嘈杂"和默认留白得到的音轨完全不同。
真正影响成片的几个选择
提示词上限是 7000 字符,但长度不是质量的决定因素。下面四个选择比堆形容词有用得多:
- 时长:4-6 秒能干净地完成一个连续动作。10-15 秒给 H3 留出分镜空间,多镜头一致性正是在这个长度体现出来的。
- 画幅:生成前就定,不要事后改。横屏和电影感用 16:9,Shorts 和 Reels 用 9:16,宽银幕用 21:9。
- 光线和时间:写"黄金时刻逆光"或"顶部荧光灯"会改变整个影调,事前指定比事后补救便宜得多。
- 一个片子一个动作。把两件不相干的事塞进一条提示词,通常得到的是两者模糊的折中而不是各自完整。
一个完整示例
这条提示词产出的是稳定的多镜头结果,而不是一个好看的单帧:
一个穿霓虹黄夹克的年轻女子穿过灯笼节,分四个镜头,急促的手持跟拍,特写与人群全景交替,面容和服装保持一致,浓烈的夜间氛围,远处鼓声与人声。
它有效是因为同时固定了四件事:主体与服装(所以切镜时脸不会变)、镜头数量、拍摄风格、声音底噪。少写任何一项,H3 就会自己填空。
常见问题
- MiniMax H3 的提示词该写多长?
- 上限是 7000 字符,但效果好的提示词大多在 30-80 个词之间。超过这个长度,多余的描述反而互相打架。优先写主体、运镜、光线和声音,而不是叠形容词。
- 文生视频能生成多长?
- 单次生成 4 到 15 秒。短片段适合一个连续动作;10-15 秒给模型留出切换镜头的空间,同时保持同一个角色。
- 文生视频带声音吗?
- 带。MiniMax H3 在同一次生成中输出与画面同步的立体声——环境音、音效、与动作匹配的声响。在提示词里描述声音就能控制生成什么。