画面与声音共同创作
H3联合生成视频与立体声,不必把画面构思和声音设计完全分开。提示词可以同时描述主体动作、镜头变化、环境声、对白与音乐氛围,让声音服务于场景表达,而不是仅在成片后附加一条背景音。
在选型前明确容量、输入输出与调用方式。
帧率与音频采样率为原生模型规格,本平台入口提供分辨率、时长、画幅与素材角色控制。
了解 MiniMax-H3 能为你的工作带来什么。
H3联合生成视频与立体声,不必把画面构思和声音设计完全分开。提示词可以同时描述主体动作、镜头变化、环境声、对白与音乐氛围,让声音服务于场景表达,而不是仅在成片后附加一条背景音。
提供首帧可让已有商品图、海报或角色画面动起来;提供尾帧可指定镜头最终落点;同时提供两者则用于生成中间变化。创作重点是说明过渡动作,并尽量保持两张图片的构图、比例和光线协调。
参考图片用于引导人物、服装、产品或风格,参考视频用于引导动作与运镜,参考音频用于引导音色、音乐或节奏。把每份素材的职责写清楚,更适合组织复杂创作,也方便判断成片是否保留了关键特征。
从具体任务出发,找到模型发挥作用的位置。
输入商品图、模特图和场景参考,描述产品特写、人物使用动作与结尾展示方式,生成横屏或竖屏广告素材。人物外观与商品结构应分别指定,交付前重点检查轮廓、佩戴关系、反射和品牌文字。
输入角色和空间参考,配合人物关系、情绪变化、景别与对白描述,制作短剧片段或分镜预演。可用近景表现眼神与表情,用参考图引导服装和外观,再将合适的短片段纳入后续剪辑流程。
将动作视频、人物图片与音频作为参考,说明谁执行动作、采用什么镜头以及声音如何配合画面,生成舞蹈或时尚节奏短片。素材应先裁成与目标片段相关的短段,避免无关内容干扰创作重点。
结合任务复杂度、输入材料与预期结果选择。
需要2K输出、4秒起步的短镜头,或希望围绕多模态素材进行完整音画创作时,可选择H3。H3 Max是另一个经过速度优化的型号,原生输出为480P或768P、时长5–15秒;更重视快速生成时可考虑它,但不要把两者的规格混用。
没有现成素材时,用文本明确主体、动作、镜头与声音;已有确定的开头或结尾画面时,选择首尾帧模式;需要结合人物外观、动作和音色时,选择参考模式。首尾帧与参考素材不能放在同一请求中,应先确定最重要的控制目标。
从一次小规模任务到正式接入。
明确目标、必要输入与输出要求,使用真实业务样例作为起点。
打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。
保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。
在正式使用前,了解输出质量与能力范围。
解答使用 MiniMax-H3 时的常见疑问。
可以。content中提供非空text项即可开始文生视频,同时设置resolution、duration和固定ratio。提示词建议依次说明主体、动作、场景、镜头、光线与声音;纯文本模式不能使用adaptive画幅。
first_frame用于指定视频开始画面,reference_image用于引导主体外观、产品或风格,不要求它成为开头。需要控制最终画面可用last_frame;首尾帧模式不能与reference_*素材混合使用。
可以在参考模式中使用reference_audio,并在文本里说明它用于音色、对白、音乐还是节奏。音频素材支持WAV和MP3;H3原生支持立体声生成,中文和英文均属于稳定支持的对白语言。
H3的原生2K流程使用再生成方式,将基础视频与原始上下文共同用于恢复细节,而不是仅采用传统超分辨率模块。调用时选择resolution为2K即可表达输出需求,不需要自行组织这些内部生成步骤。
向/minimax/videos提交MiniMax-H3及content素材,默认等待完成返回task。传async=true或callback_url可立即取得任务标识,再通过/minimax/tasks查询或接收回调;成功后从task.content.url获取成片。
模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。