正文

MiniMax H3 的 H3-Base-Ref2VA 可以同时参考图片、视频和音频,但“把所有素材一股脑上传”通常会让主体、镜头和声音之间互相抢占控制权。先给每份素材一个角色,再明确哪些内容必须保留、哪些内容只提供风格或动作参考,输出会比不断加长提示词更稳定。

Ref2VA 适合需要多模态参考的音视频生成:人物或产品外观来自图片,运镜来自视频,氛围或音色来自音频。它和 FL2VA 不同,FL2VA 只适合文本、首帧、尾帧或首尾帧控制;需要多份参考材料时才选择 Ref2VA。

先确认 Ref2VA 的输入上限

官方给出的限制不是建议值,而是请求能否被正确处理的边界:

音频不能作为唯一输入,必须同时提供至少一张图片或一段视频。输出视频的时长为 4 到 15 秒、帧率 24 FPS,默认较短边为 768 像素。本地 H3-Base 成功生成 768P 音视频,不代表已经复现官方 2K 成品;2K 仍需官方 Context-IR 与 Regenerate-2K 流程。

图片9 张
视频3 段
音频3 段
全部文件12 个

每份素材只负责一种控制目标

一套可审查的参考包通常只需要三到五份素材。用下面的角色划分,而不是按文件名猜测:

不要用两段素材给出互相冲突的主体身份。例如图 1 要求保留产品外观,视频 1 却出现另一个产品且没有说明“只参考运镜”,模型就没有明确的优先级。

主体身份与外观一张清晰人物或产品图片
场景与构图一张场景图或短视频
动作与运镜一段短参考视频
声音氛围或音色一段有授权的音频
生成目标文本说明

提交前先写一份素材清单

素材清单不需要放进模型请求,但应在本地或项目任务中保留。它让团队能快速发现“音频为什么被当作背景”“人物为什么变了”这种问题。

这份清单的价值在于可复现:换一个操作者、重跑一个任务或排查审核拦截时,都能确认每份素材原本应承担什么作用。

YAML
ref2va_package:
  target: "8 秒产品展示视频,带新的中文旁白"
  files:
    - id: image_1
      role: "主体外观"
      preserve: "保留瓶身比例、白色标签和绿色盖子"
    - id: video_1
      role: "镜头运动"
      preserve: "只参考由近到远的平移镜头,不复用画面中的人物"
    - id: audio_1
      role: "声音参考"
      preserve: "参考轻快节奏,不复用原始人声或音乐"
  exclusions:
    - "不出现原视频中的人物、文字和商标"
  rights: "确认拥有全部素材的生成与传播授权"

提示词把“保留”和“参考”分开写

Ref2VA 的提示词要显式描述素材之间的关系。先声明素材身份,再写生成目标,最后说明不可复用的内容。下面是一个结构示例,不含真实人物、品牌或受限素材:

如果要生成对白,应将“谁说话、何时说、使用哪种语言、是否只参考音色”写明。不要把没有授权的真人语音说成“参考一下”;声音和肖像同样需要明确的使用权。

Text
<Picture 1> 是目标产品的外观参考,瓶身形状、白色标签和绿色盖子必须保留。
<Video 1> 只提供镜头运动参考:镜头从近景平稳拉到中景;不要保留视频中的人物、文字或场景。
<Audio 1> 只提供轻快节奏的氛围参考;目标音轨生成新的无歌词背景声。

生成一个 8 秒、16:9 的产品展示视频。开始时产品位于画面中央,镜头缓慢后移,暖白色灯光照亮标签。画面中不出现人物、原视频文字或额外品牌标识。

先跑最小参考包,再逐项增加控制

第一次请求只放主体图片和文本目标,确认外观是否稳定;第二次加入运镜视频;最后再加入音频。每次只增加一种控制变量,才知道问题来自哪份素材。

测试时先用 4 到 8 秒片段。较短样本更容易比较主体一致性、运镜、声音和时序,也能减少无效素材反复进入生产队列。

第一轮1 张主体图片 + 文本
第二轮第一轮 + 1 段视频
第三轮第二轮 + 1 段音频

参考失控时怎样判断原因

人物或产品被视频参考替换

视频参考很可能同时携带主体与动作信息。先把视频的作用改成“只参考运镜 / 动作”,并在文本中重申图片主体必须保留。若仍然不稳定,先移除视频,验证图片主体稳定后再换一段主体更少的短视频。

加入音频后没有声音,或声音关系错误

确认音频不是唯一输入,并检查时长是否在 2 到 15 秒内。再把“复用原音”“参考音色”“参考节奏”“生成新旁白”拆成明确的一项,不要在同一句中同时要求四种不同的声音关系。

请求被拒绝或素材无法提交

检查图片、视频、音频和人物肖像是否有生成、编辑与传播授权。官方流程会对文本和多媒体素材自动审核,涉嫌违法、色情或侵害第三方权利的提交可能被拦截。不要通过改写提示词尝试绕过审核;更换为已授权的素材,并保留授权来源记录。

输出达到 768P,但与网页 2K 示例不同

这不是 Ref2VA 参数遗漏。开源的 H3-Base 本地输出默认是 768P;官方 2K 结果包含额外的 Context-IR 预处理和 Regenerate-2K 阶段。先把本地验收标准定为参考关系正确、音视频可播放和分辨率符合 H3-Base 范围,再决定是否接入官方 2K API。

一次可交付的 Ref2VA 验收

Ref2VA 的价值不是多传几份素材,而是让多份素材形成一个没有冲突的生成意图。素材角色、提示词关系和可复现的最小测试都清楚后,H3 的多模态控制才会真正可用。

  • 素材数量、时长与总文件数不超过官方限制。
  • 每份素材都有单一角色,并能说明它是“保留”还是“仅参考”。
  • 文本明确主体、运镜、声音和不可复用内容的关系。
  • 通过最小参考包逐轮增加素材,而不是一次堆满输入。
  • 对图片、视频、音频、人物肖像和品牌内容持有相应授权。
  • 生成结果通过主体一致性、镜头关系、声音和分辨率四项检查。

参考来源

MiniMax H3 official repository and input specificationsMiniMax GitHubMiniMax H3 release announcementMiniMaxMiniMax H3 Community License AgreementHugging Face

相关文章

MiniMax H3 本地部署教程:用 SGLang 跑通 768P 原生音视频智能编程 / 约 10 分钟7 个关键洞察:AI Coding 工具真正改变的不是写代码,而是验证代码智能编程 / 约 18 分钟当 AI Agent 开始替人动手,企业最先缺的不是更强模型智能编程 / 约 9 分钟AI 编程开始按量计费后,团队终于得给每次 Agent 长跑算账了智能编程 / 约 11 分钟

作者信息