MiniMax H3 Max Ref 通常指 fal H3 Max 系列的 reference-to-video 工作流。想让人物、道具或风格在不同镜头中保持可辨认,第一步是明确每份参考素材负责什么。与其上传一组好看的图片,不如准备一套职责清楚的参考清单。
MiniMax H3 Max Ref 指什么
fal 的 reference-to-video 文档把 H3 Max 描述为其基于 MiniMax H3 后训练的版本。提示词可以按素材类型与顺序引用 Image 1、Video 1、Audio 1 等标签;该文档注明图片、视频与音频参考合计不超过 12 份。它们是具体提供商的接口能力,不代表所有 H3 界面都展示相同选项。
这个流程是用参考素材引导新场景的生成。如果你已经有完成的视频,只想替换里面的人物,可以看 MiniMax H3 Recast 指南,先确定源镜头与替换角色的对应关系。
整理 MiniMax H3 Max Ref 素材职责表
先用一句话写出镜头:谁在场、做什么、摄影机在哪里、观众听到什么。再给每份参考素材分配一个用途:肖像定义主角外观,房间图片定义环境,动作参考表达运动节奏。某张图说不出独立用途,就先移出第一轮素材。
为文件起可辨认的名称,例如 protagonist-front 与 workshop-lighting,再把文件名记录到素材清单。文件名用于自己整理;真正提示词里的引用应遵守所选界面的标签规范。这样即使上传顺序变化,也能及时发现角色指向出了问题。
两张肖像如果在年龄、发型、饰品和服装上差异明显,会让人物说明变得不明确。先决定哪些特征必须稳定,再选择一致的素材。对可辨认的人物和声音,确认拥有相应使用权限,不要把网上随手找到的素材直接当商业拍摄参考。
用提示词分配身份、动作与声音
以下是原创的镜头说明范例,用来展示如何区分素材职责,不代表已经生成或测评过的结果:
Image 1 定义主角的脸和发型。
Image 2 定义工作室的暖色侧光与木制工作台。
主角把小陶瓷杯放到台面上,然后转头看门口。
稳定中景跟随手部动作,不改变观察方向。
声音:轻微陶瓷碰撞、安静室内环境音、远处门轴响声。
一个连贯动作比多个不相关事件更容易评估。如果镜头同时需要人物入场、交换物品和复杂运镜,先确定哪个事件承担故事核心,把其他事件拆到后续镜头里。短而明确的场景更方便复查与调整。
把身份要求和动作要求分开写:“使用 Image 1 的脸”说明什么应保持,“转头看门口”说明什么要变化。复盘时也分开记录,避免身份不够稳定就把已经成功的动作描述全部改掉。
用三镜头清单管理连续性
人物卡只保留本场景真正重要的特征:发型、服装、主要饰品和必须辨认的道具。每条镜头沿用相同措辞与参考顺序,再单独更新动作和机位,不要每次从头重写角色。
以工作室场景为例,第一镜建立主角与工作台,第二镜展示放杯子的动作,第三镜表现听到门响后的反应。记录光线方向与杯子位置,下一镜接续时就有可比较的依据。连续性包括物体和空间,不只是一张相似的脸。
生成候选片段后,对照人物卡检查首尾帧、眼部、头发轮廓、衣服细节、道具形状以及手与物体接触的位置。再按正常速度检查时间变化。单张静帧好看,不能代替完整播放的验收。
常见问题
Ref 是什么意思?
在这里通常是 reference-to-video 的简称。比较功能时最好写出完整工作流与提供商名称。
H3 Max 等于所有 MiniMax H3 模型吗?
不等于。fal 把 H3 Max 描述为其后训练版本;不能从 H3 名称推断所有界面具有相同输入和参数。
第一次应该放多少参考素材?
从定义人物和场景所需的最少素材开始,只给具有明确独立职责的文件增加位置,再核对提供商限制。
参考肖像可以直接给已有视频换人物吗?
那属于源视频人物替换。参考生视频主要用于创建新的场景,应按自己的起始素材选择流程。
怎样比较两条候选片段?
用相同人物卡与相同检查时刻,分别评估身份、道具接触、动作连续性和声音,不只看一张漂亮的静帧。
写好下一条镜头说明
用 H3 提示词指南补齐动作与声音,浏览 H3 视频案例,再 创建 H3 视频。保存这份素材职责表,后面的场景就能从同一份角色与风格说明继续,而不必重新猜测每张参考图的用途。