
为了蹭Minimax H3的话题流量,我之前匆忙测试后就直接写文发布了我错了,不该如此敷衍地写了一期水文Minimax H3的提示词格式有硬性要求,不能用常规思维写提示词所以我仔细研究了官方的提示词指南,并写了这份教程

>
正文开始

>
很多人写视频提示词时,习惯把人物、场景、动作、镜头、风格全部塞进一段话里:一个女孩坐在咖啡馆里,一只狗扑向她手里的饼干,画面温馨搞笑,电影感,镜头推进……
这种写法不是完全不能用,但当你同时上传人物图、场景图、动作视频和声音参考时,模型很容易搞不清:
哪张图负责人物长相;哪张图负责场景;哪段视频只参考动作;哪段音频需要原样保留;哪些元素必须保持一致;哪些元素允许修改
Seedance2.0的全参考模式,解决这个问题的办法是使用@素材的方式
MiniMaxH3的全参考模式,解决这个问题的办法则是把提示词写成一份结构清晰的视频制作说明书
官方要求完整提示词应由六个部分组成,并且主体使用英文;只有角色台词、歌词以及画面中真实出现的文字可以保留原语言。

>一、先理解一个核心原则

>
全参考模式的提示词,不是在回答:这个视频讲了什么故事?
而是在回答:模型应该从哪些素材中提取什么内容,并在视频的什么时间、什么镜头、什么位置使用这些内容?
所以,不要只写剧情梗概:一个女孩在咖啡馆遇到一只狗
这就是我匆忙测试的时候所犯下的错误,为了蹭流量我也是水文了
要写成可以被模型执行的画面:
中景,女孩坐在画面右侧的橙色沙发上,右手拿着饼干。年轻男人从画面左侧进入,牵着一只白色萨摩耶。狗突然向饼干靠近,牵引绳被拉直,女孩迅速将手向后收。
前者是故事,后者才是视频提示词
一个合格的镜头描述,至少应该交代:景别与构图+人物外观与位置+环境与光线+单一动作+状态变化+镜头运动+声音与台词
这其实与绝大多数的视频模型提示词结构没什么区别,算是通用结构了
但海螺官方特别提醒:

>
detailed_description不能退化成剧情摘要或简单的参考素材对应表,而要明确写出每个镜头真正能看到和听到的内容

>

>二、完整提示词的六个部分

>
MiniMaxH3全参考模式的标准结构如下:
1,subject_definitions
定义参考素材中需要被单独识别和追踪的内容
2,summary用一小段话说明要生成什么视频,以及各项参考素材分别承担什么作用
3,retention_analysis告诉模型,参考素材中的哪些特征必须完整保留,哪些只需部分参考,哪些特征要转移给其他对象
4,detailed_description最重要的部分,按照视频播放顺序,逐镜头描述画面、动作、镜头、声音和台词
5,overall_soundscape描述环境声和现实世界中能够听到的声音,例如风声、脚步声、室内底噪
6,non_diegetic_music描述只有观众能听见、画面中的角色听不见的背景音乐
这六个部分必须按照固定顺序组织

>三、四种参考标签怎么使用

>
全参考模式最关键的技巧,是给参考内容正确贴标签
官方定义了四种标签:
<SubjectN>
<PictureN>
<VideoN>
<AudioN>
其中的N从1开始编号
<SubjectN>:真正要出现在视频里的内容
Subject不是“文件”,而是从文件中提取出来、需要在成片中使用的视觉元素,它可以是:人物;动物;物体;场景;服装;道具;特效;画面风格;动作;表情或姿势
例如,你上传了一张小狼妖角色图,你应该这么写提示词:
<Subject1>is the young wolf demon in<Picture1>,with grey fur,drooping ears,worn brown clothes,and anervous expression.
意思是:Subject1是Picture1里的年轻小狼妖,灰色毛发、下垂耳朵、破旧棕色衣服,神情紧张
一张图片可以提供多个Subject
例如,一张咖啡馆照片,既可以提取:
<Subject1>is the young woman in<Picture1>.
<Subject2>is the coffee-shop environment in<Picture1>.
同一个Subject也可以同时来自多个素材:
<Subject1>is the woman whose appearance comes from<Picture1>and whose walking motion comes from<Video1>.
意思是:<Subject1>是一个女人,她的外表来自<Picture1>,她的行走动作来自<Video1>
也就是:Picture1负责人物长相;Video1负责人物走路动作
这是Minimax H3全参考模式里最实用的能力之一:把不同素材的属性拼装到同一个目标角色上
<PictureN>:具体画面锚点
在Minimax H3里,不是上传了图片,就一定要单独定义<PictureN>
只有当图片本身要承担以下作用时,才需要把它单独定义为Picture:
视频首帧;视频尾帧;某个关键帧;镜头构图参考;分镜图;需要直接编辑的画面
例如:
<Picture2>is the first frame of[Shot1],showing the wolf demon standing outside there cruitment hall.
意思是:<Picture2>是【Shot1】的第一帧,显示狼妖站在那里的十字大厅外
如果图片只是用来确定人物长相,就不需要单独写一行Picture,只需把它写进Subject定义:
<Subject1>is the wolf demon in<Picture1>.
最常见的错误,是上传五张图,就机械地定义五个Picture
正确做法是先自己搞清楚:这张图是一个具体画面,还是只负责提供人物、服装、场景或风格?
只提供特征,用Subject
直接控制某一帧或某个镜头构图,才用Picture
<VideoN>:整段视频的结构来源
Video主要用于描述整段参考视频与目标视频之间的关系,例如:
修改原视频;续写原视频;参考原视频的镜头运动;参考剪辑节奏;参考镜头顺序;参考整段时间结构
例如:
<Video1>is the source video for the target video edit.
意思是:<Video1>是目标视频编辑的源视频
但是,假如你只是想使用参考视频里某个人的动作,那么这个人或动作仍然应该定义成Subject:
<Subject2>is the nervous hand-rubbing motion from<Video1>.
意思是:<Subject2>是<Video1>中的紧张的手部摩擦动作
不要因为素材来源是视频,就把里面的所有内容都写成<Video1>
你可以这样理解:<VideoN>管整段视频的结构和时间关系;<SubjectN>管视频里需要被提取出来使用的具体内容
<AudioN>:声音素材
Audio可以负责:
原样复制整段声音;复制其中一部分;参考人物音色;参考说话节奏;参考情绪和语气;参考音乐风格;参考音效质感;延续原音频节拍
例如:
<Audio1>is the voice-timbre reference for<Subject1>(S1).
意思是Audio1只负责Subject1的说话音色
注意:上传的视频文件里带有声音,并不代表必须自动定义一个Audio
只有当声音确实要被复制或参考时,才需要定义<AudioN>
而且Video和Audio各自独立编号,不要求数字一一对应

>四,先判断你的任务属于哪一种

>
是不是这教程不看还好,看完后整个人都学废了的感觉?
其实简单的
在summary开头,需要使用方括号标明任务类型
常用类型有六种
1,keyframe completion
参考图片直接作为首帧、尾帧或关键帧
[keyframe completion]
2,reference generation
参考人物、场景、风格、动作、运镜或声音特征
但不直接修改或续写原视频
[reference generation]
这也是普通多素材(模态)参考生成最常使用的类型
3,video editing
直接修改一段已有视频
[video editing]
4,video continuation
从原视频结尾继续生成
[video continuation]
5,audio reuse
直接复制原音频信号
[audio reuse]
6,audiore ference
不复制原声音,只参考音色、节奏、语气或音乐风格
[audio reference]
在一项任务中,可以同时拥有多个类型:
[video continuation+keyframe completion+audio reference]
不要因为上传了视频,就直接写video editing
如果只是参考视频的运镜或节奏,通常仍然属于reference generation
只有直接修改原视频,才属于videoediting
只有从原视频结尾继续,才属于video continuation

>五、如何告诉模型“哪些东西不能改”

>
retention_analysis的作用,是明确参考素材的保留程度
视觉素材使用以下四种关系
1,fully_preserved
完整保留,适用于:必须保持同一个角色;服装不能改变;场景布局不能改变;首帧或尾帧必须严格匹配
<Subject1>:fully_preserved the character's grey fur,drooping ears,brown clothes,and facial identity areretained.
意思就是:<Subject1>中角色的灰色皮毛、下垂的耳朵、棕色衣服和面部特征都保留下来
2,partially_preserved
保留一部分,但允许修改。
例如:保持人物身份,但更换服装;保持场景结构,但改变时间和光线;保持动作主体,但改变速度
3,attribute_transfer
把参考属性转移给另一个对象
例如:将参考视频里成年人的动作转移给小狼妖;将参考图中的服装穿到另一个角色身上;将某种表情迁移到目标人物
4,weak_reference
只保持大致相似,适用于:只参考氛围;只参考画风;只参考大致构图;只参考镜头节奏
如果你上传的不是视频,而是音频,则使用:
fully_copy:完整复制;
partially_copy:复制部分内容;
reference:只参考音色、节奏或风格;
weak_reference:只保持大致氛围
这一部分不是让你评价生成质量,而是提前告诉模型:哪些参考关系是强约束,哪些只是弱参考

>六、真正决定效果的是detailed_description

>
detailed_description是提示词主体
官方建议在生成视频时,将提示词写成约350至500个英文单词,但不要机械凑字数,台词多的视频,应优先保证台词时间能够合理容纳
视频编辑任务,则根据原视频复杂度调整
1,先用一两句话确定整体风格
风格说明放在第一个镜头之前:
The target video uses a stylized 3D animated mockumentary style, with slightly exaggerated expressions, warm daylight, and dry absurdist comedy.
意思是:目标视频采用风格化的3D动画伪纪录片风格,带有轻微夸张的表情、温暖的日光和枯燥的荒诞喜剧
不要堆几十个彼此冲突的风格词,比如:
cinematic, anime, photorealistic, watercolor, clay animation, cyberpunk, Chinese ink painting
电影、动漫、写实主义、水彩、粘土动画、赛博朋克、中国水墨画
正确的写法应该是:
A stylized 3D animated mockumentary with rough hand-painted textures and natural daylight.
确定一个主风格,再补充一到两个质感特征就够了
2,第一个镜头不写时间
[Shot1]
后面的镜头标明切换时间:
[Shot2]At 00:03.000,...
[Shot3]At 00:06.500,...
时间戳代表新镜头从什么时候开始
3,每个镜头按照固定顺序写
新手可以使用以下顺序,可有效避免踩坑:
第一步:景别和构图
A medium shot shows...
A close-up frames...
A wide shot establishes...
第二步:人物位置
<Subject 1> stands on the left side of the frame.
第三步:人物外观
人物第一次出现时,简要重申最关键的识别特征:
<Subject 1>, the grey-furred young wolf demon in worn brown clothes, ...
后续镜头不用重新完整定义
第四步:单一动作
He slowly hands the recommendation letter to the interviewer.
不要在一个短镜头里同时安排:走进来、坐下、递材料、转头、摔倒、站起来、说话、推门离开等多个动作
模型不是不认识这些动作,而是很难在几秒内正确安排动作顺序
更稳妥的做法是拆镜头。这也是其它模型常用的多动作制作方法:
镜头1:走进房间;
镜头2:坐下;
镜头3:递出推荐信;
镜头4:面试官低头查看。
第五步:表情和状态变化
不要只写“紧张”,要写出可见变化:
His ears droop slightly, his shoulders tighten, and he avoids eye contact.
第六步:镜头运动
The camera slowly pushes in.
The camera makes a slight handheld pan to the right.
The camera remains static.
需要时写清楚速度和幅度,不需要运镜时直接写静态镜头
第七步:声音与台词
写明声音来源、说话方式以及具体台词

>七、台词的标准写法

>
每一个真实发声的人,都需要固定的说话者编号:
(S1)
(S2)
(S3)
编号根据角色第一次发声的顺序确定,后面不能随意改变。
例如:
<Subject 1> (S1) says in a nervous young male voice, <d>[Chinese] 我有三封推荐信,两封是我自己写的。</d>
其中:
<Subject1>表示画面中的参考角色;
(S1)表示声音来源;
[Chinese]表示台词语言;
<d>...</d>包裹完整台词。
同一个角色后面继续说话,仍然使用(S1)
角色在画外说话时:
<Subject 1> (S1), speaking off-screen, says...
需要注意:
台词、旁白和歌词都写在<d>中;原始语言应保留,不必翻译成英文;听不清的原始台词写[unclear],不能自行猜测;如果只参考音色,不要把参考音频中的原台词带进新视频;台词结尾应使用正常的句号、问号或感叹号
官方将“视觉主体”和“声音来源”视为两套不同的追踪系统:Subject管角色是谁,S1/S2管声音是谁发出的,挺麻烦的

>八、环境声和背景音乐必须分开

>
1,overall_soundscape
描述画面世界里真实存在的声音,
overall_soundscape: Quiet indoor room tone, faint paper rustling, wooden chair creaks, and distant crowd noise from outside the recruitment hall.
整体声景:安静的室内色调,微弱的纸张沙沙作响,木椅吱吱作响,招聘大厅外传来远处人群的喧闹声。
这里所谓的画面世界里真实存在的声音,包括:风声;雨声;街道声;室内底噪;脚步声;开门声;衣物摩擦声;物体碰撞声
2,non_diegetic_music
描述只有观众能听见的配乐
non_diegetic_music: A restrained plucked-string comedy score at a medium-slow tempo, with brief pauses before each punchline.
使用BGM时最好交代清楚:使用什么乐器;音乐速度;情绪;音量变化;是否逐渐增强;是否在笑点前停止
完整台词不要在这两个部分重复,台词只放在detailed_description中

>九、刚上手时最容易犯的八个错误

>
错误一:把所有参考文件都定义成Picture
图片只负责人物外观时,应定义Subject,而不是单独定义Picture
错误二:把参考视频里的人物写成Video
人物、物体和动作属于Subject;Video主要表示整段视频的编辑、延续、节奏或镜头结构
错误三:只写“参考某张图”
模型不知道你究竟参考什么
错误的写法:Use Picture 1 as reference.
正确的写法:<Subject 1>'s facial identity, grey fur, drooping ears, and worn brown clothes come from <Picture 1>.
错误四:一条参考素材承担太多模糊任务
不要写:Use Video1 for everything.
应该将参考元素全部拆开:人物动作来自Video1;剪辑节奏弱参考Video1;音频不复制;场景来自Picture2
错误五:只写剧情,不写画面
“他参加了一次荒诞的面试”,这样的提示词模型是无法直接执行的
必须说明:他站在哪里;面试官在哪里;谁先动作;动作幅度多大;镜头是否移动;什么时候说话
错误六:一个镜头塞入太多动作
一个镜头承担一个动作,复杂事件,就拆开来通过多个镜头完成
错误七:角色编号反复变化
同一个角色一旦是(S1),整段视频都必须保持(S1)
错误八:混淆“复制声音”和“参考声音”
想保留原音轨,写audio reuse
只想参考音色或说话方式,写audior eference

>十、新手可以直接套用的完整模板

>
这应该是新手最喜欢的板块了😂

>
subject_definitions:
<Subject1>is[需要生成的人物、动物、物体或场景],whose[外观、服装、身份等特征]come from<Picture1>.<Subject2>is[第二个视觉主体],whose[动作、表情或外观]come from<Video1>.<Picture2>is the[first frame/keyframe/lastframe/composition reference]of[ShotN].<Video1>is the source video used as a reference for[camera movement/editing rhythm/temporal structure].<Audio1>is the voice-timb rereference for<Subject1>(S1).summary:[reference generation+audio reference]The target video shows[人物、场景和核心事件].<Picture2>defines[具体画面作用].<Video1>provides[视频参考作用].<Audio1>provides[声音参考作用].retention_analysis:<Subject1>(appears in[Shot1],[Shot2]):fully_preserved[必须保留的人物特征].<Subject2>(appears in[Shot2],[Shot3]):partially_preserved[保留什么,允许改变什么].<Picture2>([Shot1]first frame):fully_preserved[需要严格保留的构图和位置].<Video1>(camera movement and pacing):weak_reference[只需大致参考的内容].<Audio1>:reference[只参考音色、情绪和说话节奏,不复制原始信号].detailed_description:The target video uses a[主要风格]with[光线、色彩和整体质感].[Shot1]A[景别]shows[环境与构图].<Subject1>,[关键外观特征],stands or sitsat[画面位置].[角色执行一个主要动作].The camera[运镜方式].[环境声音].[Shot2]At 00:03.000,the shotcuts to a[景别]of<Subject2>.[主体位置、动作和状态变化].<Subject1>(S1)says in a[音色、情绪、速度],<d>[Chinese]具体台词。</d>[Shot3]At 00:06.000,the shotcuts to[新的构图].[角色执行一个主要动作].<Subject2>(S2)replies in a[声音描述],<d>[Chinese]具体台词。</d>The camera[运镜或保持静止].The shot ends on[最后画面状态].overall_soundscape:[环境底噪、脚步、衣物摩擦、物体碰撞和其他现实声音].non_diegetic_music:[乐器、节奏、情绪、音量及音乐发展方式].

>

>十一、完整示例:小狼妖参加花果山面试

>
假设上传了:
Picture1:小狼妖角色图;
Picture2:花果山招聘大厅;
Video1:一个求职者紧张递简历的动作视频;
Audio1:小狼妖的声音参考。
可以这样写:
subject_definitions:
<Subject 1> is the young wolf demon in <Picture 1>, with grey fur, drooping ears, a thin body, worn brown clothes, and a permanently nervous expression.
<Subject 2> is the monkey interviewer, wearing a red official robe and sitting behind a large wooden recruitment desk.
<Subject 3> is the recruitment-hall environment in <Picture 2>, featuring stone walls, red banners, crowded wooden benches, and a large sign reading “花果山人才招聘处”.
<Subject 4> is the nervous document-handing motion from <Video 1>, transferred to <Subject 1>.
<Audio 1> is the voice-timbre reference for <Subject 1> (S1), providing a young male voice with a cautious and slightly trembling delivery.
summary:
[reference generation + audio reference] The target video shows <Subject 1> attending a job interview with <Subject 2> inside <Subject 3>. The nervous document-handing action of <Subject 4> is transferred to <Subject 1>. <Audio 1> provides the voice-timbre reference for <Subject 1>. The scene uses dry absurdist comedy and ends with the interviewer rejecting the résumé because it lacks a sufficiently powerful recommendation letter.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2], [Shot 3]): fully_preserved - the wolf demon's facial identity, grey fur, drooping ears, thin body, worn brown clothes, and nervous appearance are retained.
<Subject 2> (appears in [Shot 1], [Shot 2], [Shot 3]): fully_preserved - the monkey interviewer's red official robe, seated posture, and bureaucratic expression are retained.
<Subject 3> (appears in [Shot 1], [Shot 2], [Shot 3]): fully_preserved - the stone recruitment hall, wooden desk, red banners, benches, and visible Chinese recruitment sign are retained.
<Subject 4> (appears in [Shot 1]): attribute_transfer - the cautious document-handing motion is transferred to <Subject 1>.
<Audio 1>: reference - the target speaker follows the youthful, cautious, slightly trembling vocal quality without copying the original audio signal.
detailed_description:
The target video uses a stylized 3D animated mockumentary look with rough hand-painted textures, warm daylight entering through the stone doorway, slightly exaggerated facial expressions, and dry absurdist comedy.
[Shot 1] A medium-wide static shot establishes <Subject 3>, the crowded stone recruitment hall with red banners, wooden benches, and the large sign reading “花果山人才招聘处”. <Subject 2>, the monkey interviewer in a red official robe, sits behind a large wooden desk on the right side of the frame. <Subject 1>, the thin grey-furred wolf demon in worn brown clothes, stands on the left. Using the nervous document-handing motion transferred from <Subject 4>, he slowly extends a folded résumé toward the interviewer with both hands. His ears droop and his shoulders remain tense. Papers rustle softly as the résumé reaches the desk.
[Shot 2] At 00:03.000, the shot cuts to a close-up of <Subject 2>. He lowers his eyes toward the résumé without touching it. His expression remains serious and slightly impatient. <Subject 2> (S2) asks in a flat bureaucratic voice, <d>[Chinese] 有大圣的推荐信吗?</d> He raises one eyebrow and taps the desk once with his index finger. The camera remains static.
[Shot 3] At 00:06.000, the shot cuts to a close-up of <Subject 1>. He tightens his grip on the résumé, lowers his head, and answers using the cautious, slightly trembling voice referenced from <Audio 1>. <Subject 1> (S1) says, <d>[Chinese] 没有,但我能吃苦。</d> After a short pause, the shot cuts back slightly wider as <Subject 2> pushes the résumé back across the desk with one finger and says, <d>[Chinese] 我们这里不缺苦,缺关系。</d> <Subject 1> remains frozen with both hands extended as the final frame holds for one second.
overall_soundscape:
A low indoor crowd murmur continues throughout the recruitment hall. Soft paper rustling, wooden chair creaks, distant footsteps, and one dry finger tap on the desk remain clearly audible.
non_diegetic_music:
A restrained plucked-string comedy score at a medium-slow tempo plays quietly beneath the scene. The music stops briefly before the interviewer's final line, followed by one short wooden-percussion note during the final frozen frame.
也就是说,骚年,要想用好Minimax H3,你得英文上阵才行
不过问题不大,可以先按格式写中文再翻译,不过最快的方式是将上面的完整示例丢给ai去仿写,然后后续去替换元素😂

>十二、最后记住这套五步写法

>
面对任何复杂参考素材,不要直接开始写长提示词
先完成下面五步:
第一步:拆素材
每份素材究竟提供人物、场景、动作、构图、运镜、节奏还是声音?
第二步:定标签
可复用视觉内容用Subject,具体画面锚点用Picture,整段视频关系用Video,声音用Audio
第三步:定保留程度
哪些必须完整保留,哪些允许修改,哪些只是弱参考?
第四步:拆镜头
按照实际播放顺序,把复杂事件拆成多个单动作镜头
第五步:补声音
区分人物台词、环境声和观众才能听见的背景音乐
MiniMax H3全参考提示词的底层逻辑,可以压缩成一句话:
不要告诉模型你上传了什么文件,要告诉模型每份素材负责什么,以及它应该在成片的哪个镜头中如何生效
MiniMax H3的使用有严格的格式要求,与Seedance2.0等模型的使用完全不同,目前来说,必须遵守这个格式才有可能跑出好片子
如果你不想这么麻烦,那就再等等,会有大神在这方面做优化的

>就酱
end
