官方指南
MiniMax 发布了两份官方提示词编写指南:- 基础生成模式(T2VA、I2VA、FL2VA、L2VA):将提示词组织为带时长的镜头,并配合镜头运动与音频(对话、音效、音乐),每种模式都配有示例
- 全参考模式(R2V):重写输出的结构,包括主体定义、参考标签和保留分析,以及如何为每个参考在目标镜头中分配角色
通用技巧
- 描述整个场景:先交代整体场景(地点、人物、正在发生什么),再将其拆分为带时长的各个镜头
- 镜头、镜头运动与音频:在一个提示词块中描述镜头、镜头运动以及相应的音频(对话、音效、音乐)
- 分辨率:H3 的原生画布短边为 768px,16:9 下为 1344x768,分辨率会取整为 32 的倍数。参见设置输出分辨率
- 时长:时长输入会吸附到模型在 24fps 下的每块 17 帧(17k+5)网格上
提示词嵌入
Comfy-Org/ComfyUI#15697 为 MiniMax H3 加入了提示词嵌入支持。你可以在 H3 提示词中使用 ComfyUI 标准的embedding: 语法。
将嵌入文件放在 ComfyUI/models/embeddings/ 中,然后在提示词中按名称引用即可,例如 embedding:my_embedding。该嵌入会像其他任何 ComfyUI 模型一样被加载并混入文本条件中。
Comfy-Org/MiniMax-H3 仓库的 embeddings 文件夹中托管了 10 个风格嵌入。这些文件并非官方文件:它们由社区成员 silveroxides 通过 Hugging Face PR #50 贡献,并非由 Comfy-Org 或 MiniMax 制作。原始文件位于 silveroxides/MiniMax-H3_tests 仓库中。文件名描述了预期效果,触发词是不带扩展名的文件名: