Skip to main content
提示词是 H3 多模态训练最能发挥价值的地方:镜头、镜头运动、对话和音效全部集中在一个提示词块中。本页汇总了 ComfyUI 中 MiniMax H3 的提示词编写资源:MiniMax 官方指南、适用于所有工作流的通用技巧,以及用于风格效果的提示词嵌入。

官方指南

MiniMax 发布了两份官方提示词编写指南:
  • 基础生成模式(T2VA、I2VA、FL2VA、L2VA):将提示词组织为带时长的镜头,并配合镜头运动与音频(对话、音效、音乐),每种模式都配有示例
  • 全参考模式(R2V):重写输出的结构,包括主体定义、参考标签和保留分析,以及如何为每个参考在目标镜头中分配角色
MiniMax 还发布了可安装的 H3 skills,其中有提示词编写技能,可将这些指南打包供智能体使用。 各工作流页面展示了这些指南在每个模板中的应用:文生视频与图生视频参考生视频多帧参考Fun ControlNet Union

通用技巧

  1. 描述整个场景:先交代整体场景(地点、人物、正在发生什么),再将其拆分为带时长的各个镜头
  2. 镜头、镜头运动与音频:在一个提示词块中描述镜头、镜头运动以及相应的音频(对话、音效、音乐)
  3. 分辨率:H3 的原生画布短边为 768px,16:9 下为 1344x768,分辨率会取整为 32 的倍数。参见设置输出分辨率
  4. 时长:时长输入会吸附到模型在 24fps 下的每块 17 帧(17k+5)网格上
各工作流专属的提示词方法(参考标签、时间轴锚点、控制视频长度)会在各工作流页面中另行说明。

提示词嵌入

Comfy-Org/ComfyUI#15697 为 MiniMax H3 加入了提示词嵌入支持。你可以在 H3 提示词中使用 ComfyUI 标准的 embedding: 语法。 将嵌入文件放在 ComfyUI/models/embeddings/ 中,然后在提示词中按名称引用即可,例如 embedding:my_embedding。该嵌入会像其他任何 ComfyUI 模型一样被加载并混入文本条件中。 Comfy-Org/MiniMax-H3 仓库的 embeddings 文件夹中托管了 10 个风格嵌入。这些文件并非官方文件:它们由社区成员 silveroxides 通过 Hugging Face PR #50 贡献,并非由 Comfy-Org 或 MiniMax 制作。原始文件位于 silveroxides/MiniMax-H3_tests 仓库中。文件名描述了预期效果,触发词是不带扩展名的文件名: