Skip to main content
使用 Google 的 Gemini Omni Flash 模型,根据文本提示生成带有音频的视频。可选择提供参考图像和/或参考视频来引导或编辑结果。直接在提示中描述所需的时长(3-10 秒)和宽高比(16:9 或 9:16)。

输入

通用输入

Omni Flash 输入

参考输入

注意事项:
  • 如果图像输入包含多个帧,则每一帧都计入 14 张图像的上限。
  • 当提供参考图像或视频时,编码后的媒体总大小必须保持在约 90 MB 以下;否则节点会报错。
  • 当未提供参考图像或视频时,节点仅根据文本提示生成视频。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): 648844868affb68298d2eac8ac20095bfe378d32e721396781de330ef6a6d69f