加载中...
Gemini Omni 是 Google 原生多模态视频模型,曾被认为会命名为 Veo 4。它能将提示词、参考图片和视频片段理解为统一的创作指令,并通过自然语言完成视频生成、局部编辑和混剪。借助更强的上下文理解、视觉一致性、音频控制与最高 4K 输出,你可以更直接地把创意素材变成完整视频。
从统一的多模态输入到自然语言编辑、连贯叙事、音频控制和数字人,Gemini Omni 将视频生成与编辑放进同一个创作流程。
Gemini Omni 不局限于单一输入类型。你可以用文字解释概念,用图片定义人物或视觉风格,用视频片段提供运动和场景上下文。模型会把这些参考理解为一个连贯指令,生成更准确、更富表现力且更贴近创作意图的视频。

Gemini Omni 把剪辑变成对话。无需手动调整时间线、遮罩或重新生成整个片段,只要说明需要修改的内容,模型就能更换元素、调整动作或优化细节,同时尽量保留原有镜头、运动和风格。

直接利用已有视频进行再创作,让一个或多个片段在保留原有结构和创意方向的同时演变成新版本。它适合广告重制、生活方式素材与产品镜头融合,以及需要快速迭代的创意工作流。

无需重做整个场景,即可聚焦需要改进的对象或细节。Gemini Omni 能在尽量保持构图、人物动作、镜头和整体风格不变的前提下,替换物体或修复局部内容。

Gemini Omni 能持续追踪角色身份、环境布局、视觉风格和场景细节,让镜头之间更连贯。更稳定的文字和公式表现也让它适合课程、教程、产品演示、动画内容和品牌故事。

Gemini Omni 将 Google 更广泛的 AI 知识用于视频生成,理解主题、语境与逻辑关系,创建更具信息量和结构的场景。它适合历史内容、教育讲解、科学可视化和产品演示。

为视频生成与氛围、节奏和场景相匹配的语音、环境声与音效。清晰对白、自然口型、纸张摩擦声和环境氛围可以共同服务于叙事,让结果更完整、更具沉浸感。

Gemini Omni 可以在不同摄像机角度之间流畅切换,从正面镜头、侧面视角到俯拍和地面机位,同时保持人物和环境一致,为电影创作、培训演示与产品展示提供更丰富的镜头语言。

使用参考图片保持脸型、发型和整体身份一致,生成带自然口型、面部表情和细微动作的数字人视频。适合故事讲述者、教育者、虚拟主播和希望在保持现实身份隐私的同时与观众互动的创作者。
Gemini Omni 面向需要统一多模态输入、精确创意控制和高质量视频输出的个人与团队。
制作原型、预可视化、专业广告和叙事短片。
制作角色一致、音频丰富的 Reels、Shorts、TikTok、产品视频和品牌内容。
将复杂概念转化为具有清晰逻辑和视觉结构的讲解、培训与课程视频。
通过多模态参考、视频编辑和 4K 输出构建更完整的专业创作流程。
选择模型,输入提示词并按需上传参考图片或视频,然后设置输出参数并生成。
打开 AnyAIHub 视频生成器,在模型选择器中选择 Gemini Omni。
描述要生成或编辑的视频,并按需上传图片或一段视频作为人物、场景、风格或运动参考。
选择 16:9 或 9:16、4/6/8/10 秒及 720p、1080p 或 4K,生成完成后预览并下载视频。
了解 Gemini Omni 的模型定位、输入方式、编辑能力、时长、分辨率和积分规则。
Gemini Omni 是 Google 原生多模态创作模型,首先开放视频生成与编辑能力。它能统一理解提示词、图片和视频参考,并通过自然语言创建或修改视频。
Veo 3 主要面向文字和图片驱动的视频生成;Gemini Omni 更强调多模态参考、已有视频编辑和重制、场景一致性、多角度镜头以及最高 4K 输出。
当前 Kie 接口支持提示词、最多 7 张参考图片,或 1 个视频与剩余图片配额的组合。一个视频占用 2 个配额,图片占用 1 个,总配额不超过 7。
可以。你可以上传一段不超过 30 秒的视频,当前生成会使用其中最长 10 秒的片段,并通过自然语言更换对象、转换场景、调整动作或重制素材。
无视频输入时可选择 4、6、8 或 10 秒,支持 720p、1080p 和 4K。提供视频输入时,输出时长由模型自动决定。
无视频输入时,720p/1080p 的 4、6、8、10 秒分别为 63、84、105、126 积分,4K 分别为 147、168、189、210 积分;有视频输入时,720p/1080p 为 168 积分,4K 为 252 积分。
从文字、图片和视频参考出发,用自然语言生成、编辑和重制支持原生音频与 4K 输出的视频。