HyperAIHyperAI

Command Palette

Search for a command to run...

Google 推出 Gemini Omni 模型家族旨在“创造万物”

谷歌于近期推出全新生成式人工智能模型系列 Gemini Omni。该系列旨在实现“从任意输入创造一切”的愿景,首期发布的核心模型名为 Gemini Omni Flash,专注于视频生成与编辑。不同于谷歌此前仅支持文本生成视频的 Veo 模型,Omni Flash 具备多模态输入能力,可结合文本、照片、音频及现有视频作为素材,生成高质量且时长可达 10 秒的视频片段。谷歌深谋远虑地认为,未来将支持更长的输出时长及图像、音频等更多形式。 Omni Flash 的核心优势在于其深厚的世界知识库与强大的对话式编辑功能。基于 Gemini 系列训练数据,模型拥有比 Veo 更丰富的现实世界知识,能生成物理逻辑合理、场景连贯的视频。用户可通过自然语言对话轻松修改视频内容,无论是添加人物形象、改变特定元素还是重构整个场景,系统都能保持角色一致性与上下文连贯。谷歌产品负责人指出,其前代产品 Nano Banana 图像生成器已累计生成超 500 亿张图像,证明了多模态技术的巨大潜力,而 Omni Flash 正将这一智能延伸至视频领域。 该模型将于周二起正式在 Gemini 应用、Google Flow 及 YouTube Shorts 平台上线。谷歌表示,Omni 系列是 Gemini 从原生多模态推理迈向实际创作能力的重要一步,未来将不断拓展其创造边界,让用户能够以前所未有的方式将想法转化为视频内容。此举标志着生成式 AI 在视频制作领域的重大进步,同时也为普通用户提供了更专业、更便捷的视频创作工具。

相关链接