AI 见闻
精选· 重要性 5/5

Google 推出 Gemini Omni:原生多模态视频生成与编辑模型

Google DeepMind Blog··约 8 分钟阅读
中文导读

Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并通过自然语言对话式编辑,结合了 Gemini 的推理能力与创造力。

介绍 Gemini Omni去年,Nano Banana 将 Gemini 的智能引入图像生成和编辑。自那时起,它已帮助数百万人修复老照片、根据草图进行设计,并以以前不可能的方式将想法可视化。

从一开始,我们就将 Gemini 构建为原生多模态模型,现在我们正在迈出下一步。我们推出 Gemini Omni,在这里 Gemini 的推理能力与创造力相遇。Omni 是我们的新模型,可以根据任何输入创建任何内容——从视频开始。

通过 Omni,你可以将图像、音频、视频和文本组合作为输入,并基于 Gemini 的现实世界知识生成高质量视频。你还可以通过对话轻松编辑视频。

今天,我们向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列的首个模型:Gemini Omni Flash。未来我们将支持图像和音频等输出模态。

以下是 Omni 的一些特别之处:通过对话编辑视频Gemini Omni 为你提供了一种更简单的视频编辑方式——使用自然语言。每条指令都基于上一条指令。你的角色保持一致,物理规律成立,场景记住之前发生的一切。

改变你周围的世界。改变特定事物,或改变一切。你的视频成为你永远无法亲自拍摄的事物的起点。提示:用气泡制作雕塑。重新想象动作。

拍摄一段视频,只需让 Omni 改变正在发生的事情。编辑动作、添加新角色或物体,或将某个瞬间转变为意想不到的事物。提示:当人触摸镜子时,让镜子像液体一样美丽地泛起涟漪,人的手臂变成反光镜面材质。

提示:调暗房间灯光。将黑白棋盘格房间放入一个玻璃球中,玻璃球漂浮在手部上方并跟踪手部,球内包含同一只手握住球体的递归表示,形成无限递归的房间。摄像机缓慢靠近球体,形成视频循环。提示:公寓的灯光开始与音乐同步亮起。

通过多轮对话优化你的视频。更改环境、角度、风格甚至具体细节,而不会丢失原始场景的线索。滚动轮播查看编辑如何层层叠加。提示:小提琴家演奏歌曲的视频。提示:将小提琴家传送到图像环境。提示:让小提琴隐形。

提示:将摄像机角度改为越过小提琴家的肩膀。基于 Gemini 的世界知识将想法变为现实Gemini Omni 不仅构建看起来真实的场景,还会推理接下来应该发生什么。

它将直观的物理理解与 Gemini 在历史、科学和文化背景方面的知识相结合,弥合了照片级真实感与有意义叙事之间的差距。

创建具有更准确物理效果的视觉效果。Omni 对重力、动能和流体动力学等力有了更直观的理解,使你能够创建更逼真的场景。提示:弹珠在连锁反应式轨道上快速滚动,连续平滑镜头。融合知识与创造力。Omni 利用 Gemini 的知识,以远超模式匹配的方式连接语言、图像和意义。

提示:视频展示字母表中的物品。每个字母开头的独特物品放在桌子上(例如 C 的水豚、D 的迪斯科球和 L 的熔岩灯)。所有 26 个字母必须由 26 个物品表示,并配有匹配的下三分之一字幕显示该字母。

每次只显示一个物品和字幕。每个下三分之一字幕看起来像黑色记号笔写在左下角的纸片上。快速切换,每个物品约 9 帧,24 FPS。最后一帧是一张纸片,写着“THE END”。整个视频伴随平静流畅的音乐。

复杂想法可视化。Omni 可以根据简短提示创建引人入胜的解说视频,生成分解复杂概念的视觉效果。提示:蛋白质折叠的黏土动画解说,一切由黏土制成,无手,定格动画,准确。根据任意输入组合创建视频引用任何内容。

Omni 将任何参考(图像、文本、视频或音频)转化为单一、连贯的输出。

虽然音频输入最初仅支持语音参考,但我们很快将推出其他类型的音频输入。提示:基于 image_0.png 的动态科幻电影风格视频。元素亮起方式类似于 video_0.mp4,与 audio_0.wav 的音乐节拍同步。

提示:参考 video-0 中极端的摄像机运动、透视和畸变,从 image-0 中的角色创建正面全身行走循环,在行走循环中快速风格转换到多种视觉风格,从现实电影开始。保持环境不变,仅改变风格。

硬切背景始终以天空为中心。连续行走、连续音频,风格转换与音频节拍完美同步。电影感,16:9。提示:添加竖琴声,与我触摸每片蕨叶时同步。

将叶子结构全部改为类似半透明 3D 生物发光植物,周围有生物发光萤火虫飞舞,在我演奏时做出反应,与声音同步,微妙的散景景深动态照明,反射在房间墙壁上,保持房间结构不变。从你已有的内容开始。通过输入参考,你可以使用角色、场景或绘图的图像,以符合你愿景的方式进行创作。

提示:想象当我行走时,世界逐渐变为复古未来主义风格(颗粒感且情绪化,如 image-1)。使用音频作为复古未来主义背景音乐。10 秒。

提示:将其转为真实镜头,仅将绘图作为运动指导,最终视频中不显示绘图。提示:将输入视频中的姿势和运动应用于此图像中提供的角色。将图像参考中的风格应用于新视频。应用风格、运动或效果。通过使用输入参考定义视觉语言,或仅用自然语言描述。

Omni 融合输入参考以创建连贯的片段。提示:编辑此内容,保持一切不变。添加从滑板中发出的动画运动效果。提示:将提供的视频中鲸鱼游泳的运动应用于提供的流体反射材料图像。不显示鲸鱼或水;而是让这种反射运动材料形成类似游泳鲸鱼的形状。

用水替换为移动的白色光滑材料形状。使用你自己的数字形象创建视频我们致力于负责任地开发 AI,并制定了明确的政策来保护用户免受伤害,并管理我们 AI 工具的使用。

首先,你可以通过使用 Avatars 用自己的声音创建视频,Avatars 会创建你的数字版本,以便你生成看起来和听起来都像你的视频。除了形象功能之外,在编辑视频以更改音频和语音方面,我们仍在努力测试并更好地了解如何负责任地将此功能带给用户。

所有使用 Omni 创建的视频都包含我们不可感知的 SynthID 数字水印。你可以通过 Gemini 应用、Chrome 中的 Gemini 和 Google 搜索轻松验证视频是否由 Gemini Omni 生成。

你可以在我们的博客文章中了解更多关于我们如何扩展内容透明度和验证工具的信息,以帮助你了解内容在网络上是如何创建和编辑的。立即尝试 Gemini Omni今天,我们推出 Omni 系列的首个模型——Gemini Omni Flash。

Gemini Omni Flash 今天通过 Gemini 应用和 Google Flow 向全球所有 Google AI Plus、Pro 和 Ultra 订阅者推出。

从本周开始,它还将免费向 YouTube Shorts 和 YouTube Create 应用的用户推出。在接下来的几周内,我们还将向开发者推出。

原文出处
Introducing Gemini Omni

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读