谷歌推出Gemini Omni Flash,视频创作的AI工具
谷歌DeepMind正式发布了Gemini Omni Flash,这是Gemini Omni系列多模态AI模型的首个产品。该模型旨在使视频生成和编辑像对话一样直观,这是谷歌实现统一生成式AI愿景的一大步。Omni Flash承诺将文本、图像、音频和视频等输入整合为一个无缝的创作过程,而不再需要依赖单独的工具来处理这些内容。
Omni团队的成员,包括研究科学家Mohammad Babaeizadeh、产品经理Anish Nangia和研究工程师Sarah Xu,强调了该平台的灵活性。Babaeizadeh在一次圆桌讨论中提到:“它没有上限。” 并列举了从专业视频编辑到更有趣的应用(如更换发型或在视频中插入奇趣元素)的多种用例。
Omni Flash的能力源于其“任意到任意”的多模态设计。与早期专注于特定输入类型(如文本转视频)的AI模型不同,Omni Flash支持在所有支持的格式之间进行迭代编辑和转换。这使其对寻求效率和创作自由的开发者和创作者特别有吸引力。谷歌将该模型定位为Gemini API的预览版,为更广泛的应用铺平道路。
更广泛的Gemini Omni计划不仅仅是技术野心的体现——它也是在生成式AI领域保持领先地位的战略举措。与OpenAI的DALL·E 3和Adobe的Firefly等平台主要聚焦于图像和文本生成不同,视频仍然是一个相对未被充分开发的领域。通过优先发展视频编辑和合成,谷歌瞄准了这一市场中的关键空白。
那么,为什么从视频开始?根据DeepMind团队的说法,视频是多模态方法的自然延伸,提供了一个复杂但回报丰厚的媒介,用于展示模型的优势。实际应用包括创建宣传内容到简化后期制作工作流程,可能为创作者节省数小时甚至数天的时间。
这一公告也恰逢各行业对会话式AI的兴趣日益增加。通过Omni Flash,谷歌希望重新定义用户与生成式工具的互动方式,使用户能够通过自然语言提示实时迭代和完善输出。这种对迭代会话编辑的专注使Omni与谷歌早期的Veo模型区分开来,后者更侧重于直接的文本转视频生成。
展望未来,团队暗示Omni Flash将进一步增强,未来的更新只会扩展模型的能力。尽管目前尚未披露具体的发布时间,但谷歌为开发者提供的持续文档显示了其对该平台的长期承诺。
对于创作者而言,这一工具的意义重大。能够以最少的技术专长生成和编辑视频,可能会使高质量内容创作更加大众化。同时,整合了Gemini API的开发者可能为创意应用和服务解锁新的可能性。