Gemini Omni“全能”模型震撼发布,革新视频编辑,实现“任意输入任意输出”

谷歌在2026年I/O开发者大会上发布了新一代多模态大模型Gemini Omni,标志着AI大模型进入全能时代。该模型能够实现从任何输入生成任何输出的能力,包括音频生成动态图像、草图生成3D场景等,并引入了颠覆性的“对话式编辑”功能,大幅提升视频编辑效率。

8效率工具AI大模型视频编辑多模态Gemini Omni

新一代AI大模型Gemini Omni震撼发布

5月20日,谷歌在2026年I/O开发者大会上正式发布了新一代多模态大模型Gemini Omni,标志着AI大模型正式跨越了单一或简单叠加模态的局限,迈入了全能时代。

全能模型,诺奖得主挂帅

诺贝尔奖获得者、Google DeepMind负责人德米斯·哈萨比斯亲自揭开了Gemini Omni的面纱。他强调,Gemini Omni是迄今为止能力最为全面、最深刻的版本,实现了真正的原生多模态融合。

Gemini Omni“全能”模型震撼登场,一句话颠覆视频编辑,实现“任意输入生任意输出”插图

任意输入任意输出,颠覆视频编辑

Gemini Omni最引人注目的核心突破是其“从任何输入生成任何输出”的能力,包括音频生成动态图像、草图生成3D场景等。此外,其首创的“对话式编辑”功能,让视频编辑变得简单高效。

全面接入谷歌生态,开发者迎来新机遇

作为主打高效与敏捷的版本,Gemini Omni Flash已全面接入谷歌核心产品生态,包括Gemini App、Google Flow和YouTube Shorts等,为开发者提供了更多可能性。