
Gemini Omni“全能”模型震撼发布,革新视频编辑,实现“任意输入任意输出”
谷歌在2026年I/O开发者大会上发布了新一代多模态大模型Gemini Omni,标志着AI大模型进入全能时代。该模型能够实现从任何输入生成任何输出的能力,包括音频生成动态图像、草图生成3D场景等,并引入了颠覆性的“对话式编辑”功能,大幅提升视频编辑效率。
新一代AI大模型Gemini Omni震撼发布
5月20日,谷歌在2026年I/O开发者大会上正式发布了新一代多模态大模型Gemini Omni,标志着AI大模型正式跨越了单一或简单叠加模态的局限,迈入了全能时代。
全能模型,诺奖得主挂帅
诺贝尔奖获得者、Google DeepMind负责人德米斯·哈萨比斯亲自揭开了Gemini Omni的面纱。他强调,Gemini Omni是迄今为止能力最为全面、最深刻的版本,实现了真正的原生多模态融合。

任意输入任意输出,颠覆视频编辑
Gemini Omni最引人注目的核心突破是其“从任何输入生成任何输出”的能力,包括音频生成动态图像、草图生成3D场景等。此外,其首创的“对话式编辑”功能,让视频编辑变得简单高效。
全面接入谷歌生态,开发者迎来新机遇
作为主打高效与敏捷的版本,Gemini Omni Flash已全面接入谷歌核心产品生态,包括Gemini App、Google Flow和YouTube Shorts等,为开发者提供了更多可能性。