谷歌发布多模态旗舰模型Gemini Omni,支持文字、图像、视频、音频多种输入输出

北京时间5月20日凌晨,谷歌在I/O 2026开发者大会上正式发布多模态旗舰模型Gemini Omni。诺贝尔物理学奖得主、Google DeepMind负责人德米斯·哈萨比斯(Demis Hassabis)在主题演讲中揭开了这款模型的面纱,将其定位为Gemini模型家族迄今为止能力最为全面的版本。

Gemini Omni可同时处理文字、图像、视频、音频等多种输入形式,并在同一生成框架内输出多模态内容。据谷歌介绍,该模型融合了公司当前最先进的几款生成式媒体模型,包括图像模型Nano Banana、视频生成模型Veo以及世界模型Genie。

在现场演示环节,哈萨比斯展示了多项能力:面对用户手绘的一条鱼,Gemini Omni不仅能识别图像内容,还能实时生成流动动画;在“弹珠世界知识”演示中,模型将抽象知识点具象化为弹珠穿行于复杂管道的视觉叙事;在黑洞素描场景下,Omni精准识别物理概念并展开深度讲解;蛋白质折叠演示则直观呈现了其在科学推理与可视化方面的潜力。

与其他模型发布不同,Gemini Omni并非纯粹的对话模型。哈萨比斯称,该模型最终将能够根据任意输入生成任意输出。目前首发版本Gemini Omni Flash以视频生成为主,即日起向AI订阅用户及YouTube Shorts创作者开放。

Gemini Omni被深度集成至Gemini App,成为用户与AI交互的“默认智能引擎”。谷歌CEO桑达尔·皮查伊(Sundar Pichai)在大会上披露,Gemini应用月活跃用户数已达9亿,过去12个月谷歌每月处理的Token量增至3.2千万亿个,同比增长7倍。

市场有风险,投资需谨慎。本文为AI基于第三方数据生成,仅供参考,不构成个人投资建议。

关键词阅读:科技财经资讯风格

责任编辑:磐石
AI智能分析该文,为您挖掘投资机会该AI功能处于试用阶段,内容仅供参考,请仔细甄别!
展开
精彩推荐
加载更多
全部评论
热榜
关闭 下载金融界app
金融界App
金融界微博
金融界公众号