
谷歌推出 Gemini Embedding 2:多模态嵌入模型助力信息理解
谷歌最新发布的 Gemini Embedding 2 模型,支持文本、图像、视频等多模态数据嵌入,提升信息理解能力,适用于检索增强生成、语义搜索等多种应用场景。
谷歌近日发布了 Gemini Embedding 2 模型,这是其首个原生多模态嵌入模型,能够将文本、图像、视频和文档等不同类型的数据映射到同一嵌入空间。
不同于生成式模型,Gemini Embedding 2 主要用于理解数据,将文本、图像或视频转换为向量等数学形式,便于机器读取和分析。
该模型支持语义搜索、分类和聚类等功能,能够理解语义关系,提供更准确、更具上下文的信息。
支持的数据类型包括:文本、图像、视频、音频和文档,且能在 100 种语言中识别语义意图。
具体处理限制如下:

- 文本:上下文窗口最高 8192tokens
- 图像:每次请求最多 6 张,支持 PNG 和 JPEG 格式
- 视频:最多 120 秒输入,支持 MP4 和 MOV 格式
- 音频:可直接处理音频数据,无需先进行转录
- 文档:支持最多 6 页 PDF
谷歌表示,新模型可简化数据处理流程,增强多模态应用能力,适用于检索增强生成、语义搜索、情感分析以及数据聚类等场景。
模型还支持在一次请求中同时接收多种输入,如“图像 + 文本”,分析不同媒体类型之间的关系。
在诉讼取证等应用中,Gemini Embedding 2 可帮助专业人士快速找到关键证据,提升检索精度和召回率。
目前,Gemini Embeddings 2 已通过 Gemini API 和 Vertex AI 提供公开预览,同时 gemini-embedding-001 仍可用于只处理文本的应用场景。