谷歌推出 Gemini Embedding 2:多模态嵌入模型助力信息理解

谷歌最新发布的 Gemini Embedding 2 模型,支持文本、图像、视频等多模态数据嵌入,提升信息理解能力,适用于检索增强生成、语义搜索等多种应用场景。

8效率工具多模态嵌入信息理解谷歌数据处理

谷歌近日发布了 Gemini Embedding 2 模型,这是其首个原生多模态嵌入模型,能够将文本、图像、视频和文档等不同类型的数据映射到同一嵌入空间。

不同于生成式模型,Gemini Embedding 2 主要用于理解数据,将文本、图像或视频转换为向量等数学形式,便于机器读取和分析。

该模型支持语义搜索、分类和聚类等功能,能够理解语义关系,提供更准确、更具上下文的信息。

支持的数据类型包括:文本、图像、视频、音频和文档,且能在 100 种语言中识别语义意图。

具体处理限制如下:

谷歌首个原生多模态嵌入模型 Gemini Embedding 2 发布:能让机器“理解”信息插图

  • 文本:上下文窗口最高 8192tokens
  • 图像:每次请求最多 6 张,支持 PNG 和 JPEG 格式
  • 视频:最多 120 秒输入,支持 MP4 和 MOV 格式
  • 音频:可直接处理音频数据,无需先进行转录
  • 文档:支持最多 6 页 PDF

谷歌表示,新模型可简化数据处理流程,增强多模态应用能力,适用于检索增强生成、语义搜索、情感分析以及数据聚类等场景。

模型还支持在一次请求中同时接收多种输入,如“图像 + 文本”,分析不同媒体类型之间的关系。

在诉讼取证等应用中,Gemini Embedding 2 可帮助专业人士快速找到关键证据,提升检索精度和召回率。

目前,Gemini Embeddings 2 已通过 Gemini API 和 Vertex AI 提供公开预览,同时 gemini-embedding-001 仍可用于只处理文本的应用场景。