模型到应用 · 找回已有素材

不记得文件名,也能找回一段画面:EmbeddingGemma 2

输入“海龟吃东西”,直接找出视频中的几处时间点。看 Google 的手机演示,理解一个小模型怎样把文字、照片、声音与视频接到同一套本地搜索里。

可通过 Google AI Edge Gallery 体验官方示例,需要先安装应用并准备模型。本文依据公开演示与文档,未在本站手机或私人图库中实测。

Google 演示输入 Turtle eating,返回海龟画面的候选时间点,下方是播放器和时间线。
Google 官方演示约 11 秒的手机画面,去除左右空白,界面未改绘。查询是“海龟吃东西”,结果可以继续打开查看;画面中的分数表示匹配程度。 · 打开大图
本文目录4 个章节

EN

记得画面,就从画面里的事开始找

Google 的手机演示里,用户输入“海龟吃东西”,应用列出视频中的多个候选片段,每个都带时间点。点开其中一个,下方播放器进入对应位置。这把找素材的问题从“文件叫什么”推进到了“我要的那一刻在哪里”。

10 月 6 日发布的 EmbeddingGemma 2 是这些示例背后的模型。演示让人看见一种具体用途:拍下很长的视频以后,可以先描述记得的画面,再回到原片确认。它展示了检索路径,私人录像里能找准多少,还需要用自己的材料判断。

来源与延伸阅读

EN

同一模型,把几种材料变得可以比较

上一代 EmbeddingGemma 面向文字;第二代把文字、代码、图片、音频和视频放进同一个表示空间。可以把它理解为替材料生成一组用于比较的数字:一句描述与一张照片虽然形式不同,也能被拿来寻找相近的含义。完整模型为 7.4 亿参数,权重已在 Google 的公开仓库中提供。

另一段演示打开了猫趴在键盘上的照片,并提供继续找相似图片的按钮。搜索的起点因此不必只有文字,也可以是手边已有的一张图。模型输出这种可比较的表示,应用再把结果做成照片网格、视频时间点和可以打开的文件。

Google 手机演示里的照片结果:一只猫趴在笔记本键盘上,下方提供寻找相似图片的入口。
Google 官方演示约 21 秒的手机画面,去除左右空白,保留英文结果界面。打开一张照片后,还能把它作为继续寻找相似素材的起点。 · 打开大图
来源与延伸阅读

EN

本地搜索,还需要应用先整理素材

Google 的开发说明把这个过程拆开了:应用先为媒体建立本地索引,查询时再比较输入与索引里的表示,返回相似的结果。Gallery 的两个入口分别负责找媒体、找视频中的片段;它们展示了模型如何接到手机界面。首次准备模型与素材索引,和之后在设备上检索,是两个不同阶段。

前天介绍的 SCM 也在回答“忘了文件名,怎样找回素材”,既有版本采用 CLIP、SigLIP 等模型,并把画面文字和对白检索分别处理。现在多了一条官方手机示例,可以对照着看:你需要找整张图片、一句对白,还是视频中的某个动作?不同结果背后,应用安排的索引与返回方式也不同。

来源与延伸阅读

EN

找到候选以后,打开原片看一眼

这里的匹配分数是检索排序的依据,不能直接读成“有多少概率找对了”。对读者而言,最有用的闭环很简单:描述记得的内容,得到几处候选,打开原图或原片确认,再把它放进正在整理的相册、笔记或作品。

这次发布值得接续的地方,是源头模型与日常找素材之间已有可见的应用示例。下一步值得看的,是中文查询、相近场景容易混淆的照片,以及更长录像里的定位表现;本文没有把这些尚未实测的结果提前写成结论。

来源与延伸阅读