JOTO
Contact us
← AI 智库
开源模型

谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜

2026 年 10 月 9 日

谷歌开源EmbeddingGemma 2,740M参数、567MB内存占用,支持文字、图片、音频、视频跨模态联合嵌入。可在手机、浏览器本地运行,22毫秒完成多模态检索,无需联网或调用API。它统一处理多模态内容至768维语义空间,提升图像/视频检索得分近20分,并支持代码、多语言及离线RAG应用。

EmbeddingGemma 2:首个原生多模态开源嵌入模型

10月6日,谷歌开源EmbeddingGemma 2,把一个能搜图、看视频、听声音的搜索引擎,塞进了一个内存不到600MB的小模型!文字、代码、图片、视频、音频,都能用一句话一起搜了,这在谷歌的开源模型里还是第一次。

740M参数,手机、笔记本、浏览器都能离线跑。谷歌CEO Sundar Pichai也亲自下场安利:这是谷歌首个原生多模态开源嵌入模型。

EmbeddingGemma 2 模型架构示意图
EmbeddingGemma 2 模型架构示意图

本地多模态检索:一句「鸟在唱歌」同时召回照片与录音

它的一大突破,是让手机也能在本地搜图片、视频和声音。演示中,只要输入一句「鸟在唱歌」,鸟的照片和鸟叫录音就能一起找到。

发布一个多小时后,Hugging Face的Victor M就让它在浏览器里跑了起来。他在搜索框里敲下「birds singing」(鸟在唱歌),屏幕上的格子立刻重新排序:排到最前面的,既有鸟的照片,也有显示着波形的鸟叫录音。

整个查询只用了22毫秒,不走服务器,也没调任何API。

浏览器中EmbeddingGemma 2实时检索结果界面
浏览器中EmbeddingGemma 2实时检索结果界面
EmbeddingGemma 2多模态检索动图演示
EmbeddingGemma 2多模态检索动图演示

应用接入它后,你就能让AI帮你找手机里的照片、录音和视频,不必先把文件上传到云端。

谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜 配图 4

统一语义空间:文字、图片、声音可互相检索

Embedding这东西,普通用户平时看不见,但很多AI搜索和RAG问答,背后都靠它找资料。它干的活,是把一段内容变成一串数字,相当于在一个巨大的空间里,给每段内容安排一个坐标。意思越接近,坐标就越靠近。搜索时,系统再去找与问题最接近的那些内容。

上一代EmbeddingGemma只处理文字。要搜图片和声音,往往还得接上其他模型,或先把它们转成文字。EmbeddingGemma 2把这些内容放进了同一个768维空间。

比如,猫的照片、「cat」这个词和猫叫声,就能在这个空间里按语义关联起来。

多模态语义空间对齐示意动图
多模态语义空间对齐示意动图

于是,你可以用一句话搜图片、搜视频,也可以用一段语音,找到视频里对应的片段。它还能把文字、图片和视频放在一起,让你一次搜到包含这些内容的整条信息。

谷歌在模型卡里举了个例子:一双跑鞋的商品页,包含文字介绍、两张细节图,以及鞋子在湿滑岩石上的防滑测试视频。模型能把这组内容转成一个向量,用来匹配「适合越野跑的防水鞋」这样的搜索。

一次能处理的内容也更多了。8K上下文窗口,是上一代的4倍。只输入单一类型的内容时,最多能容纳约5.5分钟音频、29张图片,或58帧视频。它还支持100多种语言。

性能对比:图像与视频检索大幅领先同量级模型

谷歌把它和几个同量级的模型放在一起比了一轮,差距最大的是看图和看视频。

EmbeddingGemma 2与其他模型图像检索得分对比图表
EmbeddingGemma 2与其他模型图像检索得分对比图表
EmbeddingGemma 2与其他模型视频检索得分对比图表
EmbeddingGemma 2与其他模型视频检索得分对比图表

EmbeddingGemma 2在图像和视频检索上,明显领先Jina v5 Omni-Nano。在谷歌公布的测试中,EmbeddingGemma 2的图像检索得分为57.3,比它参数量大三成的Jina v5 Omni-Nano只有31.6。视频检索也拉开了差距:50.7分对31.2分,领先近20分。在多语言文本测试上,它和上一代基本持平。

567MB:手机自己当搜索引擎

这么多本事,全装在740M参数里。其中文本部分占270M,视觉编码器170M,音频编码器300M,可以按需加载。只搜文字,就加载270M;要搜图片,再加上视觉部分,总共440M。

在谷歌的Pixel 11 Pro测试中,量化后的纯文本模型,内存占用最低约191MB,完整多模态模型约567MB。

它还支持给搜索索引「瘦身」:用更少的数字记录每段内容的含义,占用的存储空间就能减少三分之二。在谷歌的多语言文本检索测试中,得分只下降了不到1分。

谷歌自己做了几个应用打样:AI Edge Gallery里的Instant Media Search,能让你在相册里按意思搜照片。Video Moments Finder更直观,说一句话,就能定位视频里对应的片段。另一个应用Foresight,则把它与Gemma 4搭配起来,在Mac上离线检索文件和会议记录。

开发者这边,llama.cpp已经提供支持,Unsloth也放出了量化版,方便把模型部署到本地。

据Mac应用Nativ公布的实测,在M5 Max上,8-bit量化版生成的向量,与原版的余弦相似度达到0.9997,文本嵌入速度达到每秒817条。

Nativ实测EmbeddingGemma 2在M5 Max上的性能数据
Nativ实测EmbeddingGemma 2在M5 Max上的性能数据

真实场景验证:多语言、错别字、低功耗设备均通过测试

土耳其开发者Avenox的测试,更贴近日常。他的笔记大多用英文写,提问却习惯用土耳其语。以前靠关键词匹配,两边的词对不上,相关笔记就可能搜不到。他让Claude花一个小时搭了个测试台,选出40条笔记,再分别换个说法,用土耳其语提问,看正确笔记能不能进入前18个候选。

据他公布的结果,关键词匹配的命中比例只有15%;换上EmbeddingGemma 2,升到了97%。他又拿30条平时随手输入、带有错别字的真实消息测试。模型找到的相关笔记数量,是关键词匹配的两倍。每次查询约50毫秒,全程在本地运行。

还有人玩得更野。开发者Nick Lo把它装进一块Nano开发板。输入一句话,模型只需约15毫秒,就能把这句话转成用于搜索的一串数字。找到对应图片后,再交给一块ESP32-S3单片机,把图像逐行画出来。

Nick Lo在Nano开发板+ESP32-S3上实现EmbeddingGemma 2图像检索输出
Nick Lo在Nano开发板+ESP32-S3上实现EmbeddingGemma 2图像检索输出

Coding Agent也能本地搜代码

除了多模态,代码检索也有明显提升。在代码检索基准MTEB Code上,它从上一代的68.76分涨到78.68分,一口气涨了近10分,谷歌称,这一成绩在同尺寸模型中领先。

这对写代码的Agent很实用。Claude Code、Codex这类工具干活之前,都要先在整个代码库里找到相关的那几段。有了270M的纯文本版,开发者就能在本地为代码库建立索引,再用大白话查找相关代码。建索引和检索这两步,都可以留在本地。

AI搜索正式搬进你的手机

今年3月,谷歌在云端发过多模态的Gemini Embedding 2,通过API调用,按用量付费。半年多后,谷歌又把多模态检索带进了一个能在手机上运行的开源小模型。照片、录音和视频,也有了留在本地检索的选项。

谷歌给出的一个用法,是把它与Gemma 4搭配,做离线、隐私优先的RAG。一个负责找资料,一个负责根据资料回答,检索和问答都能在设备上完成。

过去,要用AI搜索照片、视频和录音,很多时候得把内容交给云端处理。现在,这种检索能力只要几百MB,就有机会装进每个人的口袋。

谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜 配图 10
谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜 配图 11
谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜 配图 12

JOTO 企业落地观察

  • EmbeddingGemma 2 的轻量化多模态嵌入能力,为企业构建端侧RAG知识工程提供了新路径——尤其适用于员工本地设备(如笔记本、平板)中分散的会议录音、截图、文档等混合形态知识资产,无需上传即可完成语义检索。
  • 其按需加载模块(文本270M / 视觉+音频共约567M)的设计,提示企业在设计AI智能体时需明确核心模态优先级:若仅需增强代码/文档检索,可规避视觉与音频模块,显著降低终端部署门槛与资源消耗。
  • 50毫秒级本地查询响应与8K上下文支持,使它成为边缘侧轻量级FDE(Field Deployment Engineer)驻场共创工具的可行底座——例如现场工程师可直接用语音描述故障现象,即时检索历史维修图谱、手册截图与同类工单录音。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.