如果你想在手机上离线体验 Gemma 4,这篇文章会带你从安装到实用功能一步步跑通。
第 1 步:获取应用
Google AI Edge Gallery 目前已经提供 Google Play 正式入口。Android 设备要求 Android 12 或更高版本;无法使用 Google Play 时,才需要从 GitHub Releases 侧载 APK。
优先从 Google Play 安装:
需要侧载时,再在 Android 设备上依次进入:
设置 -> 应用 -> 特殊应用权限 -> 安装未知应用
然后:
-
找到你使用的浏览器(例如 Chrome 或 Firefox),开启“允许来自此来源”。
-
在手机浏览器打开 Google AI Edge Gallery Releases。
-
下载最新的
.apk安装包。 -
下载完成后,在通知栏或文件管理器中点开安装包,按提示完成安装。
不要使用第三方 APK 下载站。侧载前核对发布者、版本号和 GitHub Release 附件,安装后再关闭浏览器的“允许来自此来源”。
第 2 步:首次打开并授权
首次打开后按应用实际提示授予必要权限。不要预先开放与当前功能无关的照片、麦克风或摄像头权限;只在使用 Ask Image 或 Audio Scribe 等功能时授权。
首页一般会看到这些入口:
Ask Image:图像理解任务(描述图片、回答图片相关问题)AI Chat:常规文本对话Summarize:粘贴文本并生成摘要Smart Reply:生成回复建议
大多数用户最常用的是 AI Chat。
第 3 步:下载 Gemma 4 模型
- 进入
AI Chat。 - 按提示点击
Get Models。 - 在模型列表中选择当前版本实际提供的 Gemma 4 变体,并查看下载体积与设备提示。
- 按可用内存而不是只按手机标称 RAM 选择模型;后台应用、共享 GPU 内存和上下文长度都会影响能否加载。
- 点击
Download,后台开始下载。
注意:模型越大,下载时间越长。你也可以下载多个模型,后续按需切换,已下载模型会保存在本机,不必重复下载。
第 4 步:开始对话
模型下载完成后:
- 点击模型名称进行加载,并记录首次加载耗时;不要把固定的“10 到 30 秒”当作所有手机都能达到的结果。
- 在聊天框输入问题并发送。
- 模型会在本地生成回复,数据不会上传到云端。
一般第一条回复会受模型加载和预热影响;同一会话后续回复可能更快,实际以应用 benchmark 和设备温度为准。
第 5 步:体验视觉能力(Gemma 4 多模态)
如果你下载的是 Gemma 4 多模态版本:
- 返回主菜单,进入
Ask Image。 - 选择一张图片,或直接拍照。
- 输入你想问的问题(例如“这张图里有什么?”或“图里有哪些文字需要注意?”)。
- 等待模型在本地分析并返回结果。
这项功能可以离线使用,图片内容也不会发送到外部服务器。
用内置 Benchmark 判断手机是否适合
AI Edge Gallery 提供模型管理与 benchmark。至少记录以下信息:
| 项目 | 记录内容 |
|---|---|
| 设备 | 手机型号、SoC、Android 版本 |
| 应用 | AI Edge Gallery 版本 |
| 模型 | 完整名称、量化与下载大小 |
| 内存 | 运行前后的可用内存 |
| 延迟 | 首 token 时间与持续生成速度 |
| 稳定性 | 是否闪退、降频或因温度中止 |
同一模型至少运行两次:第一次观察加载与预热,第二次观察持续生成。手机发热明显时暂停测试,避免把降频后的结果误认为模型本身性能。
离线与隐私怎么验收
官方项目说明推理在设备本地完成,但模型下载、首次授权和某些外部 Skill 仍可能需要网络。可以在模型下载完成后开启飞行模式,再运行固定提示词:
|
|
飞行模式下仍能生成,说明该模型的核心推理链路已经离线可用。若使用 Wikipedia、地图等 Agent Skills,则应单独检查这些工具是否访问网络,不要把“模型本地推理”扩大成“应用所有功能都永不联网”。
常见失败判断
模型下载完成但无法加载
先释放后台应用和存储空间,再选更小的模型。下载成功只代表文件落盘,不代表设备有足够连续内存完成加载。
生成中闪退或手机明显降频
降低上下文、选择更小模型,并关闭省电模式或过多后台任务。不要长期在高温状态连续跑 benchmark。
APK 无法安装
确认 Android 版本符合要求、APK 来自官方 Release,并检查是否已经安装签名不同的旧版本。必要时先备份应用数据,再卸载冲突版本。