
Google AI Edge Gallery 离线落地指南在手机上跑本地 AI 的完整路径【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/galleryGoogle AI Edge Gallery 是一个面向移动端的本地 AI 平台它把开源大模型直接装进你的 Android 或 iOS 设备离线推理、生成式对话、图像问答全部在本地完成不经过任何服务器。对设备端 AI 有真实落地需求的人来说这是目前少数能把离线跑大模型变成开箱即用体验的开源项目Apache 2.0 协议。一、为什么要把大模型搬上设备如果你正在评估本地部署 AI 模型大概率会撞上这三个问题数据出不了网。金融单据、病历、工业图纸这类内容上传到云端 API 意味着合规风险。Gallery 的推理发生在设备硬件上提示词、图片、音频都不离开本机——这是架构决定的不是配置项。网络条件不可靠。工厂车间、野外作业、机舱环境里云端服务时断时续。模型文件一旦下载并加载完成后续所有功能断网可用。想自己挑模型。云端 API 给你什么用什么而 Gallery 内置模型库支持从 Hugging Face 拉取社区模型也支持加载你自己的自定义模型。这三条里只要占一条端侧生成式 AI 就值得认真评估。二、三步把平台跑起来第 1 步确认设备门槛。平台系统要求内存建议Android12 及以上6GB 起步iOS17 及以上6GB 起步为什么强调内存看仓库里的模型白名单 model_allowlist.json最小的 Gemma3-1B 4-bit 量化版文件约 555MB、运行峰值内存约 2.1GBGemma-3n-E4B 峰值内存则逼近 7GB。内存低于 6GB 的设备只能跑 1B 级别的小模型加载稍大的模型会被系统杀掉。第 2 步安装应用。三条渠道任选Google Play / App Store 直接安装没有 Play 渠道的地区从最新 Release 页拿 APK 侧载企业设备统一分发也可以走 APK。模型本身是应用内按需下载的首次使用某个任务前所以安装包很小。第 3 步下载并验证模型。进入对应任务如 AI Chat选择模型并等待下载完成即可离线对话。如果要做本地构建参考DEVELOPMENT.mdgit clone https://gitcode.com/GitHub_Trending/gallery44/gallery用 Android Studio 打开Android/目录。注意模型下载功能依赖 Hugging Face 的 OAuth 配置需要把你在 Hugging Face 创建的开发者应用的clientId和redirectUri填入 ProjectConfig.kt并在app/build.gradle.kts里同步修改appAuthRedirectScheme否则下载功能不可用。三、能力盘点这套离线平台到底能干什么按能力维度拆开看每一项对应仓库里真实存在的任务模块文本对话AI Chat。多轮对话支持流式输出对 Gemma 4 系列支持思考模式Thinking Mode可以展开查看模型的逐步推理过程排查复杂问题的解法时有用。图像理解Ask Image。用相机或相册里的图片提问识别物体、解视觉题、生成详细描述。走多模态模型如 Gemma-3n白名单里标记了llmSupportImage: true。音频转写与翻译Audio Scribe。语音录音实时转文字并翻译用的是设备端小模型适合会议纪要、口述记录这类场景。设备控制Mobile Actions。基于 FunctionGemma 270M 微调AI 可以直接驱动手机完成离线的设备操作和自动化任务。智能体技能Agent Skills。给对话模型外挂工具查 Wikipedia 做事实核对、交互式地图、可视化摘要卡片。技能以模块化方式提供见 skills/built-in/每个技能就是一个带SKILL.md的目录也支持从 URL 加载。参数实验Prompt Lab。单轮测试工作台能单独调 temperature、top-k 等采样参数适合做 prompt 对比实验。基准测试Benchmark。内置跑分工具量化每个模型在你这台设备上的表现后面单独讲。小样本场景演示Tiny Garden。用自然语言种花收菜的迷你游戏底层是 FunctionGemma 270M 微调用来演示工具调用Function Calling在端上的完整链路代码在 customtasks/tinygarden/是理解智能体机制的好入口。四、拆开看这套离线推理栈怎么搭的从下往上四层每层都对应仓库里的具体实现模型执行层LiteRT 运行时。Google 把 TensorFlow Lite 演进为 LiteRT负责在移动硬件上做优化后的模型执行。应用侧代码通过 LiteRT-LM 接口调用例如 LlmModelHelper.kt 封装了模型实例的生命周期。推理 API 层LLM Inference API。Google AI Edge 提供的设备端大模型推理接口白名单里的模型描述明确写着走 MediaPipe LLM Inference API 部署支持文本/图像输入和 4096 的上下文长度以 Gemma-3n 为例。应用框架层Kotlin Jetpack Compose Hilt。任务、模型、技能都是可插拔模块用 Hilt 依赖注入装配见customtasks/*TaskModule.kt的IntoSet模式这也是二次开发成本不高的原因。模型供给层Hugging Face 集成。模型发现、元数据拉取走 HuggingFaceApiClient.kt下载由后台 Worker 完成官方白名单model_allowlists/则按版本约束每个 app 版本可提供的模型集合企业分发时可以据此锁死模型范围。一句话概括LiteRT 负责算得动LLM Inference API 负责调用方便白名单机制负责可控地发。五、二次开发换自己的模型、加自己的任务接入自定义.litertlm模型。应用支持加载自有模型文件模型管理逻辑集中在 ModelManagerViewModel.kt模型数据结构定义在 Model.kt。实操路径是把模型转成 LiteRT 兼容的量化格式白名单里的模型文件均为 int4/int8 量化的.task文件然后在模型管理器中导入——应用会把它挂进你的模型库并允许各任务选用。量化位宽和文件体积直接决定内存占用对照第二节表格选档位。开发专属任务模块。任务入口抽象是一个接口定义和完整注释见 CustomTask.kt实现它需要五步实现CustomTask接口在task属性里声明名称、描述、图标和可用模型列表实现initializeModelFn/cleanUpModelFn处理模型的加载与释放实现MainScreenComposable 作为任务详情界面App 栏、模型选择器、配置按钮已由框架提供写一个 Hilt 模块用ProvidesIntoSet把实现绑定进CustomTask集合任务就会自动出现在首页参考仓库自带的 customtasks/examplecustomtask/ 示例抄结构。如果你只是要扩展能力而不是新增入口改技能更轻往skills/下加一个目录、写一份SKILL.md再配scripts/index.html提供交互 UI智能体会按需加载。六、TTFT 和解码速度怎么看Gallery 内置 benchmark 功能跑分时围绕三个指标采集数据采集逻辑在 MetricsTracker.kt理解它们的含义再对比模型TTFT首 token 时间。从你按下发送到第一个 token 流出来的耗时涵盖 prefill 阶段。TTFT 大用户感知的就是卡。判断标准交互式对话场景 TTFT 应控制在 1~2 秒内明显更长的模型要检查是否走了纯 CPU、或上下文被拉得太长。解码速度token/s。流式输出阶段的吞吐决定打字机效果是顺滑还是断续。同一模型换加速器CPU/GPU白名单里每个模型都有accelerators配置后主要差距通常体现在这里。延迟与资源消耗。除了延迟追踪器还会周期性采样进程内存和电池功耗输出到 ADB 日志。评估能否量产部署时峰值内存是否顶到系统上限、单次推理的电量消耗比纯速度更值得看。用法建议同一台设备上先跑 1B 级小模型建立基线再对比 3B/4B 模型在 TTFT 和解码速度上的劣化幅度——如果劣化超过你的交互体验容忍线就留在小模型档位这比盲选最大的模型更靠谱。七、边界与展望适合什么数据敏感型行业金融、医疗、制造的内网场景弱网/无网现场需要把模型选择权和推理参数握在自己手里的团队。要接受的代价当前仍是实验性 Beta 版本功能与接口可能变动模型规模受设备内存硬约束端上主力还是 1B~4B 级别的量化模型与云端大模型的能力差距客观存在模型下载依赖 Hugging Face 渠道企业内网部署时要提前打通或走 APK 侧载 模型预置。路线图除了 AndroidiOS 版已上架 App Store要求 iOS 17macOS 也提供了 0.1.0 的下载包同一套端侧推理栈正在向多平台铺开。对技术选型来说这个组合意味着你现在的 Android 端方案未来大概率不用推倒重来。一句话收束先用 1B 小模型在一台 6GB 内存的设备上把离线对话、图像问答跑通再用 benchmark 数据决定上哪个档位——这条路径就是 Google AI Edge Gallery 给出的设备端 AI 落地模板。【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考