Open-AutoGLM
开源手机Agent模型与框架,智谱出品,让AI操控手机成为现实
这是什么?
Open-AutoGLM 是智谱(Zhipu AI)出品的开源手机 Agent 模型与框架。GitHub zai-org/Open-AutoGLM,26k Stars,Apache 2.0 许可证。
核心价值:让 AI Agent 像人类一样操控手机——打开应用、点击按钮、输入文字、滑动屏幕。基于视觉语言模型理解手机屏幕,输出操作指令。支持 Android 模拟器和真机。
适合谁:移动端 AI Agent 开发者、App 自动化测试工程师、需要手机端 AI 助手的团队。
前置条件:Python 3.10+,Android 设备或模拟器,智谱 API Key(开源模型可本地运行)。
准备工作
安装
git clone https://github.com/zai-org/Open-AutoGLM.git
cd Open-AutoGLM
pip install -r requirements.txt
配置
export ZHIPU_API_KEY=your-api-key
# 或使用本地模型
python setup_local.py --model autoglm-phone-9b
时间预算:安装 10 分钟,配置 15 分钟。
三步上手
第一步:启动 Android 模拟器
adb devices # 确认设备连接
python -m autoglm.agent --device emulator-5554
第二步:发送自然语言指令
> 打开微信,给张三发消息"明天见"
Agent 会自动:打开微信 → 搜索”张三” → 输入消息 → 发送。
第三步:多步骤复杂任务
> 打开美团,搜索附近的火锅店,选择评分最高的,截图发给我
Agent 依次完成:打开美团 → 搜索 → 排序 → 截图。
常见踩坑
踩坑 1:ADB 连接失败
症状:adb devices 显示 “unauthorized”。
原因:手机未授权 USB 调试。
解决:手机端弹出授权对话框时点击”允许”,或重新插拔 USB 线。
踩坑 2:屏幕分辨率不匹配
症状:Agent 点击位置偏移,按不到按钮。
原因:模型训练分辨率为 1080p,设备分辨率不匹配。
解决:使用 adb shell wm size 1080x1920 调整分辨率,或使用内置分辨率适配。
踩坑 3:本地模型推理速度慢
症状:Agent 每步操作间隔 5-10 秒。
原因:9B 模型在 CPU 上推理速度慢。
解决:使用 GPU 推理(CUDA/MPS),或切换到云端 API 模式。
踩坑 4:App 界面更新导致操作失败
症状:App 更新后 Agent 找不到按钮。
原因:App UI 变化,模型未适配新界面。
解决:运行 python autoglm/finetune.py --app wechat 针对特定 App 微调。
踩坑 5:中文输入法问题
症状:Agent 输入中文时出现乱码。
原因:ADB 默认使用英文输入法。
解决:安装 ADBKeyboard 并设置为默认输入法 adb shell ime set com.android.adbkeyboard/.AdbIME。
FAQ
Q1: Open-AutoGLM 是否免费?
A: 开源模型和框架完全免费(Apache 2.0)。使用智谱云端 API 按调用量收费。
Q2: 支持 iOS 吗?
A: 目前仅支持 Android。iOS 因系统限制不支持自动化操作。
Q3: 与 Appium 有什么区别?
A: Appium 需要编写测试脚本,Open-AutoGLM 用自然语言驱动,AI 视觉理解界面。
Q4: 能否后台运行?
A: 需要前台运行。Android 系统限制后台应用截取屏幕内容。
Q5: 安全性如何?
A: 所有操作在本地执行。建议使用专用测试设备,避免在主力机上运行敏感操作。
参考链接
本文基于公开资料整理,AI 辅助生成,数据截至 2026-08-05。具体功能请以官方文档为准。
📊 评分与标签
评分说明
总分 8.5/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-05)
- GitHub: zai-org/Open-AutoGLM ★26k, 🔱2.2k
- 许可证: Apache 2.0
- 语言: Python
🤖 Agent 能力 1.7/2.0
- 基于视觉语言模型理解手机屏幕,生成操作指令
- 支持多步骤复杂任务(打开 App → 搜索 → 操作 → 截图)
- App 界面更新后需重新适配,泛化能力有局限
- 来源:GitHub
- 竞品对比 1(Appium):Appium 需要编写脚本,Open-AutoGLM 用自然语言驱动
- 竞品对比 2(Claude Computer Use):Computer Use 控制桌面,Open-AutoGLM 控制手机
🖐️ 易用性 1.2/1.5
- 自然语言指令,无需编程
- 需要 ADB 配置和 Android 设备,初始设置有一定门槛
- 中文输入法配置需额外步骤
- 竞品对比 1(Appium):Appium 的 WebDriver 协议更标准化
- 竞品对比 2(UI Automator):UI Automator 需要 Java/Kotlin 编程
🔌 生态集成 1.5/2.0
- 支持 Android 模拟器和真机
- 可集成智谱云端 API 或本地模型
- 仅支持 Android,iOS 不支持
- 来源:GitHub
- 竞品对比 1(Appium):支持 Android + iOS,生态更广
- 竞品对比 2(Claude Computer Use):桌面端生态,不覆盖移动端
👥 社区支持 1.3/1.5
- 26k Stars,社区规模大
- 智谱(Zhipu AI)公司背书,商业支持
- Apache 2.0 许可证,企业友好
- 来源:GitHub
- 竞品对比 1(Appium):16k Stars,社区历史悠久
- 竞品对比 2(UI Automator):Google 官方维护,文档最完善
💡 创新程度 1.4/1.5
- 首个开源手机 Agent 模型与框架
- 视觉语言模型 + 手机操作的新范式
- 与传统 UI 自动化有本质区别(AI 理解 vs 元素定位)
- 来源:GitHub
- 竞品对比 1(Appium):传统 UI 自动化,非 AI 驱动
- 竞品对比 2(Apple Intelligence):Apple 的屏幕理解功能,但闭源且仅限 iOS
🔒 稳定性 1.4/1.5
- 26k Stars 大规模验证
- 智谱持续维护,模型更新频繁
- Android 碎片化导致不同设备表现差异
- 来源:GitHub
- 竞品对比 1(Appium):多年生产验证,稳定性极高
- 竞品对比 2(UI Automator):Google 官方维护,Android 兼容性最好
评分依据可追溯至公开数据源。
🏷️ 标签说明
- Agent: 手机 Agent 模型与框架。来源:GitHub
- 手机Agent: 专为手机操控设计的 AI Agent。来源:GitHub
- 开源: Apache 2.0 许可证开源项目。来源:GitHub
- 智谱: 智谱 AI 出品。来源:GitHub
📋 来源核实
- ✅ 已验证: GitHub — Stars 26k,Forks 2.2k,Apache 2.0
- ⚠️ 未实测: 未在 Android 设备上实际测试 Agent 操控功能
⚠️ 局限与声明
- 实测限制:未在真实设备上完整测试,数据基于官方文档和社区反馈
- 评分基于公开信息,实际使用体验可能因设备型号和 App 版本而异
同分类推荐
AI开发平台 分类下的其他 Agent