🤖 AI开发平台

Open-AutoGLM

开源手机Agent模型与框架,智谱出品,让AI操控手机成为现实

📅 收录: 2026-08-05 🔄 更新: 2026-08-05

这是什么?

Open-AutoGLM 是智谱(Zhipu AI)出品的开源手机 Agent 模型与框架。GitHub zai-org/Open-AutoGLM,26k Stars,Apache 2.0 许可证。

核心价值:让 AI Agent 像人类一样操控手机——打开应用、点击按钮、输入文字、滑动屏幕。基于视觉语言模型理解手机屏幕,输出操作指令。支持 Android 模拟器和真机。

适合谁:移动端 AI Agent 开发者、App 自动化测试工程师、需要手机端 AI 助手的团队。

前置条件:Python 3.10+,Android 设备或模拟器,智谱 API Key(开源模型可本地运行)。

准备工作

安装

git clone https://github.com/zai-org/Open-AutoGLM.git
cd Open-AutoGLM
pip install -r requirements.txt

配置

export ZHIPU_API_KEY=your-api-key
# 或使用本地模型
python setup_local.py --model autoglm-phone-9b

时间预算:安装 10 分钟,配置 15 分钟。

三步上手

第一步:启动 Android 模拟器

adb devices  # 确认设备连接
python -m autoglm.agent --device emulator-5554

第二步:发送自然语言指令

> 打开微信,给张三发消息"明天见"

Agent 会自动:打开微信 → 搜索”张三” → 输入消息 → 发送。

第三步:多步骤复杂任务

> 打开美团,搜索附近的火锅店,选择评分最高的,截图发给我

Agent 依次完成:打开美团 → 搜索 → 排序 → 截图。

常见踩坑

踩坑 1:ADB 连接失败

症状adb devices 显示 “unauthorized”。

原因:手机未授权 USB 调试。

解决:手机端弹出授权对话框时点击”允许”,或重新插拔 USB 线。

踩坑 2:屏幕分辨率不匹配

症状:Agent 点击位置偏移,按不到按钮。

原因:模型训练分辨率为 1080p,设备分辨率不匹配。

解决:使用 adb shell wm size 1080x1920 调整分辨率,或使用内置分辨率适配。

踩坑 3:本地模型推理速度慢

症状:Agent 每步操作间隔 5-10 秒。

原因:9B 模型在 CPU 上推理速度慢。

解决:使用 GPU 推理(CUDA/MPS),或切换到云端 API 模式。

踩坑 4:App 界面更新导致操作失败

症状:App 更新后 Agent 找不到按钮。

原因:App UI 变化,模型未适配新界面。

解决:运行 python autoglm/finetune.py --app wechat 针对特定 App 微调。

踩坑 5:中文输入法问题

症状:Agent 输入中文时出现乱码。

原因:ADB 默认使用英文输入法。

解决:安装 ADBKeyboard 并设置为默认输入法 adb shell ime set com.android.adbkeyboard/.AdbIME

FAQ

Q1: Open-AutoGLM 是否免费?

A: 开源模型和框架完全免费(Apache 2.0)。使用智谱云端 API 按调用量收费。

Q2: 支持 iOS 吗?

A: 目前仅支持 Android。iOS 因系统限制不支持自动化操作。

Q3: 与 Appium 有什么区别?

A: Appium 需要编写测试脚本,Open-AutoGLM 用自然语言驱动,AI 视觉理解界面。

Q4: 能否后台运行?

A: 需要前台运行。Android 系统限制后台应用截取屏幕内容。

Q5: 安全性如何?

A: 所有操作在本地执行。建议使用专用测试设备,避免在主力机上运行敏感操作。

参考链接


本文基于公开资料整理,AI 辅助生成,数据截至 2026-08-05。具体功能请以官方文档为准。

📊 评分与标签

评分说明

总分 8.5/10 · P_优选

📊 可观测社区指标(采集日期:2026-08-05)

🤖 Agent 能力 1.7/2.0

  • 基于视觉语言模型理解手机屏幕,生成操作指令
  • 支持多步骤复杂任务(打开 App → 搜索 → 操作 → 截图)
  • App 界面更新后需重新适配,泛化能力有局限
  • 竞品对比 1(Appium):Appium 需要编写脚本,Open-AutoGLM 用自然语言驱动
  • 竞品对比 2(Claude Computer Use):Computer Use 控制桌面,Open-AutoGLM 控制手机

🖐️ 易用性 1.2/1.5

  • 自然语言指令,无需编程
  • 需要 ADB 配置和 Android 设备,初始设置有一定门槛
  • 中文输入法配置需额外步骤
  • 竞品对比 1(Appium):Appium 的 WebDriver 协议更标准化
  • 竞品对比 2(UI Automator):UI Automator 需要 Java/Kotlin 编程

🔌 生态集成 1.5/2.0

  • 支持 Android 模拟器和真机
  • 可集成智谱云端 API 或本地模型
  • 仅支持 Android,iOS 不支持
  • 竞品对比 1(Appium):支持 Android + iOS,生态更广
  • 竞品对比 2(Claude Computer Use):桌面端生态,不覆盖移动端

👥 社区支持 1.3/1.5

  • 26k Stars,社区规模大
  • 智谱(Zhipu AI)公司背书,商业支持
  • Apache 2.0 许可证,企业友好
  • 竞品对比 1(Appium):16k Stars,社区历史悠久
  • 竞品对比 2(UI Automator):Google 官方维护,文档最完善

💡 创新程度 1.4/1.5

  • 首个开源手机 Agent 模型与框架
  • 视觉语言模型 + 手机操作的新范式
  • 与传统 UI 自动化有本质区别(AI 理解 vs 元素定位)
  • 竞品对比 1(Appium):传统 UI 自动化,非 AI 驱动
  • 竞品对比 2(Apple Intelligence):Apple 的屏幕理解功能,但闭源且仅限 iOS

🔒 稳定性 1.4/1.5

  • 26k Stars 大规模验证
  • 智谱持续维护,模型更新频繁
  • Android 碎片化导致不同设备表现差异
  • 竞品对比 1(Appium):多年生产验证,稳定性极高
  • 竞品对比 2(UI Automator):Google 官方维护,Android 兼容性最好

评分依据可追溯至公开数据源。

🏷️ 标签说明

  • Agent: 手机 Agent 模型与框架。来源:GitHub
  • 手机Agent: 专为手机操控设计的 AI Agent。来源:GitHub
  • 开源: Apache 2.0 许可证开源项目。来源:GitHub
  • 智谱: 智谱 AI 出品。来源:GitHub

📋 来源核实

  • ✅ 已验证: GitHub — Stars 26k,Forks 2.2k,Apache 2.0
  • ⚠️ 未实测: 未在 Android 设备上实际测试 Agent 操控功能

⚠️ 局限与声明

  • 实测限制:未在真实设备上完整测试,数据基于官方文档和社区反馈
  • 评分基于公开信息,实际使用体验可能因设备型号和 App 版本而异

同分类推荐

AI开发平台 分类下的其他 Agent