ghosthands

给 Agent 装上真正的手和眼睛:USB-HID 微控制器做手、视觉 grounding 模型做眼、任意 LLM 做脑的 GUI 自动化。

📅 收录: 2026-08-29 🔄 更新: 2026-08-29

这是什么?适合谁?

GhostHands(affirmitv/ghosthands)是一个**「硬件手 + 视觉眼 + LLM 脑」的 GUI 自动化方案**:USB-HID 微控制器做「手」、视觉 grounding 模型做「眼」、任意 LLM 做「脑」,实现 DOM 无关、不可检测的 GUI 操作。

核心价值:用「USB-HID 硬件 + 视觉 grounding + LLM」组合做 GUI 自动化——不走 DOM/无障碍接口,从物理层面模拟输入,配合视觉模型理解屏幕,突破传统浏览器自动化的限制。

适合人群

  • 研究 GUI 自动化新范式的工程师
  • 需要自动化无 API 桌面/Web 应用的场景
  • 对硬件 + AI 组合感兴趣的极客

使用前提:一块 USB-HID 微控制器;视觉模型与 LLM 的 API;Python 环境。

准备工作

  1. USB-HID 微控制器:作为模拟键鼠的「手」。
  2. 视觉模型:用于屏幕 grounding(定位元素)。
  3. LLM:作为决策「脑」。
  4. 成本:MIT 开源免费;硬件与模型 API 费用另计。
  5. 时间预算:硬件接线 + 跑通约 1 小时。

快速上手(3 步)

第一步:组装硬件

git clone https://github.com/affirmitv/ghosthands
git clone 后按 README 接线并配置
pip install -r requirements.txt   # 依赖与硬件配置以 README 为准

第二步:配置视觉与 LLM

配置视觉 grounding 模型与 LLM 的 API。

第三步:跑通第一个操作

下达一个 GUI 操作任务,观察「看→想→动」链路。

成功判定:让 Agent 通过硬件模拟输入,在真实屏幕上完成一次 GUI 操作。

初级用法

硬件手

USB-HID 微控制器模拟键盘鼠标,物理层输入。

视觉眼

视觉 grounding 模型定位屏幕元素。

LLM 脑

任意 LLM 做决策与规划。

高级玩法

多屏操作

扩展视觉输入覆盖多显示器。

复杂流程编排

把多步 GUI 操作串成自动化流程。

自研 grounding

用更强视觉模型提升定位精度。

小技巧

  1. 先单屏简单任务:验证链路再上复杂场景。
  2. 硬件固件先刷对:大多数问题出在固件。
  3. 视觉定位先校准:截图与坐标要对齐。
  4. 安全边界:GUI 自动化可能误触,先隔离环境。
  5. 模型选择:视觉 grounding 模型质量决定定位上限。

常见踩坑

踩坑 1:硬件固件问题

  • 现象:HID 设备不识别或输入乱码。
  • 原因:固件未刷对或驱动缺失。
  • 解决:按 README 重刷固件并检查驱动。

踩坑 2:视觉定位偏差

  • 现象:点击位置不准。
  • 原因:屏幕分辨率/缩放与视觉模型不对齐。
  • 解决:校准坐标映射,统一分辨率与缩放。

踩坑 3:误触风险

  • 现象:自动化操作点到不该点的东西。
  • 原因:GUI 操作不可预测。
  • 解决:在隔离环境跑,关键操作加确认。

踩坑 4:链路延迟

  • 现象:操作响应慢。
  • 原因:视觉 + LLM + 硬件三段延迟叠加。
  • 解决:优化模型推理与硬件轮询。

踩坑 5:项目较新

  • 现象:文档与示例有限。
  • 原因:项目 2026-08 创建。
  • 解决:以 README 为准,按需调试。

常见问题 FAQ

Q1: 为什么用硬件而不是软件 API?

A: 硬件层模拟输入不可检测、不依赖 DOM/无障碍接口,能覆盖无 API 的应用。

Q2: 需要什么硬件?

A: 一块 USB-HID 微控制器,具体型号以 README 为准。

Q3: 免费吗?

A: MIT 开源免费;硬件与模型 API 费用另计。

Q4: 和 Playwright 等有什么区别?

A: Playwright 走浏览器协议,GhostHands 走物理层输入,适用场景不同。

Q5: 安全吗?

A: 自动化可能误触,务必在隔离环境使用并设好边界。

进阶学习建议

掌握基础后,建议深入:

  1. 把视觉 grounding 换用更强模型,提升复杂 UI 的定位精度。
  2. 设计多步 GUI 流程的检查点,提升自动化可靠性。
  3. 探索硬件层自动化与浏览器协议自动化的互补组合。

参考链接


最后更新:2026-08-29 · 作者:MagicNetWorld · 基于公开资料整理,关键数据经 GitHub API 独立实测核验,AI 辅助生成

📊 评分与标签

评分说明

总分 7.2/10 · S_入选

📊 可观测社区指标(采集日期:2026-08-29)

  • GitHub: affirmitv/ghosthands ★27, 🔱3(GitHub API 实时验证)
  • License: MIT;仓库创建 2026-08-27,最后推送 2026-08-27(活跃)
  • 语言: Python;定位「硬件 + 视觉 + LLM 组合的 GUI 自动化」

⚙️ 功能完整度 1.8/2.5

  • USB-HID 硬件手 + 视觉眼 + LLM 脑,GUI 自动化链路完整但需硬件
  • 竞品对比 1(Playwright/Selenium):走浏览器协议、可检测
  • 竞品对比 2(纯视觉 Agent):无物理层输入

✨ 输出质量 1.8/2.5

  • 视觉 grounding + LLM 决策,定位与决策能力较好
  • 竞品对比 1(浏览器自动化):只覆盖 Web
  • 竞品对比 2(键鼠宏):无视觉理解

🖐️ 易用性 1.0/1.5

  • 需硬件组装与多模型配置,门槛高
  • 竞品对比 1(商用 RPA):开箱即用但贵
  • 竞品对比 2(手写自动化):灵活但费人力

💰 性价比 1.2/1.5

  • MIT 开源免费;硬件与模型 API 费用另计
  • 竞品对比 1(商用 RPA 平台):订阅收费
  • 竞品对比 2(自建脚本):免费但有限

🔒 稳定性 0.7/1.0

  • 项目较新(2026-08-27 创建)、fork 3
  • 竞品对比 1(成熟 RPA 工具):久经考验
  • 竞品对比 2(实验性方案):更不稳定

🛡️ 隐私安全 0.7/1.0

  • 本地硬件操作;视觉截图会发往模型 API
  • 竞品对比 1(云端自动化):数据上传第三方
  • 竞品对比 2(本地硬件):数据自控

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

🏷️ 标签说明

📋 来源核实

  • ✅ 已验证: GitHub 仓库 - stars/forks/license/pushed_at/语言经 GitHub API 实时核验(2026-08-29)
  • ✅ 已验证: 官方 README - 能力与定位比对
  • ⚠️ 未实测: 硬件 + 视觉 + LLM 的端到端流程
  • ⚠️ 未验证: 复杂 GUI 下的操作成功率

⚠️ 局限与未实测声明

  • 本文基于 2026-08-29 GitHub 公开信息整理,未实际运行 GhostHands
  • 需硬件投入,项目较新、复杂场景成功率待验证
  • 项目较新,能力与命令以仓库 README 为准

同分类推荐

AI开发平台 分类下的其他工具

)}