这是什么?适合谁?
DSH Vision Toolkit(@anionex/dsh-vision-toolkit)是 DeepSeek Harness 生态第一个综合性视觉工具插件:给纯文本模型装上”眼睛”——带意图的图片问答、长截图 OCR、UI 还原、GUI 视觉任务,一个工具包 + Skill 全覆盖。它由 agent-vision-toolkit 的作者长期实战迭代而来,安装即用内置免费视觉服务(Groq Qwen3.6),无需 API key。
适合人群:在 DSH 里用 DeepSeek 等纯文本模型的开发者、需要处理长截图/文档扫描 OCR 的用户、做 GUI 自动化与 UI 还原验证的测试工程师。 使用前提:DeepSeek Harness 环境(DSH Web 或 Headless)、Node.js、需要看图的日常工作流。
快速上手(3 步)
第一步:一条命令安装
dsh plugin add @anionex/dsh-vision-toolkit
(或按仓库 README 的安装命令执行;npm 包为 @anionex/dsh-vision-toolkit。)
第二步:粘贴图片即用
在 DSH Web 粘贴图片后,纯文本路由自动切换到 (Vision Toolkit) 变体——无需手动改路径或换模型。原生缩略图、会话历史、工作区路径全部保持不变。
第三步:跑一个 OCR 任务
给一张长截图(如整页聊天记录),让 Agent”OCR 提取全部文字并按时间排序”。免费视觉服务开箱即用;共享容量暂时耗尽时会返回可读的 429 与重试提示。
初级用法
- 带意图的图片问答:先说清你想从图里得到什么(“找出报错行号""对比两版 UI 差异”),视觉结果比泛泛”描述图片”有用得多。
- 长截图 OCR:长图分段提取合并,适合文档扫描、聊天记录、日志截图的结构化。
- Headless 续接:Web 里产生的结构化视觉结果,Headless 模式可继续消费同一份结果,人机两用。
高级玩法
- UI 还原验证:用 UI 还原能力把设计稿/截图转结构化描述,再与实现页面对比,形成自动化的”视觉回归”判定。
- vision-tools Skill 编排:工具包附带的
vision-toolsSkill 可在 Agent 提示词里组合调用多视觉工具,构建”看图 → 分析 → 行动”流水线。 - 双视觉插件分工:与 dsh-vision-router 并存时,按任务分流——像素定位类交给 router 的
vision_*工具,OCR/问答类交给本工具包。
常见踩坑(5 条)
踩坑 1:免费共享容量 429
- 现象:视觉请求被限流
- 原因:内置 Groq Qwen3.6 为共享免费服务,高峰容量有限
- 解决:按可读的 429 响应重试;高频场景自配视觉服务
踩坑 2:粘贴后路由没切换
- 现象:图片被当作普通附件处理
- 原因:DSH 版本过旧或插件未正确加载
- 解决:升级 DSH 与插件到最新版,重启会话
踩坑 3:OCR 长图截断
- 现象:长截图只识别了前半段
- 原因:单次视觉调用有尺寸/分辨率上限
- 解决:分段切图后逐段 OCR 再合并(工具包支持长截图工作流,按文档配置)
踩坑 4:把视觉结果当绝对真理
- 现象:坐标/文字有小偏差导致下游操作失败
- 原因:视觉模型存在固有误差
- 解决:关键坐标做二次校验(再截一张验证图);OCR 结果抽查关键字段
踩坑 5:混淆 Web 与 Headless 行为
- 现象:Web 里正常、Headless 不出图
- 原因:Headless 消费的是结构化结果而非交互界面
- 解决:按文档在 Headless 用结构化结果续接,别依赖缩略图交互
FAQ(5 个常见问题)
Q1:DSH Vision Toolkit 免费吗? A:MIT 开源;内置免费视觉服务,无需 API key,共享容量有限流。
Q2:和 dsh-vision-router 怎么选? A:router 强在路由与像素级定位工具;toolkit 强在 OCR、图片问答、UI 还原的完整工具集与 Skill。需求重叠时任选其一,复杂场景可组合。
Q3:支持哪些模型? A:为 DSH 里的纯文本模型(DeepSeek 等)设计;视觉侧由内置免费服务承担。
Q4:数据会出本地吗? A:图片会发送到视觉服务(默认共享 Groq 服务)处理;隐私敏感图建议自配视觉端点,具体以仓库文档为准。
Q5:和 agent-vision-toolkit 什么关系? A:本工具包参考并延续了 agent-vision-toolkit 的系统设计,由同一作者在 DSH 生态的工程化实现,早于 DSH 内测即启动建设。
小技巧(5 条)
- 问答带意图:提示词写清”从图中提取什么”,比开放描述准确率高一个量级。
- 会话历史利用:同会话多图对比(新旧版本 UI)能复用上下文,减少重复描述。
- 429 别硬刚:共享容量限流时错峰重试,比连续重试更快恢复。
- 结构化结果落盘:把 OCR/还原结果存进工作区,后续任务直接引用文件而非重新看图。
- 中英双文档:仓库带
README.zh.md,中文用户先读中文版。
进阶学习建议
- 研究工具包的”路由变体切换”机制,理解 DSH 插件如何按附件类型动态改路由
- 把长截图 OCR 工作流接进你的日志分析管线(截图 → 结构化文本 → 规则告警)
- 用 UI 还原能力搭建轻量视觉回归:设计稿 vs 实现页的结构化 diff
- 对比 toolkit 与 router 的工具面,为你团队沉淀一份”DSH 视觉任务选型表”
参考链接
本文基于公开资料于 2026-08-17 整理,社区指标反映 GitHub 公开数据。独立实测未进行,功能和配置项可能随版本更新而变化,请以官方文档为准。
📊 评分与标签
评分说明
总分 8.0/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-17)
- GitHub: Anionex/dsh-vision-toolkit ★529, 🔱26
- 语言:TypeScript,最近推送:2026-08-17
- 协议:MIT
⚙️ 功能完整度 2.2/2.5
- 图片问答、长截图 OCR、UI 还原、GUI 视觉任务一包覆盖,附 vision-tools Skill
- 粘贴自动切路由、会话历史与工作区路径保持、Web/Headless 双模式
- 免费共享视觉服务容量有限
- 竞品对比 1(dsh-vision-router):router 强在像素定位工具,toolkit 强在 OCR/问答/还原面更宽
- 竞品对比 2(独立 OCR 工具):独立 OCR 不在 DSH 工作流内,上下文割裂
✨ 输出质量 1.9/2.5
- 结构化视觉结果可被 Headless 续用,人机两用
- 内置免费 Groq Qwen3.6 服务,开箱质量对免费档位合理;长图/复杂 UI 精度未实测
- 竞品对比 1(文字描述桥接):结构化结果可度量性远超纯描述
- 竞品对比 2(商用 OCR API):商用 OCR 精度更高但有成本
🖐️ 易用性 1.3/1.5
- 一条命令安装,粘贴即用,无需换模型
- npm 包形态(@anionex/dsh-vision-toolkit)分发规范
- 竞品对比 1(dsh-vision-router):安装体验同级
- 竞品对比 2(自组视觉管线):自组需多工具拼接,门槛高
💰 性价比 1.3/1.5
- MIT 开源 + 内置免费视觉服务,零 key 零费用起步
- 共享容量 429 时高频用户需自配服务
- 竞品对比 1(商用 OCR/视觉 API):按量计费成本高
- 竞品对比 2(多模态模型订阅):需更高订阅档位
🔒 稳定性 0.8/1.0
- 2026-08-17 仍在推送,529 星为 DSH 视觉生态最高热度之一
- 依托 DSH rc 阶段平台,跟随平台演进有适配成本
- 竞品对比 1(dsh-vision-router):同级生态位
- 竞品对比 2(Tesseract 等老牌 OCR):老牌库极稳定但非 Agent 集成形态
🛡️ 隐私安全 0.5/1.0
- 图片发送至共享免费视觉服务(Groq Qwen3.6)处理,敏感图有外发面
- 高敏感场景建议自配视觉端点
- 竞品对比 1(本地 OCR):本地推理零外发
- 竞品对比 2(商用 API):商用有合同保障但仍出网
标签说明
- AI编程: DSH AI coding 生态的视觉增强插件。来源:GitHub
- 视觉理解: 为纯文本模型提供看图、问答、还原能力。来源:GitHub
- DeepSeek Harness: 专为 DSH 设计的插件与 Skill。来源:GitHub
- 开源免费: MIT 协议开源且内置免费视觉服务。来源:GitHub
- OCR: 长截图 OCR 是核心能力之一。来源:GitHub
来源核实
- ✅ GitHub API 已验证: Anionex/dsh-vision-toolkit - Stars 529, Forks 26, pushed 2026-08-17, MIT, TypeScript
- ✅ README 已读取: 能力矩阵、免费视觉服务、与 agent-vision-toolkit 渊源均已核对
- ⚠️ 未实测: 未在 DSH 中实际运行 OCR/还原任务
评分依据可追溯至公开数据源,评估日期:2026-08-17。社区指标来自 GitHub API 实时数据。
同分类推荐
AI编程 分类下的其他工具