[dsh]为纯文本模型设计更强大的视觉工具箱:一行安装使用、粘贴图片直接识别、多张图片问答、截图到前端UI 还原等|DeepSeek Harness-native integration for agent-vision-toolkit: image Q&A, long-screenshot OCR, UI restoration, grounding, pixel diff, Artifacts, and Web UI.
Stars 825 +3Forks 36许可证 MIT更新 2026/8/25
DSH Vision Toolkit 是 agent-vision-toolkit 在 DeepSeek Harness 中的原生集成,让纯文本模型直接处理粘贴图片、多图问答、长截图 OCR、界面还原和 GUI 视觉任务,并保留 DSH Web 中的缩略图、会话历史与工作区路径。
工具层可完成问答、定位、裁剪、描摹和像素比较,配套 Skill 会按任务选择观察与验证步骤。插件还接入 Profile、凭据、设置和 Artifacts,默认提供有每日机器配额的共享视觉服务,也允许改用自有模型配置。
核心能力
- 在 DSH Web 中粘贴图片后,纯文本模型可围绕当前问题读取画面,并保留缩略图、会话记录与工作区路径。
- 提供可单独或组合调用的视觉工具,完成针对性问答、原图像素定位、裁剪、矢量描摹、像素对比和长截图 OCR。
- 随附 vision-skills,按任务说明何时看图、选用哪个工具、如何推进以及如何验证结果。
- 接入 Profile、设置、Artifacts 与 Web 界面,默认提供有每日机器配额的共享视觉服务,也可改用自有模型配置。
如何开始
- 1安装插件
按所用 Profile 安装包。桌面版请从托盘打开 DSH 终端再执行对应命令,不要在系统终端里装。
dsh plugin --profile web add @anionex/dsh-vision-toolkit - 2重启并配置视觉模型
重启正在运行的 Web Profile,打开设置里的视觉工具,配置视觉模型并运行测试视觉模型确认连接。首次启动会自动准备隔离运行环境。
- 3粘贴图片并说明任务
在会话中粘贴截图或把图片放进工作区,再调用 /vision-skills,直接说明要问答、定位、裁剪或对照还原。
使用前确认
DSH Desktop 有意不把 dsh 写入系统 PATH,须在桌面版自带终端安装到 desktop Profile,装完后重启。2.0.1 内置插件市场一键安装存在已知问题,修复前请优先用终端命令。首次启动若系统没有 Python 3.11+,会下载托管 Python。共享视觉服务有每日机器配额。
Star 增长
数据来源:定期同步保存的 Star 快照;增长不构成质量、安全或官方背书。
GitHub Topics
相关项目
收录或清单确认都不等于本站验证。该项目因仓库添加了 dsh-plugin Topic 而自动进入目录。相关度与排查提示由公开信息自动生成,不构成质量、安全或官方背书;本站没有替你安装、运行或审核其兼容性和安全性。第三方项目可能在 Harness 进程中运行。请自行审查源代码、依赖、许可证、安装方式和权限;Star 数量不构成质量、安全或官方背书。