agent-vision-toolkit
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
Stars 1.1k +2Forks 38许可证 MIT更新 2026/8/25
agent-vision-toolkit 是给纯文本智能体使用的视觉工具与 Skill 集合,覆盖图片问答、长截图 OCR、前端界面还原、GUI 自动化、目标定位、裁剪和像素差异比较。能够调用 shell 的智能体可直接使用各项命令行工具。
可选集成层提供本地代理和原生插件,让粘贴图片及宿主自带图像工具进入同一处理流程。DeepSeek Harness 对应的独立包会注册十个结构化视觉工具,并增加凭据管理、隔离运行时、可预览产物、设置界面和按任务逐步暴露工具的能力。
核心能力
- 为纯文本智能体提供看图 CLI 与 vision-skills,覆盖带意图的图片问答、长截图 OCR、前端界面还原和 GUI 自动化
- 可选本地代理与原生插件,让粘贴图片和宿主内置看图进入同一流程
- 独立子包 dsh-vision-toolkit 向 DeepSeek Harness 注册十个结构化视觉工具,并提供凭据、隔离运行时、可预览产物、设置页和按任务逐步暴露工具
如何开始
- 1写入视觉 API 环境变量
在 ~/.config/agent-vision-toolkit/env 中配置密钥、基址和模型,权限设为 chmod 600。
VISION_API_KEY=sk-... VISION_BASE_URL=https://openrouter.ai/api/v1 VISION_MODEL=google/gemini-3.6-flash - 2克隆仓库并加入 PATH
把 bin 目录加入 PATH。glance 需要 Python 3.11+。
git clone https://github.com/Anionex/agent-vision-toolkit.git export PATH="$PWD/agent-vision-toolkit/bin:$PATH"
Star 增长
数据来源:定期同步保存的 Star 快照;增长不构成质量、安全或官方背书。
GitHub Topics
相关项目
收录或清单确认都不等于本站验证。该项目因仓库添加了 dsh-plugin Topic 而自动进入目录。相关度与排查提示由公开信息自动生成,不构成质量、安全或官方背书;本站没有替你安装、运行或审核其兼容性和安全性。第三方项目可能在 Harness 进程中运行。请自行审查源代码、依赖、许可证、安装方式和权限;Star 数量不构成质量、安全或官方背书。