ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

一个 Skill给 OpenCode/ Claude Code / ZCode 装上“眼睛“:image-vision Skill 一键安装教程,让 DeepSeek 等纯文本模型也能看图

一个 Skill给 OpenCode/ Claude Code / ZCode 装上“眼睛“:image-vision Skill 一键安装教程,让 DeepSeek 等纯文本模型也能看图 四大 AI 编程工具全通用image-vision 开源发布附保姆级安装教程现在很多人搭 AI 编程环境都是同一个思路强 Harness 高性价比纯文本模型。比如 Codex / opencode / Claude Code 配上 DeepSeek、GLM、Kimi 这类模型——编码能力扎实、成本又低作为日常开发底座非常香。但这套组合有一个明显短板这些模型没有多模态能力看不了图片。贴张报错截图、设计稿过去模型只会回你抱歉我无法查看图片。解决方式很简单不用换模型装一个 Skill 就行。今天开源的image-vision在主模型之外挂一个视觉模型做眼睛图片先交给视觉模型理解转成文字描述回灌给主模型继续推理——既保住编码能力和性价比又补齐看图短板。而且它不是只服务某一个工具一份 Skillopencode / Claude Code / Z.ai zcode / Codex 四大平台全通用。 两大买点1️⃣ 四大平台一次安装全搞定opencode / Claude Code / Z.ai zcode / Codex 通吃混用多个工具也不用重复折腾。2️⃣ 视觉模型提供商随便换OpenAI gpt-4o、通义千问 Qwen-VL、智谱 GLM-4V、SiliconFlow、本地 vLLM / Ollama……只要接口兼容 OpenAI 就能接。换厂商只改配置三行代码一行不动。 工作原理一张图看懂用户上传图片 ↓ 主模型纯文本看不到图 ↓ 自动运行 vision.py零依赖 Python 脚本 图片 base64 编码 → OpenAI 兼容接口 → 视觉模型 ↓ 返回文字描述 → 回灌给主模型 → 整合后回答用户全程对用户透明——就像模型本来就能看图。 安装教程重点来了 最懒人的方式一句话让 AI 自己装不用看文档、不用敲命令打开对话把这句话扔给 AI 就行按 https://github.com/wangxintai929/image-vision-skill 的 README 帮我配置识图能力全局安装AI 会自动完成下载、安装、写配置并根据你的回答填入视觉模型参数看到配置检查通过即完成。网络不好访问 GitHub也可以下载 ZIP 解压到本地再装在仓库页面点Code→Download ZIP解压后对 AI 说一句安装 D:\Job\code\image-vision-skill-main把路径换成你的实际解压目录即可后续步骤完全一样。、 加不加全局安装有区别不加只在当前项目/会话生效加了之后所有会话都能用推荐全局。方式一opencode 远程加载一行配置在opencode.json全局~/.config/opencode/opencode.json或项目内加入{ skills: { urls: [https://cdn.jsdelivr.net/gh/wangxintai929/image-vision-skillmain/] } }重启 opencode自动从 GitHub 拉取 Skill 和脚本连文件都不用复制。仓库版本更新后重启自动拉取新版。方式二一键安装脚本所有平台通用git clone https://github.com/wangxintai929/image-vision-skill.git cd image-vision-skill ./install.sh # macOS / Linux # Windows: powershell -ExecutionPolicy Bypass -File install.ps1脚本自动完成四件事复制脚本到统一目录~/.config/image-vision/各平台共用一份→ 生成config.json→ 把 Skill 装到 opencode 和 Claude Code 的 skills 目录 → 执行配置检查。方式三手动安装下载 ZIP 解压后把SKILL.md复制到对应平台的 skills 目录平台安装位置opencode~/.config/opencode/skills/image-vision/Claude Code~/.claude/skills/image-vision/SKILL.mdZ.ai zcode~/.zcode/skills/image-vision/SKILL.md注意zcode 不扫~/.claude/skills/Codex无 Skill 机制在~/.codex/AGENTS.md追加一段指令兜底照样能用 配置视觉模型从哪来配置只需三项API 地址、API Key、模型名称。不用打开任何配置文件直接在对话里告诉 AI它会自动写入并验证。还没想好用哪家国内用户可以优先考虑阿里云百炼——新用户开通即送免费调用额度视觉模型基本可以零成本先跑起来拿来体验整个识图流程再合适不过打开百炼平台大模型服务平台百炼控制台开通服务后在控制台创建 API Keysk-...然后对 AI 说一句视觉后端用百炼地址 https://dashscope.aliyuncs.com/compatible-mode/v1key 是 sk-xxxx模型 qwen-vl-max看到配置检查通过接入完成用其他厂商同理把三项参数发给 AI 即可。已登录 opencode-go 的用户更省事key 现成可用mimo-v2.5等视觉模型按量计费、开箱即用。✅ 实测验证装好后发一张测试图确认链路打通python ~/.config/image-vision/vision.py test.png -q 图片里有什么识别速度很快几秒到十几秒即可返回报错截图、设计稿、多图对比都能准确识别。 进阶命令免确认可选默认模型执行识别命令会弹一次确认加一行配置放行其余命令仍保持确认opencode / zcodeopencode.json中*vision.py*: allowClaude Codesettings.json中Bash(python:*vision.py*) 纯 Python 标准库实现零第三方依赖Python 3.7 就能跑。一套 Skill 打通四大平台 所有 OpenAI 兼容视觉模型给你的高性价比编程组合补上最后一块拼图。欢迎试用、提 Issue、点 Star ⭐ GitHubhttps://github.com/wangxintai929/image-vision-skill
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表