各位好!分享一个我最近在做的小工具 Auto Vision Bridge,它能把任意不支持视觉的大模型变成“能看图”的模型。
痛点很简单:DeepSeek、Kimi、文心这些文本模型一发截图就报错或答非所问,每次都要手动把图片转成文字再喂回去,非常麻烦。这个项目就是夹在 AI 客户端和模型服务之间的一个轻量中转层(反向代理),自动完成识图。
GitHub 仓库:https://github.com/nhzhongguo/auto-vision-bridge(求个 Star 鼓励一下!)
这是什么项目
Auto Vision Bridge 是零依赖的 Node.js 中转服务(Node ≥ 18,不需要 npm install):请求里有图片时,自动判断模型支不支持视觉——支持就原样透传,不支持就调用视觉模型识别成文字再转发,全程无需手动操作。
核心亮点
- 智能判断:白名单 / 黑名单 / 启发式三档决策,未知模型默认按“不支持”处理,发图绝不报错
- 零依赖:只用 Node.js 原生模块,clone 下来直接 node bridge/server.mjs 就能跑
- 三种图片通道全覆盖:Chat API、Responses API、Markdown 图片
- 同图缓存:同一张图不重复调用视觉 API(300 条 LRU),省钱又省时
- Key 安全:视觉 API Key 只存在本地 config.json(已 gitignore),不进 git
- 交互式配置向导:node scripts/setup.mjs 静默输入 Key、自动备份、可选验证
- 附赠 MCP 模式:标准 MCP Server(analyze_image 工具),支持 7 家服务商 20+ 免费视觉模型
快速开始
git clone GitHub - nhzhongguo/auto-vision-bridge: Auto Vision Bridge:给不支持视觉的大模型(DeepSeek 等)自动补上看图能力 - 零依赖自动识图中转层 + AI 一键部署 + 附赠 7 家免费视觉模型 MCP · GitHub
cd auto-vision-bridge
node scripts/setup.mjs # 交互式配置 Key 和上游地址
node bridge/server.mjs # 启动
然后把 AI 客户端的 base_url 改成 http://127.0.0.1:57399/v1 重启即可。Windows 也有隐藏窗口启动脚本。
适用场景
适合 DeepSeek / Kimi / 文心等文本模型 + 截图场景,也适合接 gpt-4o / Gemini / Claude 等视觉模型原样透传;不想让 AI 助手经手 API Key 的话,也可以自己跑配置向导。
项目状态
- 开源协议:MIT
- 当前状态:持续迭代中,欢迎 Issue / PR / 功能建议
如果觉得对你有帮助,欢迎去 GitHub 点个 Star;遇到问题可以直接在帖子里回复,或者去提 Issue/PR。