VisionBridge 是一个兼容 OpenAI 接口的代理,通过将图像相关任务路由给独立的视觉模型,为纯文本 LLM 赋予视觉能力。

Stars

39

7 天增长

暂无数据

Fork 数

2

开放 Issue

1

开源协议

MIT

最近更新

2026-07-07

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它无需训练或新权重,仅通过一个轻量代理处理工具编排、错误恢复和并发视觉调用,就能让任何纯文本推理模型(来自 LM Studio、Ollama、vLLM 等)回答关于图像的问题。

适合谁使用

  • 运行本地或自托管 LLM 并希望为文本模型添加视觉能力的开发者
  • 使用 OpenWebUI、LibreChat 等聊天界面、希望无需切换模型即可支持多模态的用户
  • 评估基于工具的视觉策略而不修改模型代码的研究人员
  • 构建结合推理与视觉后端的自定义 Agent 工作流的工程师

典型使用场景

  • 通过 OCR 和全页扫描工具从扫描文档或图像中提取文本
  • 通过放大特定区域对图像进行视觉问答
  • 让推理模型向视觉模型提问,实现两张图像的对比分析
  • 在聊天应用中让纯文本聊天机器人处理用户上传的图片

项目优势

  • 支持多种推理与视觉后端(LM Studio、Ollama、vLLM、兼容 OpenAI 的服务),并提供一键 Docker 部署
  • 自动从原生工具调用降级到提示 JSON 协议,适用于不支持工具的模型
  • 并发工具执行和场景预述降低了延迟,并在详细检查前为推理模型提供全局上下文
  • 对幻觉 ID、畸形 JSON 和后端故障具有鲁棒的错误处理,达到调用上限后强制给出最终答案

使用前须知

  • 需要同时运行推理模型和视觉模型,增加了硬件和运维复杂度
  • 代理路由和多轮工具循环会引入额外延迟,尤其在图像大或网络后端慢时
  • 没有内置认证机制;生产环境需使用外部反向代理来安全暴露服务

README 快速开始

Quick Start With Docker

项目描述

Give text-only LLMs vision. A tiny OpenAI-compatible proxy that lets reasoning models (DeepSeek, Qwen, GLM…) see images by querying a separate vision model through tools: look, OCR, scan, crop, compare. No training, no weights.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482