这个仓库提供了一个 Claude Code skill,通过本地 Ollama 视觉模型为纯文本的 DeepSeek 增加图片理解能力。

Stars

13

7 天增长

暂无数据

Fork 数

5

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-10

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它解决了 DeepSeek 无法直接“看”图片的痛点,使用本地模型保持数据隐私,无需依赖云端多模态 API。

适合谁使用

  • 需要在对话中分析图片的 DeepSeek 用户
  • 希望扩展模型能力的 Claude Code 用户
  • 寻找轻量级本地多模态桥接方案的开发者
  • 注重隐私、偏好本地部署的 AI 爱好者

典型使用场景

  • 描述或统计图片中的物体(如人数、物品)
  • 从截图或文档中提取文字(OCR)
  • 识别产品或场景
  • 获取详细的视觉描述以辅助无障碍访问或分析

项目优势

  • 完全本地运行(Ollama),保障数据隐私
  • 可安装为 Claude Code skill 或独立脚本使用,集成简单
  • 支持配置不同的视觉模型和 Ollama 端点,灵活性强
  • 架构简洁,核心脚本单一,依赖极少

使用前须知

  • 需要本地安装并运行 Ollama,增加额外设置步骤
  • 必须额外下载视觉模型(如 gemma4:e2b)
  • 性能与准确性取决于所选 Ollama 视觉模型,可能不如大型云端 API 强大

README 快速开始

安装 Ollama 并拉取模型

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

react
精选
react GitHub avatar

react

React is a JavaScript library for building user interfaces with declarative, component-based, and cross-platform design.

Web 开发前端框架
246,741
tandpfun
精选
tandpfun GitHub avatar

wardrobe

A GPT‑image powered app that extracts individual garment cutouts from photos, organizes them into a digital wardrobe, and generates modeled outfit previews.

JavaScript
1,570
mshumer
精选
mshumer GitHub avatar

Claude-of-Duty

A browser-based first-person shooter built entirely with procedural generation and orchestrated AI agents, featuring 55k lines of Three.js/WebGL2 code and no art assets.

AI 与机器学习AI 智能体
1,234