light-ocr 是一款快速、离线的 OCR 库,支持 Node.js 和 C++,可从 PDF、图片及原始像素数据中提取文本,并返回置信度分数和四边形坐标,将模型、PDFium 和硬件加速整合到一个 npm 包中。

Stars

442

7 天增长

暂无数据

Fork 数

38

开放 Issue

1

开源协议

Apache-2.0

最近更新

2026-07-28

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它在一个包中提供了完整的离线 OCR 解决方案,无需二次下载,自动启用硬件加速(macOS 上的 Core ML,Linux/Windows 上的 WebGPU),内置 PDF 支持,并提供从约 6 MB 到约 139 MB 的多种模型规模,还包含了供 AI 代理集成的 Agent Skill。

适合谁使用

  • 需要本地 OCR 且无需外部依赖的 Node.js 开发者
  • 将文本识别集成到原生应用中的 C++ 开发者
  • 希望将确定性 OCR 作为工具技能的 AI 代理创建者
  • 需要离线处理 PDF 和图片文本提取的文档处理团队

典型使用场景

  • 在用户机器上提取扫描 PDF 或图片中的文本以保护隐私
  • 使用 CLI 或编程 API 批量处理大量文档
  • 验证或补充多模态模型输出,提供精确且带坐标的 OCR 结果
  • 在桌面或服务器应用中利用硬件加速实现实时 OCR 功能

项目优势

  • 单个 npm 包安装包含 OCR 运行时、模型和 PDF 渲染器,无需后安装下载
  • 自动启用硬件加速(Core ML、WebGPU 通过 Vulkan/D3D12),在测试硬件上实现最高 5.7 倍加速
  • 输出包含文本、置信度分数和四边形边界框,按阅读顺序排列,附带版本化架构
  • 跨平台支持(macOS、Linux、Windows,x64 和 arm64),并提供多种模型规模供大小/质量权衡

使用前须知

  • Tiny 和 Medium 模型层级为预览状态,可能发生变化;Tiny 不支持日文文本
  • 硬件加速效果因设备和负载而异,回退到 CPU 时性能可能较低
  • C++ 集成需要从源代码构建静态库,增加了编译步骤

README 快速开始

Quick start

项目描述

C++17 PP-OCRv6 small OCR core with an asynchronous Node-API adapter

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482