MonkeyOCRv2 是一个面向文档 AI 的视觉-文本基础模型,提供文档原生的视觉编码器、解析模型和理解模型,在多语言文档解析和识别基准上取得了领先性能。

Stars

336

7 天增长

暂无数据

Fork 数

39

开放 Issue

0

开源协议

NOASSERTION

最近更新

2026-07-28

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它在多语言文档解析排行榜 MDPBench 上以 83.3 的综合分数位列开源模型第一,并开源了目前最大的文档预训练数据集 MonkeyDoc v2(包含 17 种语言、1.13 亿张图像),同时提供多种尺寸的模型(S/B/AS)并支持 vLLM 部署与 DFlash 加速(推理速度提升 2 倍)。

适合谁使用

  • 文档 AI 研究人员
  • OCR 系统开发者
  • 多语言 NLP 实践者
  • 从事文本丰富图像处理的计算机视觉工程师

典型使用场景

  • 多语言文档解析(PDF、扫描文档)为结构化文本
  • 文档视觉问答(DocVQA、InfoVQA)
  • 场景和文档中的文字识别与检测
  • 文档篡改检测与重叠文字分割

项目优势

  • 在 MDPBench 上开源模型排名第一(综合 83.3,支持 17 种语言)
  • 开源最大规模的多语言文档预训练数据集 MonkeyDoc v2(1.13 亿张图像)
  • 提供多种模型尺寸(S、B、AS),适配不同任务且参数量适中
  • 支持 vLLM 服务与 DFlash 加速,推理速度最高提升 2 倍

使用前须知

  • 下载 MonkeyDoc v2 数据集需要约 10 TB 磁盘空间
  • DFlash 加速依赖 vLLM 0.25.1 和 CUDA 12.9+,对硬件兼容性有限制
  • 模型在极低资源语言上的表现可能有所变化,评测主要覆盖 17 种语言

README 快速开始

Quick Start

项目描述

MonkeyOCRv2 Vision Encoder — A Document-Native Visual Backbone

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482