一个教学用途的全栈NPU加速器演示,包含16×16脉动阵列RTL设计、AXI4 SoC集成、C/Python运行时、UART串行驱动以及TVM BYOC编译器后端,已在FPGA上验证并通过LeNet-5推理。

Stars

17

7 天增长

暂无数据

Fork 数

1

开放 Issue

0

开源协议

AGPL-3.0

最近更新

2026-07-29

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它提供了从RTL到神经网络推理的完整开源NPU设计,包括在真实芯片上的硬件验证以及与TVM编译器栈的集成,是难得的教育资源。

适合谁使用

  • 学习脉动阵列和SoC设计的硬件工程师
  • 探索TVM BYOC后端的编译器开发者
  • 计算机体系结构和加速器领域的学生与研究人员
  • 希望构建自定义神经网络加速器的FPGA爱好者

典型使用场景

  • 教学NPU架构和全栈加速器设计
  • 原型设计与研究脉动阵列及数据流策略
  • 为NPU开发并测试自定义TVM代码生成目标
  • 在低功耗嵌入式硬件上运行LeNet-5等小型神经网络

项目优势

  • 完整的从RTL到推理的流水线,集成了TVM BYOC
  • 已在Xilinx FPGA上以175 MHz频率硬件验证,达到44.8 GMAC/s
  • 17个自检测试平台和黄金模型确保正确性
  • 详细的文档包括模块规范和中英文体系结构原理

使用前须知

  • 仅支持INT8精度,不支持浮点或混合精度
  • 专为Xilinx XCZU4EV开发板设计,移植到其他FPGA需要适配
  • UART传输极慢(每张图像约1秒),无PCIe/以太网时实际部署受限
  • 采用AGPLv3许可证,可能限制商业或闭源使用

README 快速开始

Quick Start

项目描述

End-to-End NPU: RTL systolic array → AXI4 SoC → TVM compiler → FPGA inference

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

vercel-labs
精选
vercel-labs GitHub avatar

scriptc

scriptc compiles ordinary TypeScript into small, fast native executables without needing Node.js, V8, or any JavaScript runtime in the binary.

开发者工具代码质量与构建
1,985
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
mereyabdenbekuly-ctrl
精选
mereyabdenbekuly-ctrl GitHub avatar

clodex-ide

Clodex is an open-source, local-first agentic IDE that combines persistent AI tasks, code, terminal, browser, Git, models, memory, and governed execution in one Electron workspace, currently in technical preview.

AI 与机器学习AI 智能体
859