STFT-VAE 是一个基于短时傅里叶变换的连续 VAE 神经音频编解码器,使用 Transformer 编码器-解码器和逆 STFT,实现了极低的潜在帧率(3.125 Hz),同时保留相位并在客观指标上优于 SNAC。

Stars

43

7 天增长

暂无数据

Fork 数

2

开放 Issue

0

开源协议

MIT

最近更新

2026-07-12

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它以 4–15 倍于同类编解码器(Mimi、SNAC、MioCodec)的低帧率运行,却在所有测试指标(SI-SDR、PESQ、STOI)上超过 SNAC,并且通过 STFT/ISTFT 直接保留相位,无需学习声码器。

适合谁使用

  • 音频机器学习研究人员
  • 声音设计师和创意编程者
  • 构建低维音频表示的工程师
  • 探索连续潜在音频模型的开发者

典型使用场景

  • 为下游任务(如分类、生成)提取低速率音频潜在表示
  • 使用极紧凑的潜在空间进行音频重建
  • 通过演示页面聆听编解码器质量的并排比较
  • 将新型音频编解码器与强大的连续基线进行基准测试

项目优势

  • 极低的潜在帧率(3.125 Hz)同时保持高质量重建
  • 通过 STFT/ISTFT 保留相位,无需独立声码器
  • 在 SI-SDR、PESQ、STOI 所有客观指标上优于 SNAC
  • 预训练模型可通过 HuggingFace 获取,支持 pip 安装和命令行使用

使用前须知

  • 仅提供一个预训练模型(24 kHz,单声道),不支持其他采样率或立体声
  • 未应用量化,连续潜在表示不能直接用于压缩或存储
  • CPU 演示限制为 30 秒音频片段;推理依赖库(torch、torchcodec)较重

README 快速开始

Usage

项目描述

Inference for the STFT-VAE continuous audio codec (24kHz, 3.125Hz latent)

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482