Audio8 TTS Preview 是一个仅 0.6B 参数的多语言文本转语音模型,支持零样本语音克隆,在基准测试中与更大模型竞争。

Stars

133

7 天增长

暂无数据

Fork 数

13

开放 Issue

1

开源协议

Apache-2.0

最近更新

2026-07-30

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它以极小的参数量(0.6B)实现了顶尖性能(如 Seed-TTS 英文 WER 最佳),提供独立的 SFT 训练流程,并采用 Apache 2.0 开源许可。

适合谁使用

  • 研究紧凑型 TTS 架构的研究人员
  • 需要多语言零样本语音克隆的开发者
  • 探索开源语音合成的爱好者
  • 原型语音应用的产品团队

典型使用场景

  • 通过短参考音频进行零样本语音克隆
  • 在 11 种支持语言中生成多语言语音
  • 批量推理以规模化内容生产
  • 在领域特定语音数据上进行自定义微调

项目优势

  • 极致的参数效率(0.6B),性能媲美 1.5B–8.5B 模型
  • 英文 WER(1.506)领先,CV3 多语言错误率低
  • 开源权重与 Apache 2.0 许可,支持商业和研究使用
  • 同时提供推理工具和完整的监督微调流程

使用前须知

  • 预览版:仅支持 11 种语言,后续将扩展更多语言和方言
  • 参考音频噪声大、过长或内容不匹配会降低稳定性和相似度
  • 存在被用于冒充的风险;用户需获得同意并标注合成语音

README 快速开始

Installation

项目描述

SOTA-Class TTS at Compact Scale

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
gavamedia
精选
gavamedia GitHub avatar

deltafin

Deltafin is a research project that runs the 2.8-trillion-parameter Mixture-of-Experts model Kimi K3 on a single Apple Silicon Mac (e.g., M1 Max with 64 GB) at about 16 seconds per token, using exact, reproducible inference with local or streaming expert loading.

AI 与机器学习大语言模型
304