CosyVoice3Pro 是基于 NVIDIA Triton Inference Server 与 TensorRT-LLM 构建的生产级语音克隆服务,采用解耦的声纹注册机制,一次注册后只需传 speakerId 与文本即可生成语音。

Stars

19

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-29

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它提供了完整的高性能语音克隆服务栈,具备 A100 上 0.148 RTF 的实测性能、开发者友好的 HTTP API、Web 管理后台以及音频后处理功能,同时将声纹特征提取从每次推理中解耦,大幅降低重复上传开销。

适合谁使用

  • 需要将语音克隆集成到应用中的开发者
  • 在生产环境运行高性能 TTS 系统的运维团队
  • 研究或尝试基于 CosyVoice 部署的实验者
  • 管理 GPU 推理服务的基础设施工程师

典型使用场景

  • 构建跨会话保持一致的个性化语音助手
  • 提供低延迟的定制音频内容生成 API(如有声书、配音)
  • 部署支持多说话人和即时风格覆盖的可扩展 TTS 流水线
  • 通过持久化声纹注册替代重复音频上传以降低成本

项目优势

  • 解耦注册:一次上传音频注册,后续所有 TTS 请求仅需 speakerId 与文本
  • 可验证的性能:在 A100-80GB 上 24 并发请求下端到端 RTF 仍低于 0.6
  • 功能全面:内置声纹管理(增删改查)、音频后处理(语速、音量、格式)和 Web 界面
  • 开发者友好:标准 HTTP/JSON API(无需 Triton tensor 协议),并兼容旧版接口

使用前须知

  • 需要 NVIDIA GPU 和 Docker 环境,不支持 CPU 运行
  • Web 后台与 API 默认无登录认证,生产部署需额外增加安全层
  • 基于上游 CosyVoice 社区项目,非 FunAudioLLM 官方发行版

README 快速开始

快速开始

项目描述

Production-ready CosyVoice serving with Triton, reusable Speaker Registry, Public HTTP API and Web console.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
makecindy
精选
makecindy GitHub avatar

cindy

Cindy is an open-source AI agent that runs locally on your machine, integrates multiple AI harnesses and models, and provides memory, skills, and automation to perform real work in your projects and apps.

AI 与机器学习大语言模型
958