SFX Generator 是一个本地音效生成应用,使用 Stable Audio 3 Small SFX 模型,后端为 FastAPI,前端为静态单页应用,提供 REST API 进行生成、编辑和预设管理。

Stars

31

7 天增长

暂无数据

Fork 数

2

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-12

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它把先进的 AI 音效模型与实用的本地 API 服务器及直观的 Web 界面结合起来,让专业品质的音效生成不再依赖云端。

适合谁使用

  • 音效设计师和音频工程师
  • 需要快速制作音效原型的游戏开发者
  • 预算有限的独立开发者
  • 探索音频生成的 AI/ML 爱好者

典型使用场景

  • 为视频游戏生成自定义音效
  • 多媒体项目的快速音频原型制作
  • 从预设类别创建音效变体
  • 本地 AI 音频生成的教学演示

项目优势

  • 本地运行,模型下载后无需云端依赖
  • 全面的 REST API,方便与外部工具集成
  • 内置约 40 种预设,并支持自定义提示
  • 支持音频裁剪(剪切)和撤销功能

使用前须知

  • 需要 Hugging Face 账户并同意模型许可
  • 依赖独立的本地 LLM 进行翻译(日语转英语)
  • 首次运行会下载大型模型文件,若未提前配置可能失败

README 快速开始

SFX Generator

Stable Audio 3 Small SFX を使ったローカル効果音生成アプリ。 バックエンド: FastAPI(単独起動、外部アプリからREST呼び出し可)。フロントエンド: 静的SPA(FastAPIが配信)。

起動方法

cd /home/animede/sound-efect
./venv/bin/python -m app.main                  # host/port は既定値(0.0.0.0:8600)
./venv/bin/python -m app.main --port 8080       # ポート変更
./venv/bin/python -m app.main --reload          # 開発用オートリロード
# または
./venv/bin/uvicorn app.main:app --port 8600

ブラウザで http://:8600/ を開く。

初回起動時、stable_audio_3.StableAudioModel.from_pretrained("small-sfx") がバックグラウンドスレッドで Hugging Face からモデルをダウンロードする。stabilityai/stable-audio-3-small-sfx のゲート(ライセンス同意)が未承認だと 403 で失敗し、そのエラーは /api/statusmodel_error に保持される (生成エンドポイントは 503 を返す)。承認後は huggingface-cli login 等でトークンを設定してから再起動すること。

設定(環境変数)

変数既定値説明
SFX_HOST0.0.0.0待受ホスト
SFX_PORT8600待受ポート
SFX_MODELsmall-sfxStableAudioModel.from_pretrained に渡すモデル名
SFX_DEVICEcudacuda / cpu
SFX_DATA_DIR./generatedWAV と sounds.db の置き場所
SFX_LLM_URLhttp://127.0.0.1:64652/v1翻訳用ローカルLLM(OpenAI互換API)
SFX_LLM_MODELunsloth/gemma-4-E4B-it-GGUF翻訳に使うモデル名

API 一覧

すべて JSON。エラーは {"detail": "..."}

メソッドパス説明
GET/api/statusモデル/翻訳サーバの状態
GET/api/presetsプリセット一覧(約40種)
POST/api/generate効果音を生成(prompt または preset_id)
GET/api/sounds生成済み一覧(新しい順)
GET/api/sounds/{id}1件取得
GET/api/sounds/{id}/audio?download=0|1WAV 取得/ダウンロード
PATCH/api/sounds/{id}改名({"name": "..."})
DELETE/api/sounds/{id}削除
POST/api/sounds/{id}/cut区間削除({"start_s", "end_s"})
POST/api/sounds/{id}/undo直前のカットを1段階アンドゥ
GET/static/index.html を配信

詳細な仕様(リクエスト/レスポンスの形状、バリデーション)は docs/DESIGN.md を参照。

ディレクトリ構成

app/            FastAPI バックエンド
  main.py       起動エントリポイント
  config.py     設定(環境変数)
  sfx_model.py  StableAudioModel ラッパー
  translate.py  日本語→英語翻訳
  store.py      SQLite + WAV 管理
  presets.py    プリセット定義
  routers/api.py  /api/* エンドポイント
static/         フロントエンド(素のHTML/CSS/JS, wavesurfer.js vendor同梱)
generated/      生成された WAV と sounds.db(git管理外)
docs/DESIGN.md  API契約

ライセンス

本アプリは音声生成に Stability AI の Stable Audio 3 Small SFX モデル

项目描述

easy sound-efect generater

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482