移除 GPT-SoVITS 和 Fish Speech,整理 audio_1 脚本与文档

- 删除 03_gen_tts_gptsovits.py、00_transcribe_refs.py、ref_texts.json
- 删除 02_gen_tts_fishspeech.py 及 tts/v2_fishspeech/ 生成结果
- 保留 VoxCPM2 / ACE-Step / Stable Audio 三条链路
- 更新执行文档和技术报告,清除两款 TTS 的所有引用

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
xsl
2026-05-20 23:12:01 +08:00
co-authored by Claude Sonnet 4.6
parent 10ced5cb69
commit e5d3d44f9d
501 changed files with 960 additions and 37 deletions
+6 -37
View File
@@ -1,7 +1,7 @@
# 音频资源制作技术落地报告
> 调研日期:2026-05-20
> 最后更新:2026-05-20(新增 GPT-SoVITS / Fish Speech / Stable Audio 部署完成状态)
> 最后更新:2026-05-20(新增 Stable Audio 部署完成状态)
> 硬件环境:NVIDIA RTX 5090 (32GB VRAM) / CUDA Driver 12.9 / WSL2 Linux
---
@@ -12,8 +12,6 @@
|--------|------|------|------|
| TTS 语音合成 | VoxCPM2 | **运行中** (port 8000) | Python 3.13 venv |
| TTS 语音合成 | CosyVoice2-0.5B | 已部署,需手动启动 | conda cosyvoice |
| TTS 语音合成 | **GPT-SoVITS v2** | **已部署** ✅ | conda gptsovits / torch 2.8.0+cu128 |
| TTS 语音合成 | **Fish Speech 2.0** | **已部署** ✅ | conda fishspeech / torch 2.8.0+cu128 |
| 音乐/铃声生成 | ACE-Step 1.5 | 已部署,需手动启动 | conda acestep |
| 音效/氛围生成 | ACE-Step 1.5 | 同上 | conda acestep |
| 音效/氛围生成 | **Stable Audio Open 1.0** | **已部署** ✅ | conda stableaudio / torch 2.8.0+cu128 |
@@ -56,15 +54,11 @@
| 工具 | Stars | 模型大小 | VRAM | 为什么值得部署 | 部署难度 |
|------|-------|---------|------|--------------|---------|
| **GPT-SoVITS v2** | 57k | ~3GB | 4-6GB | 中文 TTS 天花板;1 分钟参考音频即可克隆;自带 ASR 标注工具链;MIT 开源 | 中 (conda + WebUI) |
| **Fish Speech S2** | 26k | ~4GB | 4-24GB | 10M+小时训练数据;15000 种情感标签;WER 最低;接近 ElevenLabs 品质 | 中 (Docker 或 pip) |
| **F5-TTS** | 14.5k | ~3GB | 8GB | Flow-matching 架构;零样本克隆质量最高;MIT 开源 | 低 (pip install) |
| **ChatTTS** | 39k | ~2GB | 4GB | 专为对话设计;自然笑声/停顿/语气词;适合互动叙事 | 低 (pip install) |
**部署优先级建议**
1. **GPT-SoVITS**综合最强,完整工具链(ASR标注 → 训练 → 推理),适合为《林夏》每个角色精调专属声线
2. **Fish Speech S2** — 情感控制力最强,适合需要微妙情绪变化的场景(醉酒小美、哽咽妈妈)
3. **ChatTTS** — 对话自然度最高,适合即兴/随机对白生成
1. **ChatTTS**对话自然度最高,适合即兴/随机对白生成
#### 线上服务
@@ -164,12 +158,11 @@ voice/
| 工具 | Stars | 为什么值得 | 适用场景 |
|------|-------|----------|---------|
| **GPT-SoVITS** | 57k | 1 分钟参考即可高保真克隆;内置 ASR+标注+训练全链路;RTF 0.014 (4090) | 为角色训练专属声线模型 |
| **OpenVoice V2** | 36k | 单条音频秒级克隆;跨语言(克隆英文声 → 输出中文)| 快速原型、临时角色 |
| **RVC v2** | 36k | 实时变声;10 分钟数据可训练;社区模型库庞大 | 歌声转换、直播变声 |
| **Seed-VC** | 新 | 零样本相似度最高;解决音色泄漏问题;支持唱歌 | 高精度声音复刻 |
**部署优先级**GPT-SoVITS > Seed-VC > OpenVoice V2
**部署优先级**Seed-VC > OpenVoice V2
---
@@ -189,8 +182,6 @@ voice/
| 序号 | 工具 | 路径 | 模型 | torch |
|------|------|------|------|-------|
| 1 | **Stable Audio Open 1.0** | `/home/xsl/tools/stable-audio-tools/` | `/home/xsl/models/stable-audio-open/` | 2.8.0+cu128 (stableaudio) |
| 2 | **GPT-SoVITS v2** | `/home/xsl/tools/GPT-SoVITS/` | `GPT_SoVITS/pretrained_models/` (含 v2Pro/v3) | 2.8.0+cu128 (gptsovits) |
| 3 | **Fish Speech 2.0** | `/home/xsl/tools/fish-speech/` | `/home/xsl/models/fish-speech-1.5/` | 2.8.0+cu128 (fishspeech) |
**注:全部使用 CUDA 12.8 编译版 torch,支持 RTX 5090 (sm_120)**
PyTorch wheel 来源:`https://mirrors.aliyun.com/pytorch-wheels/cu128/`
@@ -204,23 +195,6 @@ cd /home/xsl/tools/stable-audio-tools
python run_gradio.py \
--model-config /home/xsl/models/stable-audio-open/model_config.json \
--ckpt-path /home/xsl/models/stable-audio-open/model.safetensors
# GPT-SoVITS — WebUI(含 ASR 标注 + 训练 + 推理)
conda activate gptsovits
cd /home/xsl/tools/GPT-SoVITS
python webui.py
# 默认 http://127.0.0.1:9872
# Fish Speech — API 服务
conda activate fishspeech
cd /home/xsl/tools/fish-speech
python -m tools.api \
--listen 0.0.0.0:8080 \
--llama-checkpoint-dir /home/xsl/models/fish-speech-1.5 \
--decoder-checkpoint-dir /home/xsl/models/fish-speech-1.5/firefly-gan-vq-fsq-8x1024-21hz-generator.pth \
--decoder-config-name firefly_gan_vq
# 或 Gradio WebUI:
python tools/run_webui.py --llama-checkpoint-dir /home/xsl/models/fish-speech-1.5
```
### 下一优先级 — 待部署
@@ -247,9 +221,8 @@ python tools/run_webui.py --llama-checkpoint-dir /home/xsl/models/fish-speech-1.
┌───────────────┐ ┌────────────┐ ┌────────────┐
TTS │ VoxCPM2 │ │ ChatTTS │ │ MiniMax │
语音合成 │ CosyVoice2 │ │ F5-TTS │ │ 豆包 TTS │
GPT-SoVITS ✅ │ │ │ │ ElevenLabs │
Fish Speech ✅│ │ │ │ 通义 TTS │
│ Kokoro-82M │ │ │ │ │
Kokoro-82M │ │ │ │ ElevenLabs │
│ │ │ │ 通义 TTS │
└───────────────┘ └────────────┘ └────────────┘
┌───────────────┐ ┌────────────┐ ┌────────────┐
音乐生成 │ ACE-Step │ │ DiffRhythm │ │ Suno v5 │
@@ -265,8 +238,7 @@ python tools/run_webui.py --llama-checkpoint-dir /home/xsl/models/fish-speech-1.
┌───────────────┐ ┌────────────┐ ┌────────────┐
声音克隆 │ VoxCPM2 │ │ Seed-VC │ │ ElevenLabs │
│ CosyVoice2 │ │ OpenVoice │ │ MiniMax │
GPT-SoVITS ✅ │ │ RVC v2 │ │ 豆包 │
│ Fish Speech ✅│ │ │ │ │
│ │ RVC v2 │ │ 豆包 │
└───────────────┘ └────────────┘ └────────────┘
┌───────────────┐
ASR │ SenseVoice │ (辅助能力,非生产主线)
@@ -284,7 +256,6 @@ RTX 5090 (32GB) 可同时运行的组合:
|------|----------|------|
| VoxCPM2 (6G) + ACE-Step (8G) | ~14GB | TTS + 音乐同时生产 |
| VoxCPM2 (6G) + Stable Audio (12G) | ~18GB | TTS + 高品质音效 |
| GPT-SoVITS (6G) + ACE-Step (8G) | ~14GB | 高品质 TTS + 音乐 |
| CosyVoice2 (8G) + ChatTTS (4G) | ~12GB | 双 TTS 引擎对比试听 |
| 单独 YuE 量化版 | ~8-24GB | 完整歌曲生成(独占) |
@@ -294,7 +265,5 @@ RTX 5090 (32GB) 可同时运行的组合:
| 现状 | 升级方案 | 收益 |
|------|---------|------|
| VoxCPM2 零样本克隆 | → GPT-SoVITS 精调各角色模型 | 声线稳定性大幅提升,不再依赖参考音频选择 |
| ACE-Step 生成全部音效 | → Stable Audio Open 1.5 补充精细音效 | 44.1kHz 立体声,电话底噪/UI 音效品质更高 |
| 单一 TTS 引擎 | → Fish Speech S2 补充情感场景 | 醉酒、哽咽等极端情绪表达更自然 |
| 结局仅语音 + 字幕 | → ACE-Step/DiffRhythm 生成结局专属 BGM | 5 个结局各有独立氛围音乐,沉浸感提升 |