移除 GPT-SoVITS 和 Fish Speech,整理 audio_1 脚本与文档

- 删除 03_gen_tts_gptsovits.py、00_transcribe_refs.py、ref_texts.json
- 删除 02_gen_tts_fishspeech.py 及 tts/v2_fishspeech/ 生成结果
- 保留 VoxCPM2 / ACE-Step / Stable Audio 三条链路
- 更新执行文档和技术报告,清除两款 TTS 的所有引用

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
xsl
2026-05-20 23:12:01 +08:00
co-authored by Claude Sonnet 4.6
parent 10ced5cb69
commit e5d3d44f9d
501 changed files with 960 additions and 37 deletions
+169
View File
@@ -0,0 +1,169 @@
# 《林夏》音频资源重制执行文档
> 创建日期:2026-05-20
> 目标:独立生成一套 TTS 语音 + 两套音乐音效,供对比选择
> 游戏代码不做任何修改,audio_1/ 仅用于评听比较
---
## 一、目录结构
```
audio_1/
├── 执行文档.md ← 本文件
├── tts/
│ └── v1_voxcpm2/ TTS版本1VoxCPM2(原方案复刻)
└── music/
├── v1_acestep/ 音乐版本1ACE-Step 1.5(原方案复刻)
│ ├── music/
│ ├── sfx/
│ └── ambience/
└── v2_stableaudio/ 音乐版本2Stable Audio Open 1.0
├── music/
├── sfx/
└── ambience/
```
**文件命名规则:**`audio/mp3/tts/` 完全相同(如 `v2_msg02_linxia_warm_wav_v1.mp3`
→ 若要上游切换到某版本,只需将对应目录复制覆盖 `audio/mp3/tts/` 即可
---
## 二、资源清单
| 类别 | 文件数 | 说明 |
|------|--------|------|
| TTS — NPC 来电语音 | ~30 | lv11_* 开头,妈妈/小美/外卖/阿哲等11个角色 |
| TTS — 林夏回应 | ~90 | v2_msg*_linxia_* |
| TTS — NPC 反应 | ~60 | v2_msg*_react_* |
| TTS — 系统提示 | 4 | v2_sys_* |
| TTS — 结局旁白 | 7 | v2_ending_* |
| **TTS 合计** | **~190** | |
| 音乐 BGM | 4 | lv11_bgm_m1~m4 |
| 铃声 | 9 | lv11_ring_* |
| 音效 SFX | 18 | sfx_* |
| 环境氛围 | 6 | amb_* |
| **音乐合计/版本** | **37** | × 2 版本 = 74个文件 |
---
## 三、技术方案
### 音乐工具对比
| 项目 | v1 ACE-Step | v2 Stable Audio |
|------|------------|-----------------|
| conda 环境 | acestep | stableaudio |
| 优势 | 已验证效果,可控 seed | 44.1kHz 立体声,音效更真实 |
| 劣势 | 音乐结构感强,SFX 偏长 | 不擅长节奏明确的循环 BGM |
| 最适合 | BGM + 铃声 | SFX + 环境氛围 |
---
## 四、执行步骤
### 步骤 0:准备工作(一次性)
```bash
# 创建目录
mkdir -p /home/xsl/blind/audio_1/tts/v1_voxcpm2
mkdir -p /home/xsl/blind/audio_1/music/v1_acestep/{music,sfx,ambience}
mkdir -p /home/xsl/blind/audio_1/music/v2_stableaudio/{music,sfx,ambience}
```
### 步骤 1TTS v1 — VoxCPM2
```bash
# 确认服务运行
curl http://127.0.0.1:8000/health
# 执行批量生成(输出到 audio_1/tts/v1_voxcpm2/
python audio_1/scripts/01_gen_tts_voxcpm2.py
```
**预计耗时**:约 90 分钟(~190条 × ~30s/条)
### 步骤 2:音乐 v1 — ACE-Step
```bash
conda activate acestep
python audio_1/scripts/04_gen_music_acestep.py
```
**预计耗时**:约 60 分钟(37 条,每条 20~90s
### 步骤 3:音乐 v2 — Stable Audio
```bash
conda activate stableaudio
python audio_1/scripts/05_gen_music_stableaudio.py
```
**预计耗时**:约 90 分钟(37 条,每条 ~2min
### 步骤 4:格式统一
```bash
# 所有版本统一转为 mp3 128kbps 24kHz mono
python audio_1/scripts/06_convert_all_to_mp3.py
```
---
## 五、脚本清单
| 脚本 | 职责 |
|------|------|
| `scripts/01_gen_tts_voxcpm2.py` | VoxCPM2 批量 TTS,输出到 tts/v1_voxcpm2/ |
| `scripts/04_gen_music_acestep.py` | ACE-Step 批量生成,输出到 music/v1_acestep/ |
| `scripts/05_gen_music_stableaudio.py` | Stable Audio 批量生成,输出到 music/v2_stableaudio/ |
| `scripts/06_convert_all_to_mp3.py` | WAV → MP3 统一格式转换 |
---
## 六、角色参考音频路径
| 角色 key | 参考音频 | 语速倍率 |
|----------|---------|---------|
| linxia | voice/linxia/linxia_ref.wav | 1.00 |
| mom | voice/mom/mom_extra_04.wav | 0.92 |
| azhe | voice/azhe/azhe_extra_05.wav | 1.05 |
| xiaomei | voice/xiaomei/xiaomei_03.wav | 1.10 |
| xiaomei_drunk | voice/xiaomei/xiaomei_03.wav | 0.95 |
| zhounan | voice/zhounan/zhounan_extra_10.wav | 0.95 |
| hr | voice/hr/hr_extra_18.wav | 1.00 |
| anan | voice/anan/anan_extra_13.wav | 1.15 |
| dorm_a | voice/dorm_a/000017e3-...wav | 1.10 |
| dorm_b | voice/dorm_b/a001c446-...wav | 1.00 |
| dorm_c | voice/dorm_c/dorm_c_extra_15.wav | 0.95 |
| delivery | voice/delivery/delivery_01.wav | 1.20 |
| self_3y | voice/linxia/linxia_ref.wav | 1.15 |
---
## 七、评听方式(完成后)
所有文件名与游戏引用完全一致。评听时可临时替换:
```bash
# 备份原版本
cp -r audio/mp3/tts audio/mp3/tts_original
# 试听某个 TTS 版本
cp -r audio_1/tts/v1_voxcpm2/* audio/mp3/tts/
# 试听音乐版本
cp -r audio_1/music/v2_stableaudio/* audio/mp3/
```
---
## 八、进度记录
| 步骤 | 状态 | 完成时间 | 备注 |
|------|------|---------|------|
| 步骤 0:准备(创建目录) | ⬜ 待执行 | — | — |
| 步骤 1TTS v1 VoxCPM2 | ⬜ 待执行 | — | — |
| 步骤 2:音乐 v1 ACE-Step | ⬜ 待执行 | — | — |
| 步骤 3:音乐 v2 Stable Audio | ⬜ 待执行 | — | — |
| 步骤 4:格式转换 | ⬜ 待执行 | — | — |