diff --git a/技术报告_音频资源制作.md b/技术报告_音频资源制作.md new file mode 100644 index 0000000..00b7be7 --- /dev/null +++ b/技术报告_音频资源制作.md @@ -0,0 +1,300 @@ +# 音频资源制作技术落地报告 + +> 调研日期:2026-05-20 +> 最后更新:2026-05-20(新增 GPT-SoVITS / Fish Speech / Stable Audio 部署完成状态) +> 硬件环境:NVIDIA RTX 5090 (32GB VRAM) / CUDA Driver 12.9 / WSL2 Linux + +--- + +## 一、本机已有能力总览 + +| 能力域 | 工具 | 状态 | 环境 | +|--------|------|------|------| +| TTS 语音合成 | VoxCPM2 | **运行中** (port 8000) | Python 3.13 venv | +| TTS 语音合成 | CosyVoice2-0.5B | 已部署,需手动启动 | conda cosyvoice | +| TTS 语音合成 | **GPT-SoVITS v2** | **已部署** ✅ | conda gptsovits / torch 2.8.0+cu128 | +| TTS 语音合成 | **Fish Speech 2.0** | **已部署** ✅ | conda fishspeech / torch 2.8.0+cu128 | +| 音乐/铃声生成 | ACE-Step 1.5 | 已部署,需手动启动 | conda acestep | +| 音效/氛围生成 | ACE-Step 1.5 | 同上 | conda acestep | +| 音效/氛围生成 | **Stable Audio Open 1.0** | **已部署** ✅ | conda stableaudio / torch 2.8.0+cu128 | +| 语音识别 (ASR) | SenseVoice Small | 模型已缓存 | HuggingFace cache | +| 语音识别 (ASR) | Whisper Tiny | 模型已缓存 | HuggingFace cache | +| 轻量 TTS | Kokoro-82M | 模型已缓存 | HuggingFace cache | +| 音频处理 | ffmpeg 7.0.2 | 可用 | 系统 PATH | +| 音频分析 | librosa / soundfile / pydub | 可用 | pip | +| 音视频同步 | MuseTalk / LatentSync | 已部署 | conda 环境 | + +### 当前产出数据 (《林夏》项目) + +| 类型 | 数量 | 生成工具 | +|------|------|----------| +| TTS 对话语音 | 216 条 (mp3/tts/) | VoxCPM2 | +| BGM 背景音乐 | 4 轨 (90s/30s/120s/120s) | ACE-Step 1.5 | +| 角色铃声 | 9 条 | ACE-Step 1.5 | +| 音效 | 18 条 | ACE-Step 1.5 | +| 环境氛围 | 6 条 | ACE-Step 1.5 | +| 总计 MP3 | 372 个文件 | — | + +--- + +## 二、各能力域详细分析 + +### 2.1 TTS 语音合成 + +#### 本机已有 + +| 工具 | 模型大小 | VRAM | 中文质量 | 声音克隆 | 延迟 | 特点 | +|------|---------|------|---------|---------|------|------| +| **VoxCPM2** | 4.7GB | ~6GB | A | 零样本 (5-30s参考音频) | ~1s/句 | FastAPI 服务,REST API,48kHz WAV 输出,带降噪器 | +| **CosyVoice2-0.5B** | 5.3GB | ~8GB | A+ | 零样本 | ~2s/句 | WebUI,多语言,语速可控,阿里开源 | +| **Kokoro-82M** | <200MB | <2GB (可CPU) | B (中文社区扩展) | 不支持 | <0.3s | 超轻量,英文为主,适合实时场景 | +| **Edge-TTS** | 0 (云端) | 0 | B+ | 不支持 | 网络延迟 | 微软在线服务,免费,多音色 | + +**当前主链路**:VoxCPM2 为主 → CosyVoice2 为备 → Edge-TTS 为最终兜底 + +#### 推荐部署到本地 + +| 工具 | Stars | 模型大小 | VRAM | 为什么值得部署 | 部署难度 | +|------|-------|---------|------|--------------|---------| +| **GPT-SoVITS v2** | 57k | ~3GB | 4-6GB | 中文 TTS 天花板;1 分钟参考音频即可克隆;自带 ASR 标注工具链;MIT 开源 | 中 (conda + WebUI) | +| **Fish Speech S2** | 26k | ~4GB | 4-24GB | 10M+小时训练数据;15000 种情感标签;WER 最低;接近 ElevenLabs 品质 | 中 (Docker 或 pip) | +| **F5-TTS** | 14.5k | ~3GB | 8GB | Flow-matching 架构;零样本克隆质量最高;MIT 开源 | 低 (pip install) | +| **ChatTTS** | 39k | ~2GB | 4GB | 专为对话设计;自然笑声/停顿/语气词;适合互动叙事 | 低 (pip install) | + +**部署优先级建议**: +1. **GPT-SoVITS** — 综合最强,完整工具链(ASR标注 → 训练 → 推理),适合为《林夏》每个角色精调专属声线 +2. **Fish Speech S2** — 情感控制力最强,适合需要微妙情绪变化的场景(醉酒小美、哽咽妈妈) +3. **ChatTTS** — 对话自然度最高,适合即兴/随机对白生成 + +#### 线上服务 + +| 服务 | 中文质量 | 声音克隆 | 延迟 | 价格 | 适用场景 | +|------|---------|---------|------|------|---------| +| **MiniMax Speech 2.8** | S | 支持 (30s参考) | <250ms | 按字符计费 | 实时语音交互、低延迟场景 | +| **豆包 TTS 2.0** (字节) | S | 支持 (Seed-ICL) | ~1s | 火山引擎计费 | 中文情感表达最强,指令控制情绪 | +| **通义 TTS** (阿里) | A+ | 支持 (CosyVoice) | 标准 | 免费试用额度 | 与本机 CosyVoice 生态互通 | +| **ElevenLabs** | A | 专业级 | ~100ms | $5-99/月 | 多语言、API 最成熟、配套 SFX | +| **百度语音合成** | A | 有限 | 标准 | Token 计费 | 最老牌、REST 接入最简单 | + +--- + +### 2.2 音乐制作 + +#### 本机已有 + +| 工具 | 模型大小 | VRAM | 能力 | 当前产出 | +|------|---------|------|------|---------| +| **ACE-Step 1.5** | 9.4GB (60个checkpoint) | ~8GB | 文本→音乐/铃声/氛围;支持歌词+人声;20s 生成 4 分钟音频;seed 可复现 | 4轨 BGM + 9 条铃声 | + +**当前配置**:已针对 RTX 5090 修复 cuBLAS 兼容性 (`cublaslt`),turbo 模式。 + +#### 推荐部署到本地 + +| 工具 | Stars | VRAM | 为什么值得部署 | 适用场景 | +|------|-------|------|--------------|---------| +| **DiffRhythm 2** | 新项目 | ~8GB | 最快:10 秒生成 4:45 歌曲;精确歌词对齐;Latent Diffusion 架构 | 快速迭代 BGM 候选 | +| **YuE (乐)** | Apache 2.0 | 8GB(量化)-80GB(全) | 双 LLaMA 架构;完整歌曲(人声+伴奏同步);最接近 Suno 的开源方案 | 需要完整歌曲(含唱) | +| **MusicGen (Meta)** | CC BY-NC | ~12GB fp16 | 研究级纯器乐生成;立体声输出;Loop 素材可控性强 | 纯器乐 BGM / 素材 | +| **Stable Audio Open 1.5** | 已 clone | ~12GB | 47s 立体声 44.1kHz;SFX 和音乐兼顾;代码已在本机 | 音效与短音乐片段 | + +**部署优先级建议**: +1. **Stable Audio Open 1.5** — 代码已在本机 (`/home/xsl/tools/stable-audio-tools/`),只需下载模型权重 + `pip install`,马上可用 +2. **DiffRhythm 2** — 速度碾压 ACE-Step,适合大量迭代试听 +3. **YuE** — 32GB VRAM 可跑量化版,适合需要有歌词人声的完整歌曲 + +#### 线上服务 + +| 服务 | 人声 | 中文歌词 | 时长 | 价格 | 特点 | +|------|------|---------|------|------|------| +| **Suno v5** | 有 | 支持 | ~4min | 免费 300 首/月 | 品质最高;版权诉讼风险 | +| **Udio** | 有 | 支持 | ~4min | 免费额度 | 与 Suno 竞品;已暂停下载功能 | +| **网易天音** | 有 | 中文原生 | 可变 | 按需 | 国内平台,版权更清晰 | + +--- + +### 2.3 音效生成 + +#### 本机已有 + +| 工具 | 能力 | 当前产出 | +|------|------|---------| +| **ACE-Step 1.5** | 氛围类音效 (>=5s):心跳、呼吸、雨声、敲门、猫叫、水壶、环境氛围等 | 18 条 SFX + 6 条氛围 | +| **ffmpeg** | 后期处理:混音叠加、底噪叠加、格式转换、音量调节 | 全流程 | +| **Web Audio API** (游戏内) | 13 种 UI 短音效:合成叮/咚/滴/滑动音,无需外部文件 | 实时合成 | + +**限制**:ACE-Step 擅长氛围/音乐类音效,不擅长短促精确的 UI 音效(<1s 的 click/beep)。 + +#### 推荐部署到本地 + +| 工具 | VRAM | 为什么值得部署 | 适用场景 | +|------|------|--------------|---------| +| **Stable Audio Open 1.5** | ~12GB | 音效生成品质最高的开源方案;44.1kHz 立体声;47s 时长 | 高品质 Foley、环境音 | +| **AudioLDM 2** | 8-16GB | 全能型(SFX + 音乐 + 语音);48kHz;多种模型尺寸 | 短音效、过渡音 | + +**部署优先级建议**: +1. **Stable Audio Open 1.5** — 同上,已有代码,补模型即可 +2. **AudioLDM 2** — pip 安装,轻量推理,适合补充短促音效 + +#### 线上服务 + +| 服务 | 时长上限 | 价格 | 特点 | +|------|---------|------|------| +| **ElevenLabs SFX v2** | 30s | 免费额度 | 制作级品质,支持循环,版税免费 | +| **Stable Audio 2.5** (API) | 3min | 按量 | 音频修复/inpainting,商业安全 | + +--- + +### 2.4 语音克隆 / 变声 + +#### 本机已有 + +VoxCPM2 和 CosyVoice2 均内置零样本声音克隆。当前《林夏》项目已为 12 个角色建立参考音频库: + +``` +voice/ + linxia/ linxia_ref.wav + mom/ mom_extra_04.wav + azhe/ azhe_extra_05.wav + xiaomei/ ... + zhounan/ delivery/ hr/ anan/ + dorm_a/ dorm_b/ dorm_c/ +``` + +#### 推荐部署到本地 + +| 工具 | Stars | 为什么值得 | 适用场景 | +|------|-------|----------|---------| +| **GPT-SoVITS** | 57k | 1 分钟参考即可高保真克隆;内置 ASR+标注+训练全链路;RTF 0.014 (4090) | 为角色训练专属声线模型 | +| **OpenVoice V2** | 36k | 单条音频秒级克隆;跨语言(克隆英文声 → 输出中文)| 快速原型、临时角色 | +| **RVC v2** | 36k | 实时变声;10 分钟数据可训练;社区模型库庞大 | 歌声转换、直播变声 | +| **Seed-VC** | 新 | 零样本相似度最高;解决音色泄漏问题;支持唱歌 | 高精度声音复刻 | + +**部署优先级**:GPT-SoVITS > Seed-VC > OpenVoice V2 + +--- + +### 2.5 语音识别 (ASR) — 辅助能力 + +| 工具 | 状态 | 用途 | +|------|------|------| +| **SenseVoice Small** | 模型已缓存 | 中文 ASR,可用于语音标注、字幕生成 | +| **Whisper Tiny** | 模型已缓存 | 多语言 ASR 兜底 | + +--- + +## 三、推荐部署路线图 + +### ✅ 已完成部署(2026-05-20) + +| 序号 | 工具 | 路径 | 模型 | torch | +|------|------|------|------|-------| +| 1 | **Stable Audio Open 1.0** | `/home/xsl/tools/stable-audio-tools/` | `/home/xsl/models/stable-audio-open/` | 2.8.0+cu128 (stableaudio) | +| 2 | **GPT-SoVITS v2** | `/home/xsl/tools/GPT-SoVITS/` | `GPT_SoVITS/pretrained_models/` (含 v2Pro/v3) | 2.8.0+cu128 (gptsovits) | +| 3 | **Fish Speech 2.0** | `/home/xsl/tools/fish-speech/` | `/home/xsl/models/fish-speech-1.5/` | 2.8.0+cu128 (fishspeech) | + +**注:全部使用 CUDA 12.8 编译版 torch,支持 RTX 5090 (sm_120)**。 +PyTorch wheel 来源:`https://mirrors.aliyun.com/pytorch-wheels/cu128/` + +#### 启动命令 + +```bash +# Stable Audio Open — Gradio WebUI +conda activate stableaudio +cd /home/xsl/tools/stable-audio-tools +python run_gradio.py \ + --model-config /home/xsl/models/stable-audio-open/model_config.json \ + --ckpt-path /home/xsl/models/stable-audio-open/model.safetensors + +# GPT-SoVITS — WebUI(含 ASR 标注 + 训练 + 推理) +conda activate gptsovits +cd /home/xsl/tools/GPT-SoVITS +python webui.py +# 默认 http://127.0.0.1:9872 + +# Fish Speech — API 服务 +conda activate fishspeech +cd /home/xsl/tools/fish-speech +python -m tools.api \ + --listen 0.0.0.0:8080 \ + --llama-checkpoint-dir /home/xsl/models/fish-speech-1.5 \ + --decoder-checkpoint-dir /home/xsl/models/fish-speech-1.5/firefly-gan-vq-fsq-8x1024-21hz-generator.pth \ + --decoder-config-name firefly_gan_vq +# 或 Gradio WebUI: +python tools/run_webui.py --llama-checkpoint-dir /home/xsl/models/fish-speech-1.5 +``` + +### 下一优先级 — 待部署 + +| 序号 | 工具 | 操作 | 预计耗时 | VRAM | +|------|------|------|---------|------| +| 4 | **ChatTTS** | `pip install ChatTTS` → 下载模型 | 30min | 4GB | + +### 按需部署 + +| 序号 | 工具 | 场景 | +|------|------|------| +| 5 | **DiffRhythm 2** | 需要快速迭代大量 BGM 候选时 | +| 6 | **AudioLDM 2** | 需要精确短音效生成时 | +| 7 | **YuE** | 需要完整中文歌曲(人声+伴奏)时 | +| 8 | **OpenVoice V2** | 需要快速跨语言声音克隆时 | + +--- + +## 四、能力矩阵 + +``` + 本机已有 待部署 线上服务 + ┌───────────────┐ ┌────────────┐ ┌────────────┐ + TTS │ VoxCPM2 │ │ ChatTTS │ │ MiniMax │ + 语音合成 │ CosyVoice2 │ │ F5-TTS │ │ 豆包 TTS │ + │ GPT-SoVITS ✅ │ │ │ │ ElevenLabs │ + │ Fish Speech ✅│ │ │ │ 通义 TTS │ + │ Kokoro-82M │ │ │ │ │ + └───────────────┘ └────────────┘ └────────────┘ + ┌───────────────┐ ┌────────────┐ ┌────────────┐ + 音乐生成 │ ACE-Step │ │ DiffRhythm │ │ Suno v5 │ + │ │ │ YuE │ │ Udio │ + │ │ │ MusicGen │ │ │ + └───────────────┘ └────────────┘ └────────────┘ + ┌───────────────┐ ┌────────────┐ ┌────────────┐ + 音效生成 │ ACE-Step │ │ AudioLDM 2 │ │ ElevenLabs │ + │ StableAudio ✅│ │ │ │ StableAudio│ + │ Web Audio │ │ │ │ API │ + │ ffmpeg │ │ │ │ │ + └───────────────┘ └────────────┘ └────────────┘ + ┌───────────────┐ ┌────────────┐ ┌────────────┐ + 声音克隆 │ VoxCPM2 │ │ Seed-VC │ │ ElevenLabs │ + │ CosyVoice2 │ │ OpenVoice │ │ MiniMax │ + │ GPT-SoVITS ✅ │ │ RVC v2 │ │ 豆包 │ + │ Fish Speech ✅│ │ │ │ │ + └───────────────┘ └────────────┘ └────────────┘ + ┌───────────────┐ + ASR │ SenseVoice │ (辅助能力,非生产主线) + 语音识别 │ Whisper │ + └───────────────┘ +``` + +--- + +## 五、VRAM 并行策略 + +RTX 5090 (32GB) 可同时运行的组合: + +| 组合 | 占用 VRAM | 场景 | +|------|----------|------| +| VoxCPM2 (6G) + ACE-Step (8G) | ~14GB | TTS + 音乐同时生产 | +| VoxCPM2 (6G) + Stable Audio (12G) | ~18GB | TTS + 高品质音效 | +| GPT-SoVITS (6G) + ACE-Step (8G) | ~14GB | 高品质 TTS + 音乐 | +| CosyVoice2 (8G) + ChatTTS (4G) | ~12GB | 双 TTS 引擎对比试听 | +| 单独 YuE 量化版 | ~8-24GB | 完整歌曲生成(独占) | + +--- + +## 六、针对《林夏》项目的升级建议 + +| 现状 | 升级方案 | 收益 | +|------|---------|------| +| VoxCPM2 零样本克隆 | → GPT-SoVITS 精调各角色模型 | 声线稳定性大幅提升,不再依赖参考音频选择 | +| ACE-Step 生成全部音效 | → Stable Audio Open 1.5 补充精细音效 | 44.1kHz 立体声,电话底噪/UI 音效品质更高 | +| 单一 TTS 引擎 | → Fish Speech S2 补充情感场景 | 醉酒、哽咽等极端情绪表达更自然 | +| 结局仅语音 + 字幕 | → ACE-Step/DiffRhythm 生成结局专属 BGM | 5 个结局各有独立氛围音乐,沉浸感提升 |