Files
blind/技术报告_音频资源制作.md
T
xslandClaude Sonnet 4.6 e5d3d44f9d 移除 GPT-SoVITS 和 Fish Speech,整理 audio_1 脚本与文档
- 删除 03_gen_tts_gptsovits.py、00_transcribe_refs.py、ref_texts.json
- 删除 02_gen_tts_fishspeech.py 及 tts/v2_fishspeech/ 生成结果
- 保留 VoxCPM2 / ACE-Step / Stable Audio 三条链路
- 更新执行文档和技术报告,清除两款 TTS 的所有引用

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
2026-05-20 23:12:01 +08:00

13 KiB
Raw Blame History

音频资源制作技术落地报告

调研日期:2026-05-20
最后更新:2026-05-20(新增 Stable Audio 部署完成状态)
硬件环境:NVIDIA RTX 5090 (32GB VRAM) / CUDA Driver 12.9 / WSL2 Linux


一、本机已有能力总览

能力域 工具 状态 环境
TTS 语音合成 VoxCPM2 运行中 (port 8000) Python 3.13 venv
TTS 语音合成 CosyVoice2-0.5B 已部署,需手动启动 conda cosyvoice
音乐/铃声生成 ACE-Step 1.5 已部署,需手动启动 conda acestep
音效/氛围生成 ACE-Step 1.5 同上 conda acestep
音效/氛围生成 Stable Audio Open 1.0 已部署 conda stableaudio / torch 2.8.0+cu128
语音识别 (ASR) SenseVoice Small 模型已缓存 HuggingFace cache
语音识别 (ASR) Whisper Tiny 模型已缓存 HuggingFace cache
轻量 TTS Kokoro-82M 模型已缓存 HuggingFace cache
音频处理 ffmpeg 7.0.2 可用 系统 PATH
音频分析 librosa / soundfile / pydub 可用 pip
音视频同步 MuseTalk / LatentSync 已部署 conda 环境

当前产出数据 (《林夏》项目)

类型 数量 生成工具
TTS 对话语音 216 条 (mp3/tts/) VoxCPM2
BGM 背景音乐 4 轨 (90s/30s/120s/120s) ACE-Step 1.5
角色铃声 9 条 ACE-Step 1.5
音效 18 条 ACE-Step 1.5
环境氛围 6 条 ACE-Step 1.5
总计 MP3 372 个文件

二、各能力域详细分析

2.1 TTS 语音合成

本机已有

工具 模型大小 VRAM 中文质量 声音克隆 延迟 特点
VoxCPM2 4.7GB ~6GB A 零样本 (5-30s参考音频) ~1s/句 FastAPI 服务,REST API48kHz WAV 输出,带降噪器
CosyVoice2-0.5B 5.3GB ~8GB A+ 零样本 ~2s/句 WebUI,多语言,语速可控,阿里开源
Kokoro-82M <200MB <2GB (可CPU) B (中文社区扩展) 不支持 <0.3s 超轻量,英文为主,适合实时场景
Edge-TTS 0 (云端) 0 B+ 不支持 网络延迟 微软在线服务,免费,多音色

当前主链路VoxCPM2 为主 → CosyVoice2 为备 → Edge-TTS 为最终兜底

推荐部署到本地

工具 Stars 模型大小 VRAM 为什么值得部署 部署难度
F5-TTS 14.5k ~3GB 8GB Flow-matching 架构;零样本克隆质量最高;MIT 开源 低 (pip install)
ChatTTS 39k ~2GB 4GB 专为对话设计;自然笑声/停顿/语气词;适合互动叙事 低 (pip install)

部署优先级建议

  1. ChatTTS — 对话自然度最高,适合即兴/随机对白生成

线上服务

服务 中文质量 声音克隆 延迟 价格 适用场景
MiniMax Speech 2.8 S 支持 (30s参考) <250ms 按字符计费 实时语音交互、低延迟场景
豆包 TTS 2.0 (字节) S 支持 (Seed-ICL) ~1s 火山引擎计费 中文情感表达最强,指令控制情绪
通义 TTS (阿里) A+ 支持 (CosyVoice) 标准 免费试用额度 与本机 CosyVoice 生态互通
ElevenLabs A 专业级 ~100ms $5-99/月 多语言、API 最成熟、配套 SFX
百度语音合成 A 有限 标准 Token 计费 最老牌、REST 接入最简单

2.2 音乐制作

本机已有

工具 模型大小 VRAM 能力 当前产出
ACE-Step 1.5 9.4GB (60个checkpoint) ~8GB 文本→音乐/铃声/氛围;支持歌词+人声;20s 生成 4 分钟音频;seed 可复现 4轨 BGM + 9 条铃声

当前配置:已针对 RTX 5090 修复 cuBLAS 兼容性 (cublaslt)turbo 模式。

推荐部署到本地

工具 Stars VRAM 为什么值得部署 适用场景
DiffRhythm 2 新项目 ~8GB 最快:10 秒生成 4:45 歌曲;精确歌词对齐;Latent Diffusion 架构 快速迭代 BGM 候选
YuE (乐) Apache 2.0 8GB(量化)-80GB(全) 双 LLaMA 架构;完整歌曲(人声+伴奏同步);最接近 Suno 的开源方案 需要完整歌曲(含唱)
MusicGen (Meta) CC BY-NC ~12GB fp16 研究级纯器乐生成;立体声输出;Loop 素材可控性强 纯器乐 BGM / 素材
Stable Audio Open 1.5 已 clone ~12GB 47s 立体声 44.1kHz;SFX 和音乐兼顾;代码已在本机 音效与短音乐片段

部署优先级建议

  1. Stable Audio Open 1.5 — 代码已在本机 (/home/xsl/tools/stable-audio-tools/),只需下载模型权重 + pip install,马上可用
  2. DiffRhythm 2 — 速度碾压 ACE-Step,适合大量迭代试听
  3. YuE — 32GB VRAM 可跑量化版,适合需要有歌词人声的完整歌曲

线上服务

服务 人声 中文歌词 时长 价格 特点
Suno v5 支持 ~4min 免费 300 首/月 品质最高;版权诉讼风险
Udio 支持 ~4min 免费额度 与 Suno 竞品;已暂停下载功能
网易天音 中文原生 可变 按需 国内平台,版权更清晰

2.3 音效生成

本机已有

工具 能力 当前产出
ACE-Step 1.5 氛围类音效 (>=5s):心跳、呼吸、雨声、敲门、猫叫、水壶、环境氛围等 18 条 SFX + 6 条氛围
ffmpeg 后期处理:混音叠加、底噪叠加、格式转换、音量调节 全流程
Web Audio API (游戏内) 13 种 UI 短音效:合成叮/咚/滴/滑动音,无需外部文件 实时合成

限制:ACE-Step 擅长氛围/音乐类音效,不擅长短促精确的 UI 音效(<1s 的 click/beep)。

推荐部署到本地

工具 VRAM 为什么值得部署 适用场景
Stable Audio Open 1.5 ~12GB 音效生成品质最高的开源方案;44.1kHz 立体声;47s 时长 高品质 Foley、环境音
AudioLDM 2 8-16GB 全能型(SFX + 音乐 + 语音);48kHz;多种模型尺寸 短音效、过渡音

部署优先级建议

  1. Stable Audio Open 1.5 — 同上,已有代码,补模型即可
  2. AudioLDM 2 — pip 安装,轻量推理,适合补充短促音效

线上服务

服务 时长上限 价格 特点
ElevenLabs SFX v2 30s 免费额度 制作级品质,支持循环,版税免费
Stable Audio 2.5 (API) 3min 按量 音频修复/inpainting,商业安全

2.4 语音克隆 / 变声

本机已有

VoxCPM2 和 CosyVoice2 均内置零样本声音克隆。当前《林夏》项目已为 12 个角色建立参考音频库:

voice/
  linxia/    linxia_ref.wav
  mom/       mom_extra_04.wav
  azhe/      azhe_extra_05.wav
  xiaomei/   ...
  zhounan/   delivery/   hr/   anan/
  dorm_a/    dorm_b/     dorm_c/

推荐部署到本地

工具 Stars 为什么值得 适用场景
OpenVoice V2 36k 单条音频秒级克隆;跨语言(克隆英文声 → 输出中文) 快速原型、临时角色
RVC v2 36k 实时变声;10 分钟数据可训练;社区模型库庞大 歌声转换、直播变声
Seed-VC 零样本相似度最高;解决音色泄漏问题;支持唱歌 高精度声音复刻

部署优先级Seed-VC > OpenVoice V2


2.5 语音识别 (ASR) — 辅助能力

工具 状态 用途
SenseVoice Small 模型已缓存 中文 ASR,可用于语音标注、字幕生成
Whisper Tiny 模型已缓存 多语言 ASR 兜底

三、推荐部署路线图

已完成部署(2026-05-20

序号 工具 路径 模型 torch
1 Stable Audio Open 1.0 /home/xsl/tools/stable-audio-tools/ /home/xsl/models/stable-audio-open/ 2.8.0+cu128 (stableaudio)

注:全部使用 CUDA 12.8 编译版 torch,支持 RTX 5090 (sm_120)
PyTorch wheel 来源:https://mirrors.aliyun.com/pytorch-wheels/cu128/

启动命令

# Stable Audio Open — Gradio WebUI
conda activate stableaudio
cd /home/xsl/tools/stable-audio-tools
python run_gradio.py \
  --model-config /home/xsl/models/stable-audio-open/model_config.json \
  --ckpt-path /home/xsl/models/stable-audio-open/model.safetensors

下一优先级 — 待部署

序号 工具 操作 预计耗时 VRAM
4 ChatTTS pip install ChatTTS → 下载模型 30min 4GB

按需部署

序号 工具 场景
5 DiffRhythm 2 需要快速迭代大量 BGM 候选时
6 AudioLDM 2 需要精确短音效生成时
7 YuE 需要完整中文歌曲(人声+伴奏)时
8 OpenVoice V2 需要快速跨语言声音克隆时

四、能力矩阵

                    本机已有              待部署            线上服务
                ┌───────────────┐  ┌────────────┐  ┌────────────┐
   TTS          │ VoxCPM2       │  │ ChatTTS    │  │ MiniMax    │
   语音合成     │ CosyVoice2    │  │ F5-TTS     │  │ 豆包 TTS   │
                │ Kokoro-82M    │  │            │  │ ElevenLabs │
                │               │  │            │  │ 通义 TTS   │
                └───────────────┘  └────────────┘  └────────────┘
                ┌───────────────┐  ┌────────────┐  ┌────────────┐
   音乐生成     │ ACE-Step      │  │ DiffRhythm │  │ Suno v5    │
                │               │  │ YuE        │  │ Udio       │
                │               │  │ MusicGen   │  │            │
                └───────────────┘  └────────────┘  └────────────┘
                ┌───────────────┐  ┌────────────┐  ┌────────────┐
   音效生成     │ ACE-Step      │  │ AudioLDM 2 │  │ ElevenLabs │
                │ StableAudio ✅│  │            │  │ StableAudio│
                │ Web Audio     │  │            │  │ API        │
                │ ffmpeg        │  │            │  │            │
                └───────────────┘  └────────────┘  └────────────┘
                ┌───────────────┐  ┌────────────┐  ┌────────────┐
   声音克隆     │ VoxCPM2       │  │ Seed-VC    │  │ ElevenLabs │
                │ CosyVoice2    │  │ OpenVoice  │  │ MiniMax    │
                │               │  │ RVC v2     │  │ 豆包       │
                └───────────────┘  └────────────┘  └────────────┘
                ┌───────────────┐
   ASR          │ SenseVoice    │  (辅助能力,非生产主线)
   语音识别     │ Whisper       │
                └───────────────┘

五、VRAM 并行策略

RTX 5090 (32GB) 可同时运行的组合:

组合 占用 VRAM 场景
VoxCPM2 (6G) + ACE-Step (8G) ~14GB TTS + 音乐同时生产
VoxCPM2 (6G) + Stable Audio (12G) ~18GB TTS + 高品质音效
CosyVoice2 (8G) + ChatTTS (4G) ~12GB 双 TTS 引擎对比试听
单独 YuE 量化版 ~8-24GB 完整歌曲生成(独占)

六、针对《林夏》项目的升级建议

现状 升级方案 收益
ACE-Step 生成全部音效 → Stable Audio Open 1.5 补充精细音效 44.1kHz 立体声,电话底噪/UI 音效品质更高
结局仅语音 + 字幕 → ACE-Step/DiffRhythm 生成结局专属 BGM 5 个结局各有独立氛围音乐,沉浸感提升