VoxCPM2 v5 音色克隆:脚本、参考音频、游戏对白与状态文档
通过 Voice Design 试听选定各角色参考音色,Style Control 全量克隆并部署到 audio/mp3/tts;清理未引用音频与 audio_1 旧产物。
This commit is contained in:
@@ -0,0 +1,73 @@
|
||||
# 《林夏》角色 Voice Design 提示词
|
||||
|
||||
> **模式**:VoxCPM2 **Voice Design**(纯提示词,**不使用** `voice/` 参考音频)
|
||||
> **接口**:`POST /v1/speech/styled` — `{ "text": "...", "style": "..." }`(**不传** `voice_id`)
|
||||
> **目的**:每个角色用不同提示词生成**不同音色**;同角色内用表演修饰控制 warm/cold 等分支。
|
||||
|
||||
---
|
||||
|
||||
## 1. 与 v2 的区别
|
||||
|
||||
| | v2 (`v2_styled`) | v3 (`v3_voice_design`) |
|
||||
|---|---|---|
|
||||
| 音色来源 | `voice/{角色}/` 参考音频克隆 | 提示词描述音色 |
|
||||
| API | `voice_id` + `style` | 仅 `style` |
|
||||
| 同角色音色 | 与 audio_1 相同 | **全新,各角色互不相同** |
|
||||
|
||||
---
|
||||
|
||||
## 2. 角色音色提示词(Voice Design 核心)
|
||||
|
||||
| 角色 | 性别 | design 提示词 |
|
||||
|------|------|--------------|
|
||||
| `linxia` | 女 | 24岁中国女性,中低音女声,声线偏薄但稳定,疲惫但清醒,克制有温度,普通话,像深夜发微信语音 |
|
||||
| `mom` | 女 | 52岁中国女性,温厚的中老年女声,音色略哑,轻微西部口音,说话慢而稳,像母亲打电话 |
|
||||
| `azhe` | **男** | 27岁中国男性,清朗偏低男声,城市口音,理性偏冷,语速平稳,用词克制,略带距离感 |
|
||||
| `xiaomei` | 女 | 24岁中国女性,明亮偏高的女声,语速快,活泼直接,像闺蜜连发语音,能量足 |
|
||||
| `xiaomei_drunk` | 女 | 24岁中国女性,同闺蜜音色但喝醉了,口齿略含糊,情绪起伏大,时而哭时而笑 |
|
||||
| `zhounan` | **男** | 26岁中国男性,温和偏闷的男中音,略拘谨,语速偏慢,像很久没联系的老同学,真诚不油 |
|
||||
| `hr` | 女 | 38岁中国女性,成熟职场女声,中音区,知性干练,疲惫的善意,像HR发工作语音 |
|
||||
| `anan` | 女 | 23岁中国女性,甜亮高音女声,语速快,比闺蜜更嗲,像在酒吧里喊,背景略吵 |
|
||||
| `dorm_a` | 女 | 22岁中国女性,兴奋尖亮女声,语速很快,像群里报喜,充满喜悦 |
|
||||
| `dorm_b` | 女 | 23岁中国女性,普通随和女声,中音,语速正常,像室友起哄 |
|
||||
| `dorm_c` | 女 | 23岁中国女性,温柔低声女声,语速略慢,像注意到朋友沉默的室友 |
|
||||
| `delivery` | **男** | 30岁中国北方男性,**男声**,偏低略粗,麻利直接,语速快,北方口音,像外卖小哥打电话 |
|
||||
| `self_3y` | 女 | 21岁中国女性,比林夏更亮更高的女声,刚来北京,兴奋带紧张,声音更年轻 |
|
||||
|
||||
配置文件:`audio_2/voice_style_prompts.py`
|
||||
|
||||
---
|
||||
|
||||
## 3. 表演修饰(同角色叠加)
|
||||
|
||||
林夏等分支台词会在音色描述后追加,例如:
|
||||
|
||||
- `_warm` → `,语气温暖开放,柔软但有分寸`
|
||||
- `_cold` → `,语气冷淡疏离,短促`
|
||||
- 妈妈长语音 seg1–seg8、周南 seg1–seg4、小美醉 seg1–seg4 等见 `voice_style_prompts.py`
|
||||
|
||||
---
|
||||
|
||||
## 4. 批量生产
|
||||
|
||||
```bash
|
||||
VOXCPM_PORT=8002 bash /home/xsl/tts-server/start-voxcpm.sh
|
||||
|
||||
# 全量
|
||||
VOXCPM_PORT=8002 python audio_2/scripts/02_gen_tts_voice_design.py --force
|
||||
|
||||
# 试听单个角色
|
||||
python audio_2/scripts/02_gen_tts_voice_design.py --role delivery --test --force
|
||||
python audio_2/scripts/02_gen_tts_voice_design.py --role linxia --test --force
|
||||
```
|
||||
|
||||
输出:`audio_2/tts/v3_voice_design/*_wav_v3.mp3`
|
||||
清单:`audio_2/tts/v3_voice_design/voice_design_manifest.tsv`
|
||||
|
||||
---
|
||||
|
||||
## 5. 注意事项
|
||||
|
||||
1. **Voice Design 同角色各条之间音色可能略有漂移**——无参考音频锚定。若某角色不稳定,可挑一条满意的音频注册为参考,改回 Style Control。
|
||||
2. **调整音色**:改 `ROLE_VOICE_DESIGN` 里对应角色的描述,重跑该角色即可。
|
||||
3. **外卖小哥必须是男声**——已在 `delivery` 提示词中写明「中国北方男性,男声」。
|
||||
Reference in New Issue
Block a user