Files
blind/audio_2/角色语音风格提示词.md
T
xsl 12eb1eab44 VoxCPM2 v5 音色克隆:脚本、参考音频、游戏对白与状态文档
通过 Voice Design 试听选定各角色参考音色,Style Control 全量克隆并部署到 audio/mp3/tts;清理未引用音频与 audio_1 旧产物。
2026-05-24 00:34:50 +08:00

74 lines
3.7 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 《林夏》角色 Voice Design 提示词
> **模式**VoxCPM2 **Voice Design**(纯提示词,**不使用** `voice/` 参考音频)
> **接口**`POST /v1/speech/styled` — `{ "text": "...", "style": "..." }`**不传** `voice_id`
> **目的**:每个角色用不同提示词生成**不同音色**;同角色内用表演修饰控制 warm/cold 等分支。
---
## 1. 与 v2 的区别
| | v2 (`v2_styled`) | v3 (`v3_voice_design`) |
|---|---|---|
| 音色来源 | `voice/{角色}/` 参考音频克隆 | 提示词描述音色 |
| API | `voice_id` + `style` | 仅 `style` |
| 同角色音色 | 与 audio_1 相同 | **全新,各角色互不相同** |
---
## 2. 角色音色提示词(Voice Design 核心)
| 角色 | 性别 | design 提示词 |
|------|------|--------------|
| `linxia` | 女 | 24岁中国女性,中低音女声,声线偏薄但稳定,疲惫但清醒,克制有温度,普通话,像深夜发微信语音 |
| `mom` | 女 | 52岁中国女性,温厚的中老年女声,音色略哑,轻微西部口音,说话慢而稳,像母亲打电话 |
| `azhe` | **男** | 27岁中国男性,清朗偏低男声,城市口音,理性偏冷,语速平稳,用词克制,略带距离感 |
| `xiaomei` | 女 | 24岁中国女性,明亮偏高的女声,语速快,活泼直接,像闺蜜连发语音,能量足 |
| `xiaomei_drunk` | 女 | 24岁中国女性,同闺蜜音色但喝醉了,口齿略含糊,情绪起伏大,时而哭时而笑 |
| `zhounan` | **男** | 26岁中国男性,温和偏闷的男中音,略拘谨,语速偏慢,像很久没联系的老同学,真诚不油 |
| `hr` | 女 | 38岁中国女性,成熟职场女声,中音区,知性干练,疲惫的善意,像HR发工作语音 |
| `anan` | 女 | 23岁中国女性,甜亮高音女声,语速快,比闺蜜更嗲,像在酒吧里喊,背景略吵 |
| `dorm_a` | 女 | 22岁中国女性,兴奋尖亮女声,语速很快,像群里报喜,充满喜悦 |
| `dorm_b` | 女 | 23岁中国女性,普通随和女声,中音,语速正常,像室友起哄 |
| `dorm_c` | 女 | 23岁中国女性,温柔低声女声,语速略慢,像注意到朋友沉默的室友 |
| `delivery` | **男** | 30岁中国北方男性,**男声**,偏低略粗,麻利直接,语速快,北方口音,像外卖小哥打电话 |
| `self_3y` | 女 | 21岁中国女性,比林夏更亮更高的女声,刚来北京,兴奋带紧张,声音更年轻 |
配置文件:`audio_2/voice_style_prompts.py`
---
## 3. 表演修饰(同角色叠加)
林夏等分支台词会在音色描述后追加,例如:
- `_warm``,语气温暖开放,柔软但有分寸`
- `_cold``,语气冷淡疏离,短促`
- 妈妈长语音 seg1seg8、周南 seg1seg4、小美醉 seg1seg4 等见 `voice_style_prompts.py`
---
## 4. 批量生产
```bash
VOXCPM_PORT=8002 bash /home/xsl/tts-server/start-voxcpm.sh
# 全量
VOXCPM_PORT=8002 python audio_2/scripts/02_gen_tts_voice_design.py --force
# 试听单个角色
python audio_2/scripts/02_gen_tts_voice_design.py --role delivery --test --force
python audio_2/scripts/02_gen_tts_voice_design.py --role linxia --test --force
```
输出:`audio_2/tts/v3_voice_design/*_wav_v3.mp3`
清单:`audio_2/tts/v3_voice_design/voice_design_manifest.tsv`
---
## 5. 注意事项
1. **Voice Design 同角色各条之间音色可能略有漂移**——无参考音频锚定。若某角色不稳定,可挑一条满意的音频注册为参考,改回 Style Control。
2. **调整音色**:改 `ROLE_VOICE_DESIGN` 里对应角色的描述,重跑该角色即可。
3. **外卖小哥必须是男声**——已在 `delivery` 提示词中写明「中国北方男性,男声」。