通过 Voice Design 试听选定各角色参考音色,Style Control 全量克隆并部署到 audio/mp3/tts;清理未引用音频与 audio_1 旧产物。
3.7 KiB
3.7 KiB
《林夏》角色 Voice Design 提示词
模式:VoxCPM2 Voice Design(纯提示词,不使用
voice/参考音频)
接口:POST /v1/speech/styled—{ "text": "...", "style": "..." }(不传voice_id)
目的:每个角色用不同提示词生成不同音色;同角色内用表演修饰控制 warm/cold 等分支。
1. 与 v2 的区别
v2 (v2_styled) |
v3 (v3_voice_design) |
|
|---|---|---|
| 音色来源 | voice/{角色}/ 参考音频克隆 |
提示词描述音色 |
| API | voice_id + style |
仅 style |
| 同角色音色 | 与 audio_1 相同 | 全新,各角色互不相同 |
2. 角色音色提示词(Voice Design 核心)
| 角色 | 性别 | design 提示词 |
|---|---|---|
linxia |
女 | 24岁中国女性,中低音女声,声线偏薄但稳定,疲惫但清醒,克制有温度,普通话,像深夜发微信语音 |
mom |
女 | 52岁中国女性,温厚的中老年女声,音色略哑,轻微西部口音,说话慢而稳,像母亲打电话 |
azhe |
男 | 27岁中国男性,清朗偏低男声,城市口音,理性偏冷,语速平稳,用词克制,略带距离感 |
xiaomei |
女 | 24岁中国女性,明亮偏高的女声,语速快,活泼直接,像闺蜜连发语音,能量足 |
xiaomei_drunk |
女 | 24岁中国女性,同闺蜜音色但喝醉了,口齿略含糊,情绪起伏大,时而哭时而笑 |
zhounan |
男 | 26岁中国男性,温和偏闷的男中音,略拘谨,语速偏慢,像很久没联系的老同学,真诚不油 |
hr |
女 | 38岁中国女性,成熟职场女声,中音区,知性干练,疲惫的善意,像HR发工作语音 |
anan |
女 | 23岁中国女性,甜亮高音女声,语速快,比闺蜜更嗲,像在酒吧里喊,背景略吵 |
dorm_a |
女 | 22岁中国女性,兴奋尖亮女声,语速很快,像群里报喜,充满喜悦 |
dorm_b |
女 | 23岁中国女性,普通随和女声,中音,语速正常,像室友起哄 |
dorm_c |
女 | 23岁中国女性,温柔低声女声,语速略慢,像注意到朋友沉默的室友 |
delivery |
男 | 30岁中国北方男性,男声,偏低略粗,麻利直接,语速快,北方口音,像外卖小哥打电话 |
self_3y |
女 | 21岁中国女性,比林夏更亮更高的女声,刚来北京,兴奋带紧张,声音更年轻 |
配置文件:audio_2/voice_style_prompts.py
3. 表演修饰(同角色叠加)
林夏等分支台词会在音色描述后追加,例如:
_warm→,语气温暖开放,柔软但有分寸_cold→,语气冷淡疏离,短促- 妈妈长语音 seg1–seg8、周南 seg1–seg4、小美醉 seg1–seg4 等见
voice_style_prompts.py
4. 批量生产
VOXCPM_PORT=8002 bash /home/xsl/tts-server/start-voxcpm.sh
# 全量
VOXCPM_PORT=8002 python audio_2/scripts/02_gen_tts_voice_design.py --force
# 试听单个角色
python audio_2/scripts/02_gen_tts_voice_design.py --role delivery --test --force
python audio_2/scripts/02_gen_tts_voice_design.py --role linxia --test --force
输出:audio_2/tts/v3_voice_design/*_wav_v3.mp3
清单:audio_2/tts/v3_voice_design/voice_design_manifest.tsv
5. 注意事项
- Voice Design 同角色各条之间音色可能略有漂移——无参考音频锚定。若某角色不稳定,可挑一条满意的音频注册为参考,改回 Style Control。
- 调整音色:改
ROLE_VOICE_DESIGN里对应角色的描述,重跑该角色即可。 - 外卖小哥必须是男声——已在
delivery提示词中写明「中国北方男性,男声」。