Files
blind/音色采集清单.md
T
2026-05-18 18:39:49 +08:00

221 lines
8.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 《林夏》音色参考音频采集清单
> CosyVoice「3s极速复刻」需要每个角色提供一段 **5-20 秒的干净人声参考音频**。
> 音色采集是整个音频生产的**第一步也是最关键一步**——TTS 的最终质量上限就是参考音频的质量。
---
## 采集规格(所有角色统一)
- **时长**:10-20 秒(太短克隆不稳,太长无意义)
- **内容**:说一段完整的中文,语速自然,情绪平稳
- **录制要求**:干声,无 BGM,无混响,无明显底噪
- **格式**:WAV 或 MP3 均可(后续统一转 16kHz WAV
- **如果是从视频/播客截取**:用安静片段,避免多人同时说话的段落
---
## 需要采集的 11 条参考音频
### 1. `mom` — 妈妈
| 项 | 要求 |
|---|---|
| **性别/年龄** | 女,45-55 岁 |
| **音色关键词** | 温柔、不黏腻、略带沧桑、说话慢半拍 |
| **口音** | 普通话为主,可以有轻微西北口音(不强求) |
| **情绪** | 平稳温和,不是那种激昂的或播音腔的 |
| **避免** | 太年轻、太甜、太播音、太严厉 |
| **找人方案** | 找一位 45-55 岁的阿姨录 15 秒日常说话(比如让她念:"今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭,路上慢点。") |
| **截取方案** | 影视剧中温柔母亲角色的对白片段;中年女性生活 vlog |
| **这个角色为什么重要** | 全片情感支柱。第 16 条 4 分 17 秒长戏是全片高潮,音色必须对 |
---
### 2. `azhe` — 阿哲(前任男友)
| 项 | 要求 |
|---|---|
| **性别/年龄** | 男,25-28 岁 |
| **音色关键词** | 城市感、干净、理性、偏冷、没有攻击性但也没有温度 |
| **口音** | 标准普通话,北京口音淡 |
| **情绪** | 像在跟同事说话——礼貌但已经抽离 |
| **避免** | 太温暖、太油腻、太沧桑、方言重 |
| **截取方案** | 年轻男性播客主播冷静讲述片段;商务/科技类 vlog 男声旁白 |
| **台词量** | 少,只有 2 条,但"第一刀"效果全靠音色的冷感 |
---
### 3. `xiaomei` — 小美(闺蜜)
| 项 | 要求 |
|---|---|
| **性别/年龄** | 女,23-25 岁 |
| **音色关键词** | 活泼、大大咧咧、语速偏快、北漂女孩感 |
| **口音** | 普通话,可以有点北方口语感("嘛""呗"之类自然) |
| **情绪** | 参考音频录**正常活泼状态**即可(醉戏靠后期调) |
| **避免** | 太嗲、太文静、太播音 |
| **找人方案** | 找一个 23-25 岁活泼的女生朋友,让她用"跟闺蜜聊天"的语气说段话 |
| **截取方案** | 年轻女性 vlog 日常聊天片段 |
| **附加说明** | `self-3y`(3年前的林夏)复用这个音色做基底,所以这条参考音频同时决定两个角色 |
---
### 4. `zhounan` — 周南(初中同桌)
| 项 | 要求 |
|---|---|
| **性别/年龄** | 男,25-27 岁 |
| **音色关键词** | 温和、拘谨、不油腻、有点紧张感、二三线城市小镇青年气质 |
| **口音** | 普通话,稍带一点点不够标准的感觉(不是播音腔) |
| **情绪** | 克制的,说话声音略轻,像怕打扰到别人 |
| **避免** | 太自信、太老成、太帅哥感、太粗犷 |
| **截取方案** | 文艺/读书类播客里说话温和的男生;纪录片中普通年轻男性受访者 |
| **这个角色为什么重要** | 全片"苦中一缕甜"。他的声音必须让人觉得"这个人很好但不会推销自己" |
---
### 5. `hr` — HR 王姐
| 项 | 要求 |
|---|---|
| **性别/年龄** | 女,35-40 岁 |
| **音色关键词** | 知性、职业、温和但有距离感、像个靠谱的大姐 |
| **口音** | 标准普通话 |
| **情绪** | 公事公办但不冷漠,带一点点疲惫的善意 |
| **避免** | 太年轻、太甜、太严厉、太做作 |
| **截取方案** | 职场类播客女主播;新闻女主播(偏柔和那种,不是央视腔) |
| **台词量** | 只有 1 条,但角色感很重要 |
---
### 6. `anan` — 室友安安
| 项 | 要求 |
|---|---|
| **性别/年龄** | 女,22-24 岁 |
| **音色关键词** | 可爱、嗲、兴奋、比小美更"甜"一档 |
| **口音** | 普通话 |
| **情绪** | 自顾自的快乐,不是故意撒娇而是天生就这样 |
| **避免** | 和 `xiaomei` 太像(必须能区分) |
| **找人方案** | 找一个声线偏甜的女生朋友 |
| **截取方案** | 可爱类女性 UP 主日常 vlog |
| **台词量** | 只有 1 条短语音 |
---
### 7-9. `dorm-a` / `dorm-b` / `dorm-c` — 寝室群三人
这三个角色同时出现在大学群聊里,**必须互相能区分,也必须和小美/安安区分**。
| 角色 | 人设 | 音色方向 | 和谁不能像 |
|---|---|---|---|
| **dorm-a** | 升职那位,语速快,爱热闹 | 开朗外向,语速快,声线偏亮 | 不能像 xiaomei(小美比她更"野" |
| **dorm-b** | 和事佬,温和 | 温柔日常,不突出,中间音色 | 不能像 anan(安安比她更嗲) |
| **dorm-c** | @林夏的那个,偏冷静 | 偏沉稳,年轻女声里偏低的那种 | 不能像 hr(HR 比她更成熟) |
每人需要一条独立的参考音频。找 3 个不同声线的年轻女声。
---
### 10. `delivery` — 外卖小哥
| 项 | 要求 |
|---|---|
| **性别/年龄** | 男,28-32 岁 |
| **音色关键词** | 麻利、工作状态、不寒暄、北方普通话 |
| **口音** | 普通话 + 少许河南/河北腔(轻微就行) |
| **情绪** | 中性,工作语气,不热情也不冷漠 |
| **避免** | 太文雅、太慢 |
| **截取方案** | 短视频里外卖小哥/快递员说话的片段 |
| **台词量** | 只有 1 句话 |
---
### 11. `system` — 系统 TTS
| 项 | 要求 |
|---|---|
| **方案** | **不需要采集参考音频**,直接用 CosyVoice 内置预训练音色 |
| **音色方向** | 中性 AI 女声,清晰、无感情、类似 Siri 但更轻 |
| **操作** | 启动 WebUI 后在"预训练音色"模式里试听,选一个最合适的 |
---
## 不需要单独采集的
| 角色 | 原因 |
|---|---|
| `self-3y`3年前的自己) | 复用 `xiaomei` 的参考音频,合成时调速度 |
| `self-laugh`(林夏的笑声) | TTS 无法自然生成笑声。**最佳方案:找 `xiaomei` 同一个人笑一声录下来**。备选:后期合成 |
| `unknown`(未知号码) | 无台词,只有呼吸声,从音效库获取 |
| `system` | 用 CosyVoice 预训练音色,无需参考 |
---
## 汇总:你需要找到的人/素材
| # | 需求 | 优先级 | 最省事的方式 |
|---|---|---|---|
| 1 | **一位 45-55 岁女性**说 15 秒话 | 最高 | 找妈妈/阿姨/同事的妈妈录一段 |
| 2 | 一位 25-28 岁冷感男声 10 秒 | 高 | 播客/有声书截取 |
| 3 | **一位 23-25 岁活泼女生**说 15 秒话 | 最高 | 找朋友录(同时给 self-3y 用,再录一声笑给 self-laugh 用)|
| 4 | 一位 25-27 岁温和男声 10 秒 | 高 | 播客/纪录片截取 |
| 5 | 一位 35-40 岁知性女声 10 秒 | 中 | 播客截取 |
| 6 | 一位 22-24 岁甜美女声 10 秒 | 中 | 找朋友录或 UP 主截取 |
| 7-9 | **3 位不同声线的年轻女声**各 10 秒 | 中 | 可以从不同 UP 主截取 |
| 10 | 一位北方口音男性 10 秒 | 低 | 短视频截取 |
**最少找 2 个真人录音**#1 妈妈 + #3 小美/林夏),其余都可以截取。
---
## 录音指导话术(发给帮忙录音的人)
### 给"妈妈"录音的人:
> 帮个忙,用手机录一段话,15-20 秒就行。找个安静的地方,用你平时说话的语气念:
>
> "今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭。路上慢点,别着急。对了,你上次说的那个同事后来怎么样了?没事就算了,妈妈就是随便问问。"
>
> 不用播音腔,就像平时跟孩子打电话一样说就行。录完发我微信就好,谢谢!
### 给"小美/林夏"录音的人:
> 帮个忙,用手机录一段话,15 秒左右。找个安静的地方,就用你平时跟朋友聊天的语气说:
>
> "哎你猜怎么着,今天路上遇到一个超搞笑的事,就那个奶茶店你知道吧,门口排了好长的队,结果我一去发现今天闭店了,白走一趟!"
>
> 然后**再录一声自然的笑**——就"噗"一下笑出来那种,不用太夸张,3 秒就行。
>
> 两条录音分开发我就行,谢谢!
---
## 文件命名与交付
录好 / 截取好后,按这个格式命名,放到 `audio/00_raw/tts/prompt_ref/`
```
mom_ref.wav
azhe_ref.wav
xiaomei_ref.wav ← 同时作为 self-3y 基底
xiaomei_laugh_ref.wav ← 给 self-laugh 用
zhounan_ref.wav
hr_ref.wav
anan_ref.wav
dorm_a_ref.wav
dorm_b_ref.wav
dorm_c_ref.wav
delivery_ref.wav
```
每条参考音频旁边配一个同名 `.txt` 记录对应文字内容(CosyVoice 克隆时需要):
```
mom_ref.txt → 写这段录音里说了什么字
azhe_ref.txt → ...
```
**收齐这 10 条参考音频后,就可以开始 TTS 生产了。**