diff --git a/音色采集清单.md b/音色采集清单.md deleted file mode 100644 index 1e0f7e0..0000000 --- a/音色采集清单.md +++ /dev/null @@ -1,220 +0,0 @@ -# 《林夏》音色参考音频采集清单 - -> CosyVoice「3s极速复刻」需要每个角色提供一段 **5-20 秒的干净人声参考音频**。 -> 音色采集是整个音频生产的**第一步也是最关键一步**——TTS 的最终质量上限就是参考音频的质量。 - ---- - -## 采集规格(所有角色统一) - -- **时长**:10-20 秒(太短克隆不稳,太长无意义) -- **内容**:说一段完整的中文,语速自然,情绪平稳 -- **录制要求**:干声,无 BGM,无混响,无明显底噪 -- **格式**:WAV 或 MP3 均可(后续统一转 16kHz WAV) -- **如果是从视频/播客截取**:用安静片段,避免多人同时说话的段落 - ---- - -## 需要采集的 11 条参考音频 - -### 1. `mom` — 妈妈 - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 女,45-55 岁 | -| **音色关键词** | 温柔、不黏腻、略带沧桑、说话慢半拍 | -| **口音** | 普通话为主,可以有轻微西北口音(不强求) | -| **情绪** | 平稳温和,不是那种激昂的或播音腔的 | -| **避免** | 太年轻、太甜、太播音、太严厉 | -| **找人方案** | 找一位 45-55 岁的阿姨录 15 秒日常说话(比如让她念:"今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭,路上慢点。") | -| **截取方案** | 影视剧中温柔母亲角色的对白片段;中年女性生活 vlog | -| **这个角色为什么重要** | 全片情感支柱。第 16 条 4 分 17 秒长戏是全片高潮,音色必须对 | - ---- - -### 2. `azhe` — 阿哲(前任男友) - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 男,25-28 岁 | -| **音色关键词** | 城市感、干净、理性、偏冷、没有攻击性但也没有温度 | -| **口音** | 标准普通话,北京口音淡 | -| **情绪** | 像在跟同事说话——礼貌但已经抽离 | -| **避免** | 太温暖、太油腻、太沧桑、方言重 | -| **截取方案** | 年轻男性播客主播冷静讲述片段;商务/科技类 vlog 男声旁白 | -| **台词量** | 少,只有 2 条,但"第一刀"效果全靠音色的冷感 | - ---- - -### 3. `xiaomei` — 小美(闺蜜) - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 女,23-25 岁 | -| **音色关键词** | 活泼、大大咧咧、语速偏快、北漂女孩感 | -| **口音** | 普通话,可以有点北方口语感("嘛""呗"之类自然) | -| **情绪** | 参考音频录**正常活泼状态**即可(醉戏靠后期调) | -| **避免** | 太嗲、太文静、太播音 | -| **找人方案** | 找一个 23-25 岁活泼的女生朋友,让她用"跟闺蜜聊天"的语气说段话 | -| **截取方案** | 年轻女性 vlog 日常聊天片段 | -| **附加说明** | `self-3y`(3年前的林夏)复用这个音色做基底,所以这条参考音频同时决定两个角色 | - ---- - -### 4. `zhounan` — 周南(初中同桌) - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 男,25-27 岁 | -| **音色关键词** | 温和、拘谨、不油腻、有点紧张感、二三线城市小镇青年气质 | -| **口音** | 普通话,稍带一点点不够标准的感觉(不是播音腔) | -| **情绪** | 克制的,说话声音略轻,像怕打扰到别人 | -| **避免** | 太自信、太老成、太帅哥感、太粗犷 | -| **截取方案** | 文艺/读书类播客里说话温和的男生;纪录片中普通年轻男性受访者 | -| **这个角色为什么重要** | 全片"苦中一缕甜"。他的声音必须让人觉得"这个人很好但不会推销自己" | - ---- - -### 5. `hr` — HR 王姐 - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 女,35-40 岁 | -| **音色关键词** | 知性、职业、温和但有距离感、像个靠谱的大姐 | -| **口音** | 标准普通话 | -| **情绪** | 公事公办但不冷漠,带一点点疲惫的善意 | -| **避免** | 太年轻、太甜、太严厉、太做作 | -| **截取方案** | 职场类播客女主播;新闻女主播(偏柔和那种,不是央视腔) | -| **台词量** | 只有 1 条,但角色感很重要 | - ---- - -### 6. `anan` — 室友安安 - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 女,22-24 岁 | -| **音色关键词** | 可爱、嗲、兴奋、比小美更"甜"一档 | -| **口音** | 普通话 | -| **情绪** | 自顾自的快乐,不是故意撒娇而是天生就这样 | -| **避免** | 和 `xiaomei` 太像(必须能区分) | -| **找人方案** | 找一个声线偏甜的女生朋友 | -| **截取方案** | 可爱类女性 UP 主日常 vlog | -| **台词量** | 只有 1 条短语音 | - ---- - -### 7-9. `dorm-a` / `dorm-b` / `dorm-c` — 寝室群三人 - -这三个角色同时出现在大学群聊里,**必须互相能区分,也必须和小美/安安区分**。 - -| 角色 | 人设 | 音色方向 | 和谁不能像 | -|---|---|---|---| -| **dorm-a** | 升职那位,语速快,爱热闹 | 开朗外向,语速快,声线偏亮 | 不能像 xiaomei(小美比她更"野") | -| **dorm-b** | 和事佬,温和 | 温柔日常,不突出,中间音色 | 不能像 anan(安安比她更嗲) | -| **dorm-c** | @林夏的那个,偏冷静 | 偏沉稳,年轻女声里偏低的那种 | 不能像 hr(HR 比她更成熟) | - -每人需要一条独立的参考音频。找 3 个不同声线的年轻女声。 - ---- - -### 10. `delivery` — 外卖小哥 - -| 项 | 要求 | -|---|---| -| **性别/年龄** | 男,28-32 岁 | -| **音色关键词** | 麻利、工作状态、不寒暄、北方普通话 | -| **口音** | 普通话 + 少许河南/河北腔(轻微就行) | -| **情绪** | 中性,工作语气,不热情也不冷漠 | -| **避免** | 太文雅、太慢 | -| **截取方案** | 短视频里外卖小哥/快递员说话的片段 | -| **台词量** | 只有 1 句话 | - ---- - -### 11. `system` — 系统 TTS - -| 项 | 要求 | -|---|---| -| **方案** | **不需要采集参考音频**,直接用 CosyVoice 内置预训练音色 | -| **音色方向** | 中性 AI 女声,清晰、无感情、类似 Siri 但更轻 | -| **操作** | 启动 WebUI 后在"预训练音色"模式里试听,选一个最合适的 | - ---- - -## 不需要单独采集的 - -| 角色 | 原因 | -|---|---| -| `self-3y`(3年前的自己) | 复用 `xiaomei` 的参考音频,合成时调速度 | -| `self-laugh`(林夏的笑声) | TTS 无法自然生成笑声。**最佳方案:找 `xiaomei` 同一个人笑一声录下来**。备选:后期合成 | -| `unknown`(未知号码) | 无台词,只有呼吸声,从音效库获取 | -| `system` | 用 CosyVoice 预训练音色,无需参考 | - ---- - -## 汇总:你需要找到的人/素材 - -| # | 需求 | 优先级 | 最省事的方式 | -|---|---|---|---| -| 1 | **一位 45-55 岁女性**说 15 秒话 | 最高 | 找妈妈/阿姨/同事的妈妈录一段 | -| 2 | 一位 25-28 岁冷感男声 10 秒 | 高 | 播客/有声书截取 | -| 3 | **一位 23-25 岁活泼女生**说 15 秒话 | 最高 | 找朋友录(同时给 self-3y 用,再录一声笑给 self-laugh 用)| -| 4 | 一位 25-27 岁温和男声 10 秒 | 高 | 播客/纪录片截取 | -| 5 | 一位 35-40 岁知性女声 10 秒 | 中 | 播客截取 | -| 6 | 一位 22-24 岁甜美女声 10 秒 | 中 | 找朋友录或 UP 主截取 | -| 7-9 | **3 位不同声线的年轻女声**各 10 秒 | 中 | 可以从不同 UP 主截取 | -| 10 | 一位北方口音男性 10 秒 | 低 | 短视频截取 | - -**最少找 2 个真人录音**(#1 妈妈 + #3 小美/林夏),其余都可以截取。 - ---- - -## 录音指导话术(发给帮忙录音的人) - -### 给"妈妈"录音的人: - -> 帮个忙,用手机录一段话,15-20 秒就行。找个安静的地方,用你平时说话的语气念: -> -> "今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭。路上慢点,别着急。对了,你上次说的那个同事后来怎么样了?没事就算了,妈妈就是随便问问。" -> -> 不用播音腔,就像平时跟孩子打电话一样说就行。录完发我微信就好,谢谢! - -### 给"小美/林夏"录音的人: - -> 帮个忙,用手机录一段话,15 秒左右。找个安静的地方,就用你平时跟朋友聊天的语气说: -> -> "哎你猜怎么着,今天路上遇到一个超搞笑的事,就那个奶茶店你知道吧,门口排了好长的队,结果我一去发现今天闭店了,白走一趟!" -> -> 然后**再录一声自然的笑**——就"噗"一下笑出来那种,不用太夸张,3 秒就行。 -> -> 两条录音分开发我就行,谢谢! - ---- - -## 文件命名与交付 - -录好 / 截取好后,按这个格式命名,放到 `audio/00_raw/tts/prompt_ref/`: - -``` -mom_ref.wav -azhe_ref.wav -xiaomei_ref.wav ← 同时作为 self-3y 基底 -xiaomei_laugh_ref.wav ← 给 self-laugh 用 -zhounan_ref.wav -hr_ref.wav -anan_ref.wav -dorm_a_ref.wav -dorm_b_ref.wav -dorm_c_ref.wav -delivery_ref.wav -``` - -每条参考音频旁边配一个同名 `.txt` 记录对应文字内容(CosyVoice 克隆时需要): - -``` -mom_ref.txt → 写这段录音里说了什么字 -azhe_ref.txt → ... -``` - -**收齐这 10 条参考音频后,就可以开始 TTS 生产了。**