Files
blind/音色采集清单.md
T
2026-05-18 18:39:49 +08:00

8.9 KiB
Raw Blame History

《林夏》音色参考音频采集清单

CosyVoice「3s极速复刻」需要每个角色提供一段 5-20 秒的干净人声参考音频。 音色采集是整个音频生产的第一步也是最关键一步——TTS 的最终质量上限就是参考音频的质量。


采集规格(所有角色统一)

  • 时长:10-20 秒(太短克隆不稳,太长无意义)
  • 内容:说一段完整的中文,语速自然,情绪平稳
  • 录制要求:干声,无 BGM,无混响,无明显底噪
  • 格式:WAV 或 MP3 均可(后续统一转 16kHz WAV)
  • 如果是从视频/播客截取:用安静片段,避免多人同时说话的段落

需要采集的 11 条参考音频

1. mom — 妈妈

要求
性别/年龄 女,45-55 岁
音色关键词 温柔、不黏腻、略带沧桑、说话慢半拍
口音 普通话为主,可以有轻微西北口音(不强求)
情绪 平稳温和,不是那种激昂的或播音腔的
避免 太年轻、太甜、太播音、太严厉
找人方案 找一位 45-55 岁的阿姨录 15 秒日常说话(比如让她念:"今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭,路上慢点。")
截取方案 影视剧中温柔母亲角色的对白片段;中年女性生活 vlog
这个角色为什么重要 全片情感支柱。第 16 条 4 分 17 秒长戏是全片高潮,音色必须对

2. azhe — 阿哲(前任男友)

要求
性别/年龄 男,25-28 岁
音色关键词 城市感、干净、理性、偏冷、没有攻击性但也没有温度
口音 标准普通话,北京口音淡
情绪 像在跟同事说话——礼貌但已经抽离
避免 太温暖、太油腻、太沧桑、方言重
截取方案 年轻男性播客主播冷静讲述片段;商务/科技类 vlog 男声旁白
台词量 少,只有 2 条,但"第一刀"效果全靠音色的冷感

3. xiaomei — 小美(闺蜜)

要求
性别/年龄 女,23-25 岁
音色关键词 活泼、大大咧咧、语速偏快、北漂女孩感
口音 普通话,可以有点北方口语感("嘛""呗"之类自然)
情绪 参考音频录正常活泼状态即可(醉戏靠后期调)
避免 太嗲、太文静、太播音
找人方案 找一个 23-25 岁活泼的女生朋友,让她用"跟闺蜜聊天"的语气说段话
截取方案 年轻女性 vlog 日常聊天片段
附加说明 self-3y(3年前的林夏)复用这个音色做基底,所以这条参考音频同时决定两个角色

4. zhounan — 周南(初中同桌)

要求
性别/年龄 男,25-27 岁
音色关键词 温和、拘谨、不油腻、有点紧张感、二三线城市小镇青年气质
口音 普通话,稍带一点点不够标准的感觉(不是播音腔)
情绪 克制的,说话声音略轻,像怕打扰到别人
避免 太自信、太老成、太帅哥感、太粗犷
截取方案 文艺/读书类播客里说话温和的男生;纪录片中普通年轻男性受访者
这个角色为什么重要 全片"苦中一缕甜"。他的声音必须让人觉得"这个人很好但不会推销自己"

5. hr — HR 王姐

要求
性别/年龄 女,35-40 岁
音色关键词 知性、职业、温和但有距离感、像个靠谱的大姐
口音 标准普通话
情绪 公事公办但不冷漠,带一点点疲惫的善意
避免 太年轻、太甜、太严厉、太做作
截取方案 职场类播客女主播;新闻女主播(偏柔和那种,不是央视腔)
台词量 只有 1 条,但角色感很重要

6. anan — 室友安安

要求
性别/年龄 女,22-24 岁
音色关键词 可爱、嗲、兴奋、比小美更"甜"一档
口音 普通话
情绪 自顾自的快乐,不是故意撒娇而是天生就这样
避免 xiaomei 太像(必须能区分)
找人方案 找一个声线偏甜的女生朋友
截取方案 可爱类女性 UP 主日常 vlog
台词量 只有 1 条短语音

7-9. dorm-a / dorm-b / dorm-c — 寝室群三人

这三个角色同时出现在大学群聊里,必须互相能区分,也必须和小美/安安区分

角色 人设 音色方向 和谁不能像
dorm-a 升职那位,语速快,爱热闹 开朗外向,语速快,声线偏亮 不能像 xiaomei(小美比她更"野"
dorm-b 和事佬,温和 温柔日常,不突出,中间音色 不能像 anan(安安比她更嗲)
dorm-c @林夏的那个,偏冷静 偏沉稳,年轻女声里偏低的那种 不能像 hrHR 比她更成熟)

每人需要一条独立的参考音频。找 3 个不同声线的年轻女声。


10. delivery — 外卖小哥

要求
性别/年龄 男,28-32 岁
音色关键词 麻利、工作状态、不寒暄、北方普通话
口音 普通话 + 少许河南/河北腔(轻微就行)
情绪 中性,工作语气,不热情也不冷漠
避免 太文雅、太慢
截取方案 短视频里外卖小哥/快递员说话的片段
台词量 只有 1 句话

11. system — 系统 TTS

要求
方案 不需要采集参考音频,直接用 CosyVoice 内置预训练音色
音色方向 中性 AI 女声,清晰、无感情、类似 Siri 但更轻
操作 启动 WebUI 后在"预训练音色"模式里试听,选一个最合适的

不需要单独采集的

角色 原因
self-3y3年前的自己) 复用 xiaomei 的参考音频,合成时调速度
self-laugh(林夏的笑声) TTS 无法自然生成笑声。最佳方案:找 xiaomei 同一个人笑一声录下来。备选:后期合成
unknown(未知号码) 无台词,只有呼吸声,从音效库获取
system 用 CosyVoice 预训练音色,无需参考

汇总:你需要找到的人/素材

# 需求 优先级 最省事的方式
1 一位 45-55 岁女性说 15 秒话 最高 找妈妈/阿姨/同事的妈妈录一段
2 一位 25-28 岁冷感男声 10 秒 播客/有声书截取
3 一位 23-25 岁活泼女生说 15 秒话 最高 找朋友录(同时给 self-3y 用,再录一声笑给 self-laugh 用)
4 一位 25-27 岁温和男声 10 秒 播客/纪录片截取
5 一位 35-40 岁知性女声 10 秒 播客截取
6 一位 22-24 岁甜美女声 10 秒 找朋友录或 UP 主截取
7-9 3 位不同声线的年轻女声各 10 秒 可以从不同 UP 主截取
10 一位北方口音男性 10 秒 短视频截取

最少找 2 个真人录音(#1 妈妈 + #3 小美/林夏),其余都可以截取。


录音指导话术(发给帮忙录音的人)

给"妈妈"录音的人:

帮个忙,用手机录一段话,15-20 秒就行。找个安静的地方,用你平时说话的语气念:

"今天天气不错,妈妈给你做了红烧排骨,等你回来吃饭。路上慢点,别着急。对了,你上次说的那个同事后来怎么样了?没事就算了,妈妈就是随便问问。"

不用播音腔,就像平时跟孩子打电话一样说就行。录完发我微信就好,谢谢!

给"小美/林夏"录音的人:

帮个忙,用手机录一段话,15 秒左右。找个安静的地方,就用你平时跟朋友聊天的语气说:

"哎你猜怎么着,今天路上遇到一个超搞笑的事,就那个奶茶店你知道吧,门口排了好长的队,结果我一去发现今天闭店了,白走一趟!"

然后再录一声自然的笑——就"噗"一下笑出来那种,不用太夸张,3 秒就行。

两条录音分开发我就行,谢谢!


文件命名与交付

录好 / 截取好后,按这个格式命名,放到 audio/00_raw/tts/prompt_ref/

mom_ref.wav
azhe_ref.wav
xiaomei_ref.wav       ← 同时作为 self-3y 基底
xiaomei_laugh_ref.wav ← 给 self-laugh 用
zhounan_ref.wav
hr_ref.wav
anan_ref.wav
dorm_a_ref.wav
dorm_b_ref.wav
dorm_c_ref.wav
delivery_ref.wav

每条参考音频旁边配一个同名 .txt 记录对应文字内容(CosyVoice 克隆时需要):

mom_ref.txt      → 写这段录音里说了什么字
azhe_ref.txt     → ...

收齐这 10 条参考音频后,就可以开始 TTS 生产了。