Files
blind/docs/旁白音色提示词.md
T
xsl 866f363591 项目整理:重写主文档、归档过时文档、清理死代码、新增音频制作手册
文档整理:
- 重写 game/操作说明.md 为项目主文档(6游戏/6手势/旁白/模型生成音频/TTS两步流程)
- 归档过时文档至 other_docs/(林夏原始设计、旧执行文档)
- 新增 docs/音频制作执行手册.md(从零制作游戏音频的完整流程)
- docs/ 下保留旁白音色提示词、音频脚本

代码清理:
- 删除旧架构死代码: story.js / gestures.js / profile.js
- 删除耦合旧架构的过时测试目录 game/tests/

脚本配置修正:
- check_tts_env.sh: 启动脚本路径 AutoVideo → tts-server(实际位置)
- gen_narrator_samples.py: 硬编码地址改为环境变量,默认对齐 tts-server 端口 8000
2026-06-19 22:29:04 +08:00

22 KiB
Raw Blame History

盲游 · 旁白音色提示词文档

本文档为六个游戏旁白的音色定向文件。
用途:根据此文档寻找参考音频,或向 TTS 模型输入提示词,生成样本后人工筛选。
每个游戏的旁白声音独立,风格、质感、情绪基调均不同。


通用技术要求

生成的样本音频需满足:

  • 格式:WAV,16kHz,单声道(作为参考音色注册用)
  • 最终产出:MP344100Hz,单声道,128kbps-18 LUFS
  • 首尾静音:开头 100ms,结尾 200ms
  • 无背景音乐,无混响(干声)

一、《林夏》旁白 — 纪录片叙述者

角色定位

她是一个旁观者,不是林夏本人,也不是林夏的朋友。她只是在记录。她知道今晚发生了什么,但她不评价,不安慰,不引导。像一部安静的纪录片里的解说词。

声音特征

维度 描述
性别 女声
年龄感 30-38岁
音色底质 中低女声,有一点点气声,但不是耳语。清晰,不尖锐
共鸣位置 胸腔共鸣为主,不是头声
语速 慢,比正常对话语速慢约15%。每个短句之间有自然停顿
音调 标准普通话音调,不夸张,没有朗诵腔
气息 平稳,每句话起头不会有明显换气声

情感基调

克制的悲悯。她知道林夏今晚过得不容易,但她不会在语气上表现出来。那种情绪藏在语速和停顿里,不在音调变化里。

不该有的感觉:同情、叹息、戏剧性、新闻播报腔、心理咨询语气。

TTS 提示词(英文,适用于支持风格描述的模型)

Voice: Adult Chinese female, 30-38 years old. Documentary narrator style.
Tone: Calm, observational, restrained compassion. Never dramatic.
Delivery: Slow pace (85% of normal speed), natural pauses between clauses.
Timbre: Mid-low register, slight chest resonance, not breathy, not sharp.
Emotion: Neutral on the surface, with a barely perceptible weight underneath.
Language: Standard Mandarin Chinese, no regional accent, no theatrical intonation.
Do NOT sound like: news anchor, audiobook reader, customer service, therapist.
Reference: Like a quiet documentary about ordinary people, late at night.

TTS 提示词(中文)

声音风格:中国女性旁白,年龄感在三十岁出头。纪录片叙述者风格。
语气:平静、观察性的,有克制的悲悯,但绝不戏剧化。
语速:慢,约正常语速的85%,句与句之间有自然停顿。
音色:中低女声,以胸腔共鸣为主,略有气声但不是耳语,吐字清晰。
情感:表面中性,但语速和停顿里带着一点重量。
语言:标准普通话,无地方口音,无朗诵腔。
不要像:新闻主播、有声书朗读、客服提示音、心理咨询师。
参考感受:像一部关于普通人日常的安静纪录片,深夜播出。

样例句子及朗读标注

「晚上九点零三分。手机震动,铃声响起。屏幕显示:妈妈。」

朗读提示:
- 「晚上九点零三分。」— 陈述,轻,后面停顿约 0.5 秒
- 「手机震动,铃声响起。」— 音量略低,描述动作,不强调
- 「屏幕显示:」— 停顿,然后
- 「妈妈。」— 非常平,两个字,不带任何情感色彩
「铃声响了又停。妈妈没再打来。」

朗读提示:
- 整句语速偏慢,结尾「没再打来」后留出3秒的静默感
- 不要读出遗憾或心疼,只是陈述事实

二、《一念》旁白 — 内心独白

角色定位

她就是你自己。不是外部的声音,是你坐在黑暗里,自己在心里说话的声音。像半梦半醒之间,对自己说的那些不会说出口的话。

声音特征

维度 描述
性别 女声
年龄感 25-32岁
音色底质 略有气声,不是正常说话声而是「心里的声音」。比林夏更柔,更近
共鸣位置 偏向头腔和鼻腔,不是胸腔
语速 很慢,约正常语速的80%,每个词之间都有微小的停顿,像在慢慢想
音调 比标准说话略低半个音阶,平稳,很少起伏
气息 有轻微的气声底色,每句开头偶尔有一点呼气感,但不是叹气
距离感 非常近,像贴着耳朵说话,但不是低吼,是轻而有质感

情感基调

亲密与重量。这个声音不是在讲述,是在陪伴。她知道你在想什么,她不急着说完,每一句都给你留足了空间去感受。

不该有的感觉:治愈系播客腔、催眠音频的夸张柔和、冥想引导语气。

TTS 提示词(英文)

Voice: Chinese female, 25-32 years old. Inner monologue, the voice inside your own head.
Tone: Intimate, slow, weighted. Like whispering to yourself in the dark.
Delivery: Very slow (80% speed), micro-pauses between phrases, thoughtful cadence.
Timbre: Slightly breathy, soft head resonance, close and present — not distant.
Emotion: Quiet tenderness, not sad but carrying weight. Like someone who knows.
Distance: Very close mic presence, like speaking directly into the listener's ear.
Do NOT sound like: meditation app, ASMR, therapy podcast, bedtime story reader.
Reference: The internal voice you hear when reading something that moved you deeply.

TTS 提示词(中文)

声音风格:中国女性,年龄感25-32岁。内心独白,就是你自己脑海中的声音。
语气:亲密、缓慢、有重量。像在黑暗中对自己说话。
语速:很慢,约正常语速的80%,词与词之间有细小停顿,像在慢慢思考。
音色:略有气声,偏头腔共鸣,声音贴近,不是从远处传来的。
情感:安静的温柔,不悲伤但有分量,像一个懂你的人。
距离感:非常近,像直接说在耳边,但不是低吼。
不要像:冥想App引导词、ASMR、心理播客、睡眠故事。
参考感受:读一本让你动容的书时,脑海中浮现的那个声音。

样例句子及朗读标注

「你坐在黑暗里,独自一人。今晚你必须做一个决定——你自己知道是什么。」

朗读提示:
- 「你坐在黑暗里,」— 极轻,像呼气
- 「独自一人。」— 停顿感,留白约 0.8 秒
- 「今晚你必须做一个决定——」— 稍慢,破折号处停顿约 1 秒
- 「你自己知道是什么。」— 最轻,几乎是说给自己听的
「你在黑暗里,说了那句对不起。没有人听见,但你说了。有什么东西松开了。」

朗读提示:
- 「有什么东西松开了。」— 这是最重要的一句,但要说得最轻,
  像呼出一口气,结尾略微延长「了」的尾音

三、《守夜》旁白 — 对讲机留言

角色定位

他是一个老保安,在你入职之前就在这栋楼里工作了很多年。他提前录好了这些提示音,放在对讲机系统里,帮助新来的保安在夜班时做判断。他见过很多事,不大惊小怪,但他认真负责。

声音特征

维度 描述
性别 男声
年龄感 45-55岁
音色底质 中低男声,略带沙哑,像抽了很多年烟但已经戒了。不是醇厚的磁性男声,是有点磨损的质感
共鸣位置 以胸腔为主,厚实但不夸张
语速 接近正常,约90%语速,但字与字之间咬字清楚,不含糊
音调 标准偏低,不高亢,像在做记录而不是在讲故事
录音质感 可以有轻微的对讲机感(略带中频突出),但要保持清晰
气息 平稳,带一点疲惫,但是那种习惯了疲惫的人,不是撑不住的那种

情感基调

实务与温和。他的语气像在交接班,说清楚情况,给你判断,但他不会给你施压。他见过太多了,什么情况他都经历过,所以他的语气里有一种稳定的疲惫,不是焦虑的那种疲惫。

不该有的感觉:权威、命令、惊慌、新闻播报腔、机械警报感。

TTS 提示词(英文)

Voice: Middle-aged Chinese male, 45-55 years old. Pre-recorded walkie-talkie message.
Tone: Matter-of-fact, mildly tired, steady. Like a veteran security guard giving handover notes.
Delivery: Near-normal pace (90% speed), clear diction, slight deliberateness.
Timbre: Mid-low male voice, slightly gravelly/worn texture, chest resonance dominant.
Emotion: Calm fatigue. Not stressed, not urgent. Seen it all before.
Audio texture: Slight mid-frequency presence (like walkie-talkie), but still clear.
Do NOT sound like: military commander, news anchor, emergency alert, thriller narrator.
Reference: An experienced night-shift worker leaving a recorded message for the next shift.

TTS 提示词(中文)

声音风格:中年中国男性,年龄感45-55岁。预录的对讲机提示音。
语气:实务、略带疲惫、稳定。像一个经验丰富的保安在交班时留下的提示。
语速:接近正常,约90%,吐字清楚,有一点郑重但不沉重。
音色:中低男声,略带沙哑/磨损感,以胸腔共鸣为主。
情感:平静的疲惫。不紧张,不急迫,什么都见过了。
音频质感:轻微的中频突出(对讲机感),但保持清晰可辨。
不要像:军事指挥官、新闻主播、紧急广播、惊悚片旁白。
参考感受:一个在这栋楼工作了二十年的老保安,录了一批提示音留给新来的年轻人。

样例句子及朗读标注

「凌晨零点十分。地下室传来水声,不大,但是持续的,一直在响。」

朗读提示:
- 「凌晨零点十分。」— 像在说时间记录,平,有点像报时
- 「地下室传来水声,」— 陈述,不强调
- 「不大,」— 略停,「但是」
- 「持续的,一直在响。」— 这三个字是关键信息,稍重,但不夸张
「五点整。接班的人进来了,你们交接了几句,递了记录本,你背上包走出去。外面已经有一点点亮了。」

朗读提示:
- 前半部分正常陈述
- 「外面已经有一点点亮了。」— 这里语气应该有一丝松动,
  不是高兴,是那种熬完一夜之后的轻,但他说的时候还是很平

四、《候诊》旁白 — 时间本身

角色定位

这个声音没有性格,没有情绪,没有立场。它就是时间在说话。精确,中性,像一个永远不会犯错的计时器,或者一个医院里的叫号系统升级版。它不在意你的感受,它只在意事实。

声音特征

维度 描述
性别 女声或男声均可,推荐女声(更贴近中性)
年龄感 难以判断年龄,像是AI生成的那种无年龄感
音色底质 非常干净,没有气声,没有磨损,没有个人质感。标准播音腔,但去掉情感成分
共鸣位置 中性共鸣,不特别强调胸腔或头腔
语速 接近正常,约95%,每个数字、每个名词都精确清晰
音调 几乎完全平,句末不做语气下沉或上扬
气息 完全平稳,机械般的平稳

情感基调

零情感,精确。不冷漠(冷漠也是一种情感),就是没有情感。像GPS语音导航,但更安静,更精准,没有任何「友好感」。

不该有的感觉:温暖、关怀、急迫、权威感、新闻感、AI助手的那种刻意亲切。

TTS 提示词(英文)

Voice: Chinese female (preferred) or male, genderless age quality.
Tone: Completely neutral. Zero emotion. Not cold — simply emotionless.
Delivery: Near-normal pace (95%), extremely precise diction, especially for numbers and names.
Timbre: Clean, no breathiness, no texture, no warmth — pure phonation.
Emotion: None. This is time itself speaking. It does not care.
Intonation: Nearly flat. Minimal sentence-final variation.
Do NOT sound like: friendly AI assistant, GPS voice, news anchor, customer service bot.
Reference: A hospital queue number system, but more articulate and slower.

TTS 提示词(中文)

声音风格:中国女声(推荐)或男声,无年龄感。
语气:完全中性。零情感。不是冷漠,而是没有情感这件事本身。
语速:接近正常,约95%,数字和名词发音极其精确清晰。
音色:干净,无气声,无质感,无温度——纯粹的发声。
情感:无。这是时间本身在说话,它不在乎任何人。
语调:近乎完全平,句末几乎没有语调变化。
不要像:友好的AI助手、GPS导航语音、新闻主播、客服机器人的刻意亲切。
参考感受:医院的叫号系统,但更清晰,更慢,句子更长。

样例句子及朗读标注

「叫号机叫到了八十五号。你的号是九十四。等待的时间被切成了一小块一小块的,每一块都很结实。」

朗读提示:
- 「叫号机叫到了八十五号。」— 像读数据
- 「你的号是九十四。」— 完全平,不带任何「所以你还要等」的暗示
- 后面的描述性句子:同样平,但语速可以微微放慢,因为句子更长
- 整句没有任何起伏,连「结实」也不强调
「九十四号。是你。你站起来,整理了一下衣服,走向那扇门。」

朗读提示:
- 「九十四号。」— 像报号,平
- 「是你。」— 两个字,无任何情感,不是「终于是你了」,只是确认
- 后面的动作描述:陈述,像摄像头记录下的画面

五、《遗声》旁白 — 手机系统语音

角色定位

她是这部手机的语音助手,被主人调教过,用来播报录音元数据。她有一点点温度,但本质上还是机器——她不知道这些录音是什么内容,她只负责读出文件信息。如果说《候诊》的旁白是零温度,她大约是温度计刚刚能感应到体温的那一格。

声音特征

维度 描述
性别 女声
年龄感 25-30岁的感觉,但带一点点机械感
音色底质 偏年轻的女声,咬字非常清晰,字字分明,但没有过度的感情投入
共鸣位置 偏头腔,亮而清晰
语速 约92%正常语速,读数字和文件名时会自然地慢下来一点
音调 略高于标准说话音调,但只高一点点
气息 完全清晰,无气声,像数字合成人声
节奏感 元数据的各个部分之间有固定的小停顿,像在读表格

情感基调

冷静、有礼、略机械。她不是真的无情,但她的情感是预设的,是「礼貌」这个程序的一部分,而不是真正感受到了什么。像一个很专业的前台,完全不会失礼,但你知道她下班之后不会想起你。

不该有的感觉:人类的共情感、悲伤(即使读到沉重的文件名也不会)、夸张的热情、恶意的冷漠。

TTS 提示词(英文)

Voice: Young Chinese female, 25-30 years old. Phone voice assistant style.
Tone: Calm, polite, slightly mechanical — but with a tiny hint of warmth (not cold, not human).
Delivery: 92% speed, very precise diction, slight deliberate pauses between metadata fields.
Timbre: Bright head resonance, clean, no breathiness — digital synthesis quality.
Emotion: Programmed politeness. Not sad reading sad file names. Not happy reading happy ones.
Rhythm: Consistent, like reading a form — date, duration, filename as separate units.
Do NOT sound like: warm human narrator, empathetic counselor, cold robot, customer service.
Reference: Apple's Siri or a refined voice assistant, but quieter and slower.

TTS 提示词(中文)

声音风格:年轻中国女性,年龄感25-30岁。手机语音助手风格。
语气:冷静、有礼、轻微的机械感——有一点点温度,但不是人类的温度。
语速:约92%,咬字极其清晰,元数据各字段之间有固定小停顿。
音色:偏头腔共鸣,明亮清晰,无气声——接近数字合成人声的质感。
情感:程序化的礼貌。读到沉重的文件名不会悲伤,读到轻松的也不会高兴。
节奏:稳定,像在读表格——日期、时长、文件名分别是独立的信息单元。
不要像:温暖的人类旁白、有共情的叙述者、冷酷的机器、客服话务员。
参考感受:Apple Siri或精调后的语音助手,但更安静、更慢。

样例句子及朗读标注

「第一条录音。录制时间:三月五日,早上八点。时长:二十二秒。文件名:买橙子。」

朗读提示:
- 「第一条录音。」— 轻,像索引号
- 「录制时间:」— 停顿,然后读出日期,日期之后停顿
- 「三月五日,早上八点。」— 数字精确,停顿
- 「时长:」— 同样格式
- 「二十二秒。」— 精确,停顿
- 「文件名:」— 停顿
- 「买橙子。」— 读文件名时没有任何情感色彩,就算是再奇怪的文件名也一样平

六、《浮》旁白 — 梦里的声音

角色定位

这个声音几乎不存在。它是梦里的,不知道从哪里来,没有身份,没有位置。它不是在"说话",是在"飘"。像你半睡半醒时听到的窗外风声,你以为自己听到了什么词,但你不确定。

声音特征

维度 描述
性别 女声
年龄感 难以判断,可能是任何年龄
音色底质 大量气声,几乎一半是气一半是声。不是正常的气声,是那种声音里大部分是呼吸的质感
共鸣位置 几乎没有共鸣,声音不集中,是「散」的
语速 很慢,约75%正常语速,某些词会自然地拖长
音调 比正常说话略低,非常平,起伏极小,像水面微微荡漾
气息 这个角色的声音本身就是气息。每句话开头都有轻微的吸气或呼气
空间感 有一点点远,像从很远的地方传来,或者像在一个大的空旷空间里
混响 可以有轻微的自然混响(不是KTV那种),像在一个大房间里或水边

情感基调

飘渺与悬浮。这个声音没有紧迫感,没有目的感,它只是在漂,说了什么它自己也不在意是否被听到。但每一句话都有它的重量,只是那个重量是用气息而不是用音量表现的。

不该有的感觉:ASMR(太刻意)、冥想引导(太有目的性)、鬼魂感(不是恐怖的)、梦境里的哲学大师。

TTS 提示词(英文)

Voice: Chinese female, age indeterminate. The voice of a dream — barely present.
Tone: Floating, weightless, present but not insistent. It does not need to be heard.
Delivery: Very slow (75% speed), some words naturally elongated, long pauses between sentences.
Timbre: High breathy ratio — the voice is mostly breath with a thin thread of tone.
Resonance: Minimal, diffuse — not focused, like sound in an open space or on water.
Emotion: Serene vacancy. Aware but not attached. Like mist.
Space: Slightly distant, with subtle natural reverb (not studio dry, not echoey).
Do NOT sound like: ASMR content creator, meditation guide, horror movie ghost, poetic sage.
Reference: The voice you think you hear right before falling asleep, uncertain if it was real.

TTS 提示词(中文)

声音风格:中国女性,无法判断年龄。梦里的声音,几乎不存在。
语气:漂浮、无重力、在场但不坚持。它不在意自己有没有被听到。
语速:很慢,约75%正常语速,某些词会自然地拖长,句与句之间停顿很长。
音色:气声比例极高——声音大部分是呼吸,带着一缕细细的音调。
共鸣:极少,声音是散的,不集中,像在开阔空间或水面上的声音。
情感:宁静的空洞。有意识但不执着,像雾。
空间感:略远,带轻微的自然混响(不是录音棚的干声,也不是大回声)。
不要像:ASMR创作者、冥想引导、恐怖片鬼声、诗意的哲学家。
参考感受:将睡未睡时,你以为听到了什么声音,但不确定是不是真的。

样例句子及朗读标注

「你漂浮在某处。不知道是水,还是梦,还是别的什么。声音会漂过来。」

朗读提示:
- 几乎每个逗号后都停顿 1 秒以上
- 「不知道是水,」— 语速拖长,「水」字尾音延长
- 「还是梦,」— 更轻,再延长
- 「还是别的什么。」— 最轻,像消失前的最后一丝声音
- 「声音会漂过来。」— 新的一句,但不重,像是在说梦话
「第一个。像夏天傍晚的风,带着草的气味,你说不清是哪年夏天的。它停在你身边了。」

朗读提示:
- 「第一个。」— 很轻,像梦里的报数
- 「像夏天傍晚的风,」— 语速极慢,「风」字略微拖长
- 「带着草的气味,」— 继续慢,像真的闻到了什么
- 「你说不清是哪年夏天的。」— 这句有一点感慨,但要控制,气声增加
- 「它停在你身边了。」— 最轻,最气声

附:音色对比速查表

游戏 关键词 最像 最不像
林夏 克制、观察、平静 深夜纪录片 心理咨询、有声书
一念 亲密、缓慢、有重量 你自己的内心声音 冥想App、ASMR
守夜 实务、疲惫、稳定 老同事交班提示 军事指挥、新闻主播
候诊 精确、中性、零情感 医院叫号系统 AI助手的亲切感
遗声 有礼、清晰、略机械 精调版Siri 温暖人类旁白
气声、飘渺、悬浮 将睡未睡时的幻听 ASMR创作者

样本评估标准

收到生成样本后,按以下维度打分(每项 1-5 分):

  1. 音色符合度 — 和提示词描述的质感是否匹配
  2. 情感准确度 — 情感基调是否正确(不多也不少)
  3. 语速节奏 — 是否有自然的停顿,不赶场
  4. 清晰度 — 中文吐字是否清晰,特别是数字、专有名词
  5. 辨识度 — 六个旁白之间是否有足够的声音差异

优先确保林夏(主游戏)和浮(风格最特殊)的样本质量。