VOICE TIMBRE STUDIO
声线织造台
分类清晰的音色标签库,一键拼出角色声线。按年龄、性别、共鸣位置、质感、语速、性格挑选,或直接套用「猪八戒式 / 孙悟空式」等角色原型。存进档案库,整部片子里同一个角色声线就不会跑。
自由拼配 · 每行可单点或「随机」
🎙 生成的声线标签
在上面挑一挑,或点「🎲 全随机」/「角色原型」,标签会在这里实时拼好…
复制后贴到 故事连镜 → 镜头里的「选择音色」,或视频/TTS 工具的语音风格栏即可。
同一画面里两个人 · 先选组合
💡 两个同性别的声音,工具会强制在音高、共鸣、质感、语速、性格上拉开差距,确保观众一听就分得清谁是谁。
档案存在这台浏览器里(localStorage)。给每个角色存一条固定声线,写每一集时复制同一条,配音/AI 语音就能从头到尾保持同一个嗓子。
真人配音 · 你的电脑就是配音棚
○ 正在检测引擎…
这里用免费开源的本地引擎真实合成语音:不联网、不限量。
装好开机自启后什么都不用点:打开本页会自动唤醒引擎,约 1 分钟后上方自动变绿「已连接」。(首次使用或没装自启时,双击一次「启动引擎.bat」即可)
🧭 第一次来?三步开通 只需要操作一次
2解压到任意硬盘,双击「一键安装」——自动装好引擎并设置开机自启,装完当场就能用
3回到本页,等右上角变绿「● 引擎已连接」——开始配音
📅 以后每天:开电脑 → 打开本页 → 灯自动变绿 → 直接用。零操作、零费用、不限量,声音永远不离开你自己的电脑。
🗣 音色库 · 点选一个声音
🎚
克隆稳定度(觉得走调、飘、忽高忽低就往「稳」调)
走调多半是这三件事:① 温度太高 → 往「稳」调;② 参考原话跟录音对不上 → 必须一字不差,多一个字少一个字都会飘;③ 录音太短或有杂音 → 重录,安静环境 15—20 秒。
🎭 情绪玩法:情绪写进台词里——感叹号、省略号、语气词(哈/唉/哦)都会被演出来;同一句多生成几次,挑情绪最到位的存仓库。
⚠️ 克隆须知:仅可克隆你本人的声音,或已取得本人授权的声音;请勿克隆名人或他人声音,由此产生的责任由使用者自行承担。
🎙 试音台 · 写台词,让它开口
生成中…
生成的语音可直接下载 WAV,拖进追光剪辑台就能上轨。长文会按比例增加生成时间,建议一段一段配。
🗄 语音仓库
每次生成自动存入仓库,刷新、关机都不丢。✏ 就地改名;🎬 一键发送到追光剪辑台素材库(打开剪辑台自动收到);⬇ 下载;✕ 删除。
本功能由开源项目驱动:audio.cpp · Qwen3-TTS(Apache 2.0)
🎧 成品音色库 · 点着听,挑中就发走
296 条音色样本,已切分调平,并按声学特征自动分好类。点卡片试听;挑中的发到剪辑台直接剪,或存进资产库。写剧本要指定声线时,点「📋 编号」把编号写进角色设定。
翻译配音 · 让你的声音说外语
○ 正在检测引擎…
把一整段中文语音变成同样长度的英文配音,用的还是你自己的嗓音。全程在你电脑本地完成,免费无限量。
打开本页会自动唤醒引擎,无需任何操作;灯不绿时也可手动点下面的按钮。
🧭 第一次来?三步开通 只需要操作一次
2解压到任意硬盘,双击「一键安装」——自动装好引擎并设置开机自启,装完当场就能用
3回到本页,等右上角变绿「● 引擎已连接」——开始配音
📅 以后每天:开电脑 → 打开本页 → 灯自动变绿 → 直接用。零操作、零费用、不限量,声音永远不离开你自己的电脑。
1 选择音频,分段听写
自动按停顿切段、逐段听写、剪 12 秒做你的声音克隆参考。建议先用几分钟的短音频试效果。
2 翻译
推荐自动翻译:全程本地、免费。(首次需装 Ollama + Qwen3-4B 模型,见开通教程;没装也可用手动方式:复制指令粘给 Claude/GPT,把回复的 JSON 粘回下面解析)
3 配音 + 拼装成品
逐段合成外语,按原时间轴拼装,成品总长与原音频一致。段数多时需要一些时间,别关页面。
Powered by audio.cpp · Qwen3-ASR · Qwen3-TTS(Apache 2.0)· 仅可克隆本人或已授权的声音
这个工具是什么
声线织造台生成的是音色标签——一段描述"这个人听起来是什么样"的结构化文字,贴进支持音色描述的配音模型里,让同一个角色在不同段落、不同天生成出来的声音保持一致。
为什么需要它:多数配音模型每次生成都会在音色上漂移,尤其是一集里换了台词、换了情绪之后。解决办法是把音色描述写得足够具体并且每次一字不改地复用。凭记忆手写做不到一字不改,所以做成了工具。
标签里写了什么
不是"温柔女声"这种粗颗粒,而是拆到发音部位级别:
- 音区与共鸣:胸腔 / 口腔 / 鼻腔的比例,决定声音的厚薄
- 气声比例:气多声少是耳语感,声多气少是播音腔
- 语速与停顿:字距、句尾拖长与否
- 咬字习惯:爆破音是硬还是软、齿音重不重
- 情绪底色:这是角色的常态,不是这一句的情绪
双人同性别怎么区分
两个女角色对话,最容易糊成一个人。这个工具专门做了区分逻辑:给两个角色分配互不重叠的音区和气声区间——比如 A 偏胸腔、语速慢、句尾下沉,B 偏口腔、气声多、句尾上扬。这样即使音高接近,听感上也能分开。点「角色原型」可以直接取一组已经拉开距离的组合。
什么时候别用它
如果你手上有真人录音样本,走声音克隆比写标签准得多,这个页面就没必要用。另外,音色标签控制的是"听起来像谁",控制不了"这句话念得对不对"——重音念错、断句念错,要靠在台词里加标点和换行来调,不是改音色标签能解决的。
和站内其他工具怎么配合
- 提示词生成器的故事连镜模式里有「音色|」那一行,把这里生成的标签贴进去,整条故事线的角色声音就锁住了。
- 网红日更工坊生成的口播提示词自带音色位,可以替换成你自己的标签。
- 配好的音频进追光剪辑台和画面对轴;剪辑台自带字幕识别和字幕配音,可以反过来用字幕生成配音轨。
音色标签为什么要写到发音部位
「低沉磁性的男声」这种描述,十个模型能给你十种声音,因为它不包含任何可测量的信息。真正能锁住音色的是发音位置和共鸣腔:声音是从胸腔出来的还是从鼻腔出来的,气息是贴着声带走还是漏出来一部分,齿音重不重,句尾是收紧还是放开。
这些特征即使换了模型、换了平台,也大体能对得上,因为它们描述的是物理产生方式,而不是听感印象。标签写得越靠近发音机制,跨平台的一致性越好。
旁白、对白和自言自语要分开写
- 对白是说给场景里另一个人听的,有明确的对象感,音量和语速跟着情绪走,句子之间有呼吸和停顿。
- 自言自语是说给自己听的,音量低、气声比例高、句子更碎,常常没说完就停了。加一点点近场混响会更像「在脑子里」。
- 旁白是说给观众听的,位置最「近」,几乎没有环境混响,语速稳定,情绪克制。旁白一旦带上了环境混响,观众会以为说话的人就在场景里。
同一个角色在这三种状态下应该共用同一套音色标签,只改状态描述——这样听起来才是同一个人的不同说话方式,而不是三个人。