VoiceStudio:开源本地语音工作室,3秒克隆声音、视频配音、有声书一条龙

工具推荐 1788515304更新

0

AI 语音这两年进步很快。一段文字能用很像真人的声音读出来,一段视频里的话也能翻译成别的语言重新说出来。

把文字变成声音,叫 语音合成 ,把声音变成文字,叫 语音识别 。

市面提供这两种服务的语音工具,大多是网页服务,注册账号、充值、上传素材,用完再下载。方便归方便,但素材要上传到别人的服务器, 想想总觉得不是很舒服。

现在有一个叫做 VoiceStudio 的开源项目,就是冲着这些别扭来的。它的思路,就是把语音能力,变成一个跑在你电脑上的软件。

VoiceStudio 是一个开源的桌面应用,装上之后,你的电脑就成了一间能处理声音的 本地工作室 。不需要账号,不需要 API 密钥, 没有订阅,也不按用量计费 ,联网服务只有你主动开启才会用到。

它能做什么?

语音克隆。做视频想要固定旁白声、又不想每次都自己录的人,多半会用到它。

克隆好的声音可以存进声音库,下次直接调用。不想克隆任何人,也可以设定性别、年龄、口音、音高等属性, 凭空定制一位发音人 ,比如一个播音腔或说书腔。

有了声音就能做内容。

视频配音。这是一个流程很长、也 很有代表性 的功能,先把原话转成文字,再翻译、用克隆声音重读,最后合成回视频输出 MP4。多个人说话时,它会先分清谁在什么时候说话,再给每个人分配不同的声音。

电子书也可以变有声书。导入 EPUB 或 PDF,导出的就是手机能放的 .m4b。

这些能力大多来自 现成的开源引擎 。VoiceStudio 把 16 个语音合成引擎和 11 个语音识别引擎集成到一个界面,可以在设置或模型目录里切换。

不同引擎也各有侧重,有的中文和方言表现好,有的速度快、有的适合低配电脑。

默认的那个,覆盖的语言最多, 官方口径 646 种 。

怎么装怎么用?

最方便的,可以到 GitHub Releases 页下载对应系统的安装包,macOS 是 DMG,Windows 是 MSI,Linux 是 AppImage,双击按提示装。

首次打开会自动准备环境并下载默认模型,这一步只做一次,以后再打开就能直接用。官方建议预留 10 GB 可用空间,模型和缓存都算在内。

硬件上,最低 8 GB 内存、4 GB 显存。显存 8 GB 或以下的显卡,会在语音识别时自动把合成模型挪到 CPU,没有独显也能 纯 CPU 跑 ,只是慢一些。推荐 16 GB 内存加 8 GB 以上显存,大致相当于 RTX 3060 这一档。还有 两个限制 :Intel 老款 Mac 无法本地运行引擎,Windows 的 AMD 显卡也只能用 CPU。

生成第一个克隆声音只需三步:打开语音克隆,放一段参考录音, 输入一句话,点生成 。第一次跑通,其余功能照同样思路操作就行。

不想装软件,可以用 Docker 跑官方镜像,或在 Google Colab 免费档用 T4 显卡 在浏览器里体验 。会编程的人还能把脚本指向本机的 OpenAI 兼容接口,或用 MCP 让 AI 工具调用这些能力。

效果方面,克隆效果和参考录音关系很大,干净近麦的声音更好。配音不理想时, 问题多半出在转写环节 ,换识别引擎或更干净的源音频更有效。

回到开头说的那几处别扭。

素材离开电脑,按量付费,声音还留在别人的平台上。VoiceStudio 做到的,就是把能力放回自己的电脑, 把引擎的选择权也留给自己 。它未必处处比商业服务省心,好在它开源,数据不出本机,更新的节奏也快。

如果只是偶尔用一次,网页服务依然方便。

若你把声音创作当长期的事,在意素材不出电脑、费用可控、能自己挑引擎,那 花一个下午把它装起来试一次 ,多半值得。

项目地址:https://github.com/debpalash/VoiceStudio