F5-TTS-main:根据参考语音生成语音
整合包制作: 数字生命卡兹克
我不认识他,整合包来自群友分享。在此基础上做了界面负优化,把我不想看到的都删除了。
核心功能与用法
这可以理解为语音克隆。
使用方法:
- 上传一段示例语音(例如猪八戒的音色)。
- 输入一段文字(例如唐僧念的那段经文)。
- 生成结果: 得到用猪八戒的音色念唐僧经文的效果。
- 参考要求: 参考语音只需要 15 秒的范本即可。
版本优化说明
已精简界面,已删除不需要的模型。
原版功能挺多的(例如多人对话、悟空和八戒对话等),这些都删除了。
为什么删除?
就连简单的文本生成语音都是玩具级别,还谈什么多人对话?经测试,存在以下一系列问题:
- 有吞字现象
- 有不连贯现象
- 标点符号停顿过短(抢读)
如果想拿去商用,还是算了。只是玩具级别,发出来只是让大伙看看目前 AI 到了什么境界。


体积对比:
精简后的压缩包 4.3GB,原版大小 11GB。
评论 (0)