我的用词一直都挺克制的,基本不会用到“最强”这个字眼。
但是这一次的这个AI应用,是我认为在TTS(文字转音频)这个领域,当之无愧的“最强”。
ElevenLabs,简称11Labs。
仅需30秒到5分钟左右的极少的数据集,就可以直接克隆任何一个人的声音,完美复刻他的说话方式、他的音色,甚至连他的情绪都复刻过来。
最牛逼的是,你不需要再额外做任何操作,就可以直接用同样的声音,说出29国的语言。那个流畅度,那个口语表达。。。我在AI面前宛如一个废物。
11Labs网址在此(上不去就开魔法):
https://elevenlabs.io/
尽管很多的大厂的语音TTS能力已经很强大了,比如微软的TTS、比如国庆期间刷爆全网的GPT的语音TTS,但是这些大厂有一个问题,就是公司体量实在太大了,在商业化上的舆论影响和被监管风险也极大,所以这种超低成本的语音克隆TTS,他们至今也没有向大众公开,毕竟很容易受到全社会的伦理指责。
至于那些开源的TTS,说实话,效果都挺差强人意,比如Tortoise奇慢无比,比如bark下限和稳定性太差,都难堪大用。
大厂们公开的语音产品中,也没有一项能达到11Labs如此便宜且如此便捷的了。要知道,像微软的声音克隆成本高的可怕,数小时的数据集、几千几万块钱。而11Labs,只需要30秒到5分钟的音频,1个月只需要5美刀就可以畅快的使用了。效果还出奇的好。
毕竟在现在这个AI时代,AI语音已经成了最为重要的环节之一。内容全球化翻译、智能配音、数字人与机器人等,都有超强的应用。换句话说,没有强TTS在背后支持,那些视频和数字人,各个都是恐怖谷效应拉满假到不行的哑巴。
而11Lbas的使用上,更是突出一个简单和有手就行。
先准备30秒到5分钟的音频文件,不需要超过5分钟,对质量几乎没有任何意义了。你可以多个音频文件,但是每个不要超过10M。这块一定要注意,数据集的质量跟你后面生成的质量息息相关,里面不要有任何杂音,越干净、越纯粹越好。
上面那个例子,我就去B站扒了点特朗普的演讲视频,然后剪映剪了下,准备了大概4分钟的特朗普的干声数据集,切成了11段。
然后进入11Labs的主页,登录后进入这个VoiceLab的页面。这个页面就可以去做声音的克隆了。那个大大的加号就是新建一个声音。
在弹窗中,第二个选项就是声音克隆。
不过这个功能是付费功能,正常付个费就可以用了。首月优惠1美刀,基本就是白给,可以直接绑定中国境内的VISA就可以支付,比ChatGPT的付费方便多了。
在打开的弹窗上随便输个姓名,把数据集拖进去就行。标签和描述啥的不用填。然后确认。记得一定不要开任何翻译,比如google翻译啥的,要不然会报错。
大概只需要二十几秒钟吧,模型就OK了,速度出奇的快。你就可以直接点Use去使用。
这里再推荐大家几个TTS的小技巧,善用标点符号去引导情绪。
比如这句话:I am Trump . my other name is "Chuan Jian guo".
把my other name is "Chuan Jian guo"这句话,变成my other name... is "Chuan Jian guo"后,你就能明显听出小停顿的情绪,
如果再把I am Trump后面加三个感叹号,变成I am Trump!!!的话:
这情绪一下就激动了起来。。。
11Labs对这些标点符号的引导非常到位,善用标点符号,能给这段文字带来完整的情绪感受。
在最后,说一下目前AI声音的几种技术和场景吧。
SVC,类似于变声器。将一段音频转换成另一种特定的音色,音频to音频,我也写过一篇教程:用SVC做特定人物AI配音 - 你奶奶都会的AI声音教程 ,成本挺高的,数十分钟的干声数据集,训练几个小时起步,但是对情绪和音调的还原最好,适合用在剧集配音、歌声转换等场景。不过这块11Labs已经明确要进军了,做语音转换,不知道后面用户的使用成本会拉低到什么地步。
TTS - 声音克隆。将特定的人声训练成模型,然后文字转音频。用于需要特定某个人声的场景、或同声翻译等等,数字人应用的很广泛。成本低,但是对于情绪的变化肯定没有SVC那么强,毕竟几分钟数据集+几乎为0的等待时间,11Labs是典型的王者。
普通TTS。用平台已经训练好的声音做配音,不可自定义,在有声书和视频配音里已经被广泛应用。这块的产品就非常多了,国外的微软TTS、11Labs,国内的魔音工坊等等。
基本就这三种了,SVC和TTS我也写过好多教程了,大家可以根据自己的场景,各取所需。