什么样的录音更适合声音克隆
上传的 MP3 或 WAV 必须在 5–30 秒之间,且不超过 5MB。5 秒可以使用,但信息比较少;对大多数人来说,一段自然、连贯的 15–25 秒录音更容易保留平时的节奏和发音。尽量只录一个人的普通说话声,麦克风距离保持稳定,避开音乐、电视、明显回声、重度降噪、大喊和耳语。这里也不建议上传歌声:唱歌场景只适用于供应商支持的内置声音,不适用于克隆声音。
录制或上传一段 5–30 秒的干净语音,声音必须属于你本人,或已经获得说话人的明确许可。登录并确认授权后,输入文字即可生成并下载克隆语音。
1. 准备干净样本
上传 MP3/WAV 或在线录制 5–30 秒,文件不超过 5MB。
2. 确认声音授权
只使用本人声音,或已经获得明确克隆许可的声音。
3. 生成并下载
输入文字,设置语速和场景,生成后试听并下载。
文字转语音工作室
供应商密钥只保留在服务端
上传的 MP3 或 WAV 必须在 5–30 秒之间,且不超过 5MB。5 秒可以使用,但信息比较少;对大多数人来说,一段自然、连贯的 15–25 秒录音更容易保留平时的节奏和发音。尽量只录一个人的普通说话声,麦克风距离保持稳定,避开音乐、电视、明显回声、重度降噪、大喊和耳语。这里也不建议上传歌声:唱歌场景只适用于供应商支持的内置声音,不适用于克隆声音。
注册或登录后,本页会直接打开克隆声音面板。你可以上传文件,也可以在浏览器里现场录制。先回放样本,确认没有杂音或其他人的声音,再选择合适场景,并勾选本人或已获授权声明。接着输入需要朗读的文字,调整语速,选择 MP3 或 WAV。生成完成后先在播放器里听一遍,再下载真实返回的文件。如果供应商请求失败,页面不会给出伪造的下载,也不会把失败任务当成已完成结果。
安静的房间里,一部手机就能录出不错的参考声音。麦克风离嘴大约一掌远并稍微偏向侧面,可以减少呼吸和爆破音。样本文字最好像正常说话,包含不同长短的词、一个短停顿和一个问句,不要整段都是数字或人名。上传前戴耳机听一遍。如果能听见电视、风扇、另一位说话人、削波破音或空房间的回声,先重新录制;一段更干净的源声音,通常比反复修改生成参数更有用。
声音克隆请求经过应用服务器,因此语音供应商的 API 密钥不会进入浏览器。参考录音只用于当前克隆请求,并和原始文字一样从保存的任务日志中省略。生成结果可以在配置的保留期内出现在登录账户的历史记录中,方便再次播放或下载。这样的设计减少了不必要的源录音保存,但你仍然不应上传敏感对话,也不要上传自己无权使用的声音。
只能克隆自己的声音,或说话人已经清楚同意用于声音克隆的声音。公开视频、社交媒体片段、采访和播客并不自动等于授权。禁止将克隆声音用于名人模仿、诈骗、冒充、骚扰、虚假信息、社会工程或绕过语音验证。如果听众可能把合成内容误认为真人发言,应当主动说明;为客户或团队制作时,也建议保留授权记录。更完整的边界和举报方式可以查看声音使用政策。
相关工具
可以先比较内置声音,返回通用文字转语音工作台,使用免费 MP3 体验,或用 WAV 保留可编辑的源文件。
这里说明样本时长、文件大小、免费积分、下载格式、登录要求和授权边界。