部分模型厂商声音克隆调研
简介
截止到 2026年7月10日,很多模型厂商都推出了实时全模态模型,该类型的模型基于 WebSocket 协议进行交互,对接到应用中后可以实时和大模型对话交互。
目前很多厂商的音色做的也很不错,但如果我们想要做基于个人音色的数字人形象的话,就需要用到“声音克隆”(又叫“声音复刻”)技术来克隆个人音色。
本文就是对部分厂商的声音克隆技术进行调研。
对比总结
以下是对比总结
| 厂商 | 阿里百炼平台 | 字节火山引擎 | |
|---|---|---|---|
| 声音复刻模型 | CosyVoice,MiniMax,Qwen-TTS | 声音复刻ICL | |
| 克隆方式 | 准备录音文件 ↓ 调用声音复刻接口 ↓ 调用语音合成接口 ↓ 调用Omni接口对话 | 开通音色槽位 ↓ 调用音色训练接口 ↓ 调用豆包接口对话 | |
| 门槛 | 上手简单,费用低 | 上手复杂,费用较高 | |
| 页面快速验证 | 阿里云百炼平台快速复刻,按量付费 | 火山引擎平台仅支持预付费模式,无法快速验证 | |
| 特色 | 惟妙惟肖,如闻其声 | 录制成本极低、秒级别完成模型复刻、低成本调优、高度还原、跨语种迁移 | |
| 音频格式 | WAV (16bit)、MP3、M4A | wav、mp3、ogg、m4a、aac、pcm | |
| 音频时长 | 推荐10~20秒,最长不得超过60秒 | 在开放环境下录制最短5s音频 | |
| 音频大小 | < 10 MB | < 10 MB | |
| 音频采样率 | ≥ 24 kHz | pcm 仅支持24k | |
| 音频内容 | 至少3秒连续清晰朗读 避免背景音乐、噪音或其他人声 | 5~10秒连续音频 尽量在安静环境下使用降噪麦克风进行录入 | |
| 支持语言 | 中、英、葡及其他外语 | 中、英、葡及其他外语 但端到端实时语音模型仅支持中、英 | |
| 训练时长 | 音频上传后,15秒左右完成模型复刻 | 音频上传后,秒级别完成模型复刻 | |
| 音色相似度 | 高 | 高 | |
| 情感还原度 | 较为机械 | 较好 | |
| 韵律自然度 | 较为自然 | 较紧凑 | |
| 费用 | 创建音色:CosyVoice(免费)、MiniMax(首次合成9.9元音色费)、Qwen-TTS(0.01元/个) 模型调用:按模型调用的 Token 用量计费+实时语音合成费用 注意:qwen-tts系列的模型将会在10月10日下线 | 创建音色:138元/个槽位 训练音色:声音复刻合成字符数 模型调用:按模型调用的Token用量计费+声音复刻合成字符数 |
语音内容:您好,欢迎致电客服中心,我是您的专属智慧助理小张,请问您有什么需要帮助的吗?
阿里百炼平台
准备
- 自定义音色音频文件:CosyVoice模型支持WAV (16bit)、MP3、M4A;MiniMax模型支持MP3、M4A、WAV;Qwen-TTS模型支持WAV (16bit)、MP3、M4A
服务费用说明: MiniMax模型训练完毕后、首次合成会扣除 9.9元 的音色解锁费用,音色固定无法再次训练,有效期一年 详情参考:免费配额与自动清理
创建音色
可直接参考官方 文档 ,根据最终使用的语音合成模型确定使用哪个声音复刻模型
若是对接端到端实时多模态模型(如qwen3.5-omni-flash-realtime),需要使用 qwen-voice-enrollment 模型,参考 文档
请求创建音色接口的时候,录好的音频需要使用URL进行传递,这里可以使用官方提供的对象存储,上传本地文件获取临时URL,使用限制如下:
- 文件与模型绑定:文件上传时必须指定模型名称,且该模型须与后续调用的模型一致,不同模型无法共享文件。
- 文件大小限制:接口上传文件大小不得超过1GB,超出限制将导致上传失败。此外,不同模型对输入文件大小有不同限制,超出限制将导致模型调用失败。
- 文件与主账号绑定:文件上传与模型调用所使用的 API Key 必须属于同一个阿里云主账号,且上传的文件仅限该主账号及其对应模型使用,无法被其他主账号或其他模型共享。
- 文件有效期限制:文件上传后有效期48小时,超时后文件将被自动清理,请确保在有效期内完成模型调用。
- 文件使用限制:文件一旦上传,不可查询、修改或下载,仅能通过URL参数在模型调用时使用。
- 文件上传限流:文件上传凭证接口的调用限流按照“阿里云主账号+模型”维度为100QPS,超出限流将导致请求失败。
创建音色后,音色列表只能通过接口查看,无法通过火山引擎的控制面板查看
使用自定义音色交互大模型
参考官方 文档 进行调用自定义音色
若是对接端到端实时多模态模型(如qwen3.5-omni-flash-realtime),可参考 文档
字节火山引擎
准备
- 开通音色槽位(默认为后付费音色)
- 开通声音复刻1.0或2.0(默认赠送20000字数)
- 自定义音色音频文件(支持:wav、mp3、ogg、m4a、aac、pcm,其中pcm仅支持24k,单通道)
服务费用说明: 音色训练时默认使用声音复刻2.0 的字符数,当音色训练完毕后、首次合成会扣除 138元 的槽位费,音色固定无法再次训练,有效期一年;而合成时也默认使用声音复刻2.0的字符数 计费详情参考:计费概述
训练自定义音色
根据 声音复刻API-V3 进行音色训练,根据接口返回的链接验证训练效果(注:1小时有效)
注意:确保验证训练效果后再执行后续的音色合成,否则一旦首次合成后音色固定无法再次调整
训练完成后记录该音色的 speaker_id 字段供后续使用
使用自定义音色交互大模型
由于我们是在端到端的实时语音大模型中使用,可参考 端到端实时语音大模型 Demo 进行交互
在 TTS 配置的 speaker 字段填写上方的音色 ID,model_ 设置为 2.2.0.0 即可使用该音色进行实时对话