首页 博文 分类 关于
AstroBlog
实时语音

部分模型厂商声音克隆调研

#声音克隆 #全模态

简介

截止到 2026年7月10日,很多模型厂商都推出了实时全模态模型,该类型的模型基于 WebSocket 协议进行交互,对接到应用中后可以实时和大模型对话交互。

目前很多厂商的音色做的也很不错,但如果我们想要做基于个人音色的数字人形象的话,就需要用到“声音克隆”(又叫“声音复刻”)技术来克隆个人音色。

本文就是对部分厂商的声音克隆技术进行调研。

对比总结

以下是对比总结

厂商阿里百炼平台字节火山引擎
声音复刻模型CosyVoice,MiniMax,Qwen-TTS声音复刻ICL
克隆方式准备录音文件

调用声音复刻接口

调用语音合成接口

调用Omni接口对话
开通音色槽位

调用音色训练接口

调用豆包接口对话
门槛上手简单,费用低上手复杂,费用较高
页面快速验证阿里云百炼平台快速复刻,按量付费火山引擎平台仅支持预付费模式,无法快速验证
特色惟妙惟肖,如闻其声录制成本极低、秒级别完成模型复刻、低成本调优、高度还原、跨语种迁移
音频格式WAV (16bit)、MP3、M4Awav、mp3、ogg、m4a、aac、pcm
音频时长推荐10~20秒,最长不得超过60秒在开放环境下录制最短5s音频
音频大小< 10 MB< 10 MB
音频采样率≥ 24 kHzpcm 仅支持24k
音频内容至少3秒连续清晰朗读
避免背景音乐、噪音或其他人声
5~10秒连续音频
尽量在安静环境下使用降噪麦克风进行录入
支持语言中、英、葡及其他外语中、英、葡及其他外语
但端到端实时语音模型仅支持中、英
训练时长音频上传后,15秒左右完成模型复刻音频上传后,秒级别完成模型复刻
音色相似度
情感还原度较为机械较好
韵律自然度较为自然较紧凑
费用创建音色:CosyVoice(免费)、MiniMax(首次合成9.9元音色费)、Qwen-TTS(0.01元/个)
模型调用:按模型调用的 Token 用量计费+实时语音合成费用
注意:qwen-tts系列的模型将会在10月10日下线
创建音色:138元/个槽位
训练音色:声音复刻合成字符数
模型调用:按模型调用的Token用量计费+声音复刻合成字符数

语音内容:您好,欢迎致电客服中心,我是您的专属智慧助理小张,请问您有什么需要帮助的吗?

阿里百炼平台

准备

  • 自定义音色音频文件:CosyVoice模型支持WAV (16bit)、MP3、M4A;MiniMax模型支持MP3、M4A、WAV;Qwen-TTS模型支持WAV (16bit)、MP3、M4A

服务费用说明: MiniMax模型训练完毕后、首次合成会扣除 9.9元 的音色解锁费用,音色固定无法再次训练,有效期一年 详情参考:免费配额与自动清理

创建音色

可直接参考官方 文档 ,根据最终使用的语音合成模型确定使用哪个声音复刻模型 若是对接端到端实时多模态模型(如qwen3.5-omni-flash-realtime),需要使用 qwen-voice-enrollment 模型,参考 文档

请求创建音色接口的时候,录好的音频需要使用URL进行传递,这里可以使用官方提供的对象存储,上传本地文件获取临时URL,使用限制如下:

  • 文件与模型绑定:文件上传时必须指定模型名称,且该模型须与后续调用的模型一致,不同模型无法共享文件。
  • 文件大小限制:接口上传文件大小不得超过1GB,超出限制将导致上传失败。此外,不同模型对输入文件大小有不同限制,超出限制将导致模型调用失败。
  • 文件与主账号绑定:文件上传与模型调用所使用的 API Key 必须属于同一个阿里云主账号,且上传的文件仅限该主账号及其对应模型使用,无法被其他主账号或其他模型共享。
  • 文件有效期限制:文件上传后有效期48小时,超时后文件将被自动清理,请确保在有效期内完成模型调用。
  • 文件使用限制:文件一旦上传,不可查询、修改或下载,仅能通过URL参数在模型调用时使用
  • 文件上传限流:文件上传凭证接口的调用限流按照“阿里云主账号+模型”维度为100QPS超出限流将导致请求失败

创建音色后,音色列表只能通过接口查看,无法通过火山引擎的控制面板查看

使用自定义音色交互大模型

参考官方 文档 进行调用自定义音色

若是对接端到端实时多模态模型(如qwen3.5-omni-flash-realtime),可参考 文档

字节火山引擎

准备

  • 开通音色槽位(默认为后付费音色)
  • 开通声音复刻1.0或2.0(默认赠送20000字数)
  • 自定义音色音频文件(支持:wav、mp3、ogg、m4a、aac、pcm,其中pcm仅支持24k,单通道)

服务费用说明: 音色训练时默认使用声音复刻2.0 的字符数,当音色训练完毕后、首次合成会扣除 138元 的槽位费,音色固定无法再次训练,有效期一年;而合成时也默认使用声音复刻2.0的字符数 计费详情参考:计费概述

训练自定义音色

根据 声音复刻API-V3 进行音色训练,根据接口返回的链接验证训练效果(注:1小时有效)

注意:确保验证训练效果后再执行后续的音色合成,否则一旦首次合成后音色固定无法再次调整

训练完成后记录该音色的 speaker_id 字段供后续使用

使用自定义音色交互大模型

由于我们是在端到端的实时语音大模型中使用,可参考 端到端实时语音大模型 Demo 进行交互

在 TTS 配置的 speaker 字段填写上方的音色 ID,model_ 设置为 2.2.0.0 即可使用该音色进行实时对话

文章目录