JOTO
Contact us
← AI 智库
开源模型

阿里开源 TTS 新一代:CosyVoice 3.0,0.5B 参数吊打一众大模型

2026 年 9 月 6 日

2025 年 12 月,阿里 FunAudioLLM 团队发布 CosyVoice 3.0:0.5B 参数、支持 9 种语言与 18 种以上中文方言、零样本声音克隆、延迟低至 150ms,开源协议为 Apache 2.0。其 RL 版本中文 CER 降至 0.81%,说话人相似度达 77.4%,在多项指标上超越参数量更大的开源及闭源竞品。

Fun-CosyVoice 3.0 正式发布

2025 年 12 月,阿里 FunAudioLLM 团队发布了 Fun-CosyVoice 3.0——一个基于大语言模型的文本转语音系统。0.5B 参数,9 种语言,18 种以上中国方言,零样本声音克隆,延迟低至 150ms。

开源,Apache 2.0。

CosyVoice 3.0 官方宣传图
CosyVoice 3.0 官方宣传图

三代迭代,一代比一代猛

CosyVoice 不是一蹴而就的。从 2024 年 7 月的 1.0 到现在的 3.0,一年半走了三代。

  • 1.0 奠基。300M 参数,证明了"用语义 token 做语音合成"这条路可行。支持流式推理、KV cache 优化、Flow matching 训练。那时候它还只是个学术 demo。
  • 2.0 走向工程化。参数压到 0.5B,引入了 25Hz 帧率,开始支持流式输出的双通道——文本输入流和音频输出流同时跑。延迟降下来了,质量没掉。vLLM 加持,推理速度再上一层。
  • 3.0 是当前版本。在内容一致性、说话人相似度、韵律自然度三个维度上全面超越 2.0。加了 RL(强化学习)版本,中文 CER 从 1.21% 降到 0.81%,英文 WER 从 2.24% 降到 1.68%。

关键数据:Fun-CosyVoice3 的 RL 版本,中文字错率 0.81%,说话人相似度 77.4%,在开源模型里第一梯队。

它到底能做什么

  • 九语十八腔。 中文、英文、日语、韩语、德语、西班牙语、法语、意大利语、俄语——九种语言通吃。中文方言更细:广东话、闽南话、四川话、东北话、陕西话、山西话、上海话、天津话、山东话、宁夏话、甘肃话……18 种以上。
  • 零样本声音克隆。 给它一段几秒的参考音频,它就能用那个人的声音念你给的文本。支持多语言克隆(用中文声音念英文)和跨语言克隆(用英文声音念中文)。
  • 发音修正。 支持中文拼音和英文 CMU 音标的发音嵌入,遇到生僻字、专有名词、多音字,可以手动指定发音。这是生产环境的关键功能——做有声书、做新闻播报,遇到"重庆"和"重塑"的"重"字读不对,就废了。
  • 文本归一化。 数字、特殊符号、各种文本格式直接读,不需要前端模块预处理。"3.14"读成"三点一四","100%"读成"百分之百","$5.99"读成"五美元九十九美分"。你不用自己写正则。
  • 指令控制。 可以用指令控制语言、方言、情感、语速、音量。"用悲伤的语气读这段话""语速放慢一倍"——这种需求直接指令搞定。

0.5B 怎么打赢 1.5B 的

我看了它的评测表,最有意思的是跟同行的对比。

模型 参数量 中文 CER 说话人相似度 英文 WER 开源
MiniMax-Speech 闭源 0.83% 78.3% 1.65%
Fun-CosyVoice3 RL 0.5B 0.81% 77.4% 1.68%
Index-TTS2 1.5B 1.03% 76.5% 2.23%
GLM-TTS RL 1.5B 0.89% 76.4% -
F5-TTS 0.3B 1.52% 74.1% 2.00%
CosyVoice2 0.5B 1.45% 75.7% 2.57%

0.5B 的 Fun-CosyVoice3 RL,中文 CER 0.81%,比 1.5B 的 Index-TTS2(1.03%)和 GLM-TTS RL(0.89%)都低。跟闭源的 MiniMax-Speech(0.83%)几乎持平。

这个参数效率是怎么做到的?论文里提到几个关键点:语义 token 的监督学习、流匹配(flow matching)训练、以及 RL 后训练。用更少的参数学到更紧凑的语音表征,再用强化学习把"读对"的概率拉高。

能直接上生产

CosyVoice 不只是个论文附带的 demo 代码,它有完整的部署方案。

  • Web UI。 一行命令起服务,浏览器里就能试:python3 webui.py --port 50000 --model_dir pretrained_models/CosyVoice-300M
  • vLLM 加速。 支持 vLLM 0.11.x+ 的 V1 引擎和 0.9.0 旧版。vLLM 做的是 LLM 部分的加速,对 CosyVoice2/3 都适用。
  • Docker 部署。 提供了 gRPC 和 FastAPI 两种服务端,Docker 镜像直接跑。docker run 一行起服务,客户端一行调用。
  • TensorRT-LLM。 NVIDIA 贡献的 triton + trtllm runtime,LLM 部分加速 4 倍。docker compose up -d 就能跑。
  • 模型获取。 国内用 ModelScope,海外用 HuggingFace,一行代码下载预训练模型。

不只是 TTS

CosyVoice 是 FunAudioLLM 生态的一环。这个家族还有:

  • FunASR ——工业级语音识别,50+ 语言,支持说话人分离和流式。
  • SenseVoice ——超快 ASR + 情感识别 + 音频事件检测。识别语音的同时告诉你"这个人在生气""背景有狗叫"。
  • FunClip ——基于语音识别的 AI 视频剪辑。
  • Fun-ASR-Nano ——端到端 LLM-based ASR,31 种语言,支持热词和 vLLM 流式。

ASR + TTS + 情感识别 + 视频剪辑,阿里在语音 AI 这条线上铺得很宽。

说清楚限制

  • 需要 GPU。 0.5B 参数不大,但推理需要显卡。CPU 跑不动,至少需要一张像样的 NVIDIA GPU。vLLM 和 TensorRT-LLM 方案对显卡型号有要求。
  • 环境配置不简单。 Conda 环境、Python 3.10、sox 依赖、vLLM 版本兼容性——这些加起来有一定的安装门槛。Docker 方案能简化部署,但前提是你得会用 Docker。
  • 声音克隆有伦理边界。 零样本克隆太逼真了,技术本身是中性的,但使用场景需要合规。仓库没有内置防滥用机制,使用者自己负责。

怎么上手

仓库地址:github.com/QwenAudio/CosyVoice

三步走:

  1. git clone --recursive 拉代码
  2. conda create -n cosyvoice python=3.10 建环境
  3. python example.py 跑起来

模型用 ModelScope 或 HuggingFace 下载,Fun-CosyVoice3-0.5B 是推荐版本。

想试 Web UI:python3 webui.py --port 50000 --model_dir pretrained_models/Fun-CosyVoice3-0.5B

想用 vLLM 加速:装好 vLLM 0.11+ 后 python vllm_example.py

想 Docker 部署:cd runtime/python && docker build -t cosyvoice:v1.0 .

许可证 Apache 2.0,商用免费。

项目地址:github.com/QwenAudio/CosyVoice

在线 Demo:funaudiollm.github.io/cosyvoice3/

论文:arxiv.org/abs/2505.17589

CosyVoice 3.0 性能对比图表
CosyVoice 3.0 性能对比图表

JOTO 企业落地观察

  • 企业若计划将 TTS 集成进客服语音应答、智能外呼或无障碍播报等场景,CosyVoice 3.0 的零样本克隆与多语种能力可显著降低声音定制成本,但需同步建立声音授权与使用审计流程。
  • 该模型对 vLLM 和 TensorRT-LLM 的原生支持,意味着企业可在已有 LLM 推理基础设施上复用算力资源,减少新增 GPU 集群投入;但其 0.5B 参数仍要求单卡显存 ≥16GB,中小规模团队需评估部署密度与并发吞吐的平衡点。
  • 文本归一化与指令控制能力降低了前端文本预处理复杂度,使 RAG 知识工程中动态生成语音摘要、会议纪要朗读等轻量级语音交付成为可能,无需额外构建规则引擎或音素映射库。
  • 开源协议与完整部署链路(Docker / FastAPI / gRPC)为企业自主可控的语音能力构建提供了确定性路径,但声音克隆的伦理风险要求企业在 FDE 驻场共创阶段即嵌入 AI 治理检查点,例如强制添加水印标识或调用鉴权日志。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.