阿里开源 TTS 新一代:CosyVoice 3.0,0.5B 参数吊打一众大模型
2025 年 12 月,阿里 FunAudioLLM 团队发布 CosyVoice 3.0:0.5B 参数、支持 9 种语言与 18 种以上中文方言、零样本声音克隆、延迟低至 150ms,开源协议为 Apache 2.0。其 RL 版本中文 CER 降至 0.81%,说话人相似度达 77.4%,在多项指标上超越参数量更大的开源及闭源竞品。
Fun-CosyVoice 3.0 正式发布
2025 年 12 月,阿里 FunAudioLLM 团队发布了 Fun-CosyVoice 3.0——一个基于大语言模型的文本转语音系统。0.5B 参数,9 种语言,18 种以上中国方言,零样本声音克隆,延迟低至 150ms。
开源,Apache 2.0。

三代迭代,一代比一代猛
CosyVoice 不是一蹴而就的。从 2024 年 7 月的 1.0 到现在的 3.0,一年半走了三代。
- 1.0 奠基。300M 参数,证明了"用语义 token 做语音合成"这条路可行。支持流式推理、KV cache 优化、Flow matching 训练。那时候它还只是个学术 demo。
- 2.0 走向工程化。参数压到 0.5B,引入了 25Hz 帧率,开始支持流式输出的双通道——文本输入流和音频输出流同时跑。延迟降下来了,质量没掉。vLLM 加持,推理速度再上一层。
- 3.0 是当前版本。在内容一致性、说话人相似度、韵律自然度三个维度上全面超越 2.0。加了 RL(强化学习)版本,中文 CER 从 1.21% 降到 0.81%,英文 WER 从 2.24% 降到 1.68%。
关键数据:Fun-CosyVoice3 的 RL 版本,中文字错率 0.81%,说话人相似度 77.4%,在开源模型里第一梯队。
它到底能做什么
- 九语十八腔。 中文、英文、日语、韩语、德语、西班牙语、法语、意大利语、俄语——九种语言通吃。中文方言更细:广东话、闽南话、四川话、东北话、陕西话、山西话、上海话、天津话、山东话、宁夏话、甘肃话……18 种以上。
- 零样本声音克隆。 给它一段几秒的参考音频,它就能用那个人的声音念你给的文本。支持多语言克隆(用中文声音念英文)和跨语言克隆(用英文声音念中文)。
- 发音修正。 支持中文拼音和英文 CMU 音标的发音嵌入,遇到生僻字、专有名词、多音字,可以手动指定发音。这是生产环境的关键功能——做有声书、做新闻播报,遇到"重庆"和"重塑"的"重"字读不对,就废了。
- 文本归一化。 数字、特殊符号、各种文本格式直接读,不需要前端模块预处理。"3.14"读成"三点一四","100%"读成"百分之百","$5.99"读成"五美元九十九美分"。你不用自己写正则。
- 指令控制。 可以用指令控制语言、方言、情感、语速、音量。"用悲伤的语气读这段话""语速放慢一倍"——这种需求直接指令搞定。
0.5B 怎么打赢 1.5B 的
我看了它的评测表,最有意思的是跟同行的对比。
| 模型 | 参数量 | 中文 CER | 说话人相似度 | 英文 WER | 开源 |
|---|---|---|---|---|---|
| MiniMax-Speech | 闭源 | 0.83% | 78.3% | 1.65% | 否 |
| Fun-CosyVoice3 RL | 0.5B | 0.81% | 77.4% | 1.68% | 是 |
| Index-TTS2 | 1.5B | 1.03% | 76.5% | 2.23% | 是 |
| GLM-TTS RL | 1.5B | 0.89% | 76.4% | - | 是 |
| F5-TTS | 0.3B | 1.52% | 74.1% | 2.00% | 是 |
| CosyVoice2 | 0.5B | 1.45% | 75.7% | 2.57% | 是 |
0.5B 的 Fun-CosyVoice3 RL,中文 CER 0.81%,比 1.5B 的 Index-TTS2(1.03%)和 GLM-TTS RL(0.89%)都低。跟闭源的 MiniMax-Speech(0.83%)几乎持平。
这个参数效率是怎么做到的?论文里提到几个关键点:语义 token 的监督学习、流匹配(flow matching)训练、以及 RL 后训练。用更少的参数学到更紧凑的语音表征,再用强化学习把"读对"的概率拉高。
能直接上生产
CosyVoice 不只是个论文附带的 demo 代码,它有完整的部署方案。
- Web UI。 一行命令起服务,浏览器里就能试:
python3 webui.py --port 50000 --model_dir pretrained_models/CosyVoice-300M - vLLM 加速。 支持 vLLM 0.11.x+ 的 V1 引擎和 0.9.0 旧版。vLLM 做的是 LLM 部分的加速,对 CosyVoice2/3 都适用。
- Docker 部署。 提供了 gRPC 和 FastAPI 两种服务端,Docker 镜像直接跑。
docker run一行起服务,客户端一行调用。 - TensorRT-LLM。 NVIDIA 贡献的 triton + trtllm runtime,LLM 部分加速 4 倍。
docker compose up -d就能跑。 - 模型获取。 国内用 ModelScope,海外用 HuggingFace,一行代码下载预训练模型。
不只是 TTS
CosyVoice 是 FunAudioLLM 生态的一环。这个家族还有:
- FunASR ——工业级语音识别,50+ 语言,支持说话人分离和流式。
- SenseVoice ——超快 ASR + 情感识别 + 音频事件检测。识别语音的同时告诉你"这个人在生气""背景有狗叫"。
- FunClip ——基于语音识别的 AI 视频剪辑。
- Fun-ASR-Nano ——端到端 LLM-based ASR,31 种语言,支持热词和 vLLM 流式。
ASR + TTS + 情感识别 + 视频剪辑,阿里在语音 AI 这条线上铺得很宽。
说清楚限制
- 需要 GPU。 0.5B 参数不大,但推理需要显卡。CPU 跑不动,至少需要一张像样的 NVIDIA GPU。vLLM 和 TensorRT-LLM 方案对显卡型号有要求。
- 环境配置不简单。 Conda 环境、Python 3.10、sox 依赖、vLLM 版本兼容性——这些加起来有一定的安装门槛。Docker 方案能简化部署,但前提是你得会用 Docker。
- 声音克隆有伦理边界。 零样本克隆太逼真了,技术本身是中性的,但使用场景需要合规。仓库没有内置防滥用机制,使用者自己负责。
怎么上手
仓库地址:github.com/QwenAudio/CosyVoice
三步走:
git clone --recursive拉代码conda create -n cosyvoice python=3.10建环境python example.py跑起来
模型用 ModelScope 或 HuggingFace 下载,Fun-CosyVoice3-0.5B 是推荐版本。
想试 Web UI:python3 webui.py --port 50000 --model_dir pretrained_models/Fun-CosyVoice3-0.5B
想用 vLLM 加速:装好 vLLM 0.11+ 后 python vllm_example.py
想 Docker 部署:cd runtime/python && docker build -t cosyvoice:v1.0 .
许可证 Apache 2.0,商用免费。
项目地址:github.com/QwenAudio/CosyVoice
在线 Demo:funaudiollm.github.io/cosyvoice3/
论文:arxiv.org/abs/2505.17589

JOTO 企业落地观察
- 企业若计划将 TTS 集成进客服语音应答、智能外呼或无障碍播报等场景,CosyVoice 3.0 的零样本克隆与多语种能力可显著降低声音定制成本,但需同步建立声音授权与使用审计流程。
- 该模型对 vLLM 和 TensorRT-LLM 的原生支持,意味着企业可在已有 LLM 推理基础设施上复用算力资源,减少新增 GPU 集群投入;但其 0.5B 参数仍要求单卡显存 ≥16GB,中小规模团队需评估部署密度与并发吞吐的平衡点。
- 文本归一化与指令控制能力降低了前端文本预处理复杂度,使 RAG 知识工程中动态生成语音摘要、会议纪要朗读等轻量级语音交付成为可能,无需额外构建规则引擎或音素映射库。
- 开源协议与完整部署链路(Docker / FastAPI / gRPC)为企业自主可控的语音能力构建提供了确定性路径,但声音克隆的伦理风险要求企业在 FDE 驻场共创阶段即嵌入 AI 治理检查点,例如强制添加水印标识或调用鉴权日志。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


