CosyVoice2 Evaluation Results

December 26, 2025 · View on GitHub

Model: CosyVoice2-0.5B Evaluation Date: 2025/12/08 Paper/Repo: FunAudioLLM/CosyVoice2-0.5B

Metrics Legend:

  • WER⬇️: Word Error Rate (lower is better)
  • CER⬇️: Character Error Rate (lower is better)
  • SIM⬆️: Speaker Similarity (higher is better)
  • P808_MOS⬆️: DNSMOS P.808 Mean Opinion Score (higher is better)

Note:

  • Performance format: reproduced_result(official_result) - values in parentheses are official results from the paper.
  • Replicating CosyVoice2 results is challenging as the model weights and inference code have been updated over time.

Seed-TTS-Eval Benchmark

taskdatasetWER/CER⬇️SIM⬆️eval_clinote
ttsseed_tts_eval_en3.24(2.57)65.36(65.2)[1]
ttsseed_tts_eval_zh1.28(1.45)75.03(75.3)[2]

CV3 Benchmark (Zero-Shot)

taskdatasetWER/CER⬇️SIM⬆️P808_MOS⬆️eval_clinote
ttscv3_zero_shot_en7.60(6.32)71.133.81[3]
ttscv3_zero_shot_zh4.02(4.08)77.903.85[4]
ttscv3_zero_shot_hard_en13.91(11.96)70.93(66.7)3.93(3.95)[5]
ttscv3_zero_shot_hard_zh8.35(12.58)76.33(72.6)3.81(3.81)[6]https://github.com/FunAudioLLM/CV3-Eval/issues/4

Long-TTS-Eval Benchmark

Update (2025/12/19): results may change as FunAudioLLM/CosyVoice is updated.

the official result from Long-TTS-Eval

taskdatasetWER(%)⬇️eval_clinote
ttslong_tts_eval_en7.17(14.80)[7]model: cosyvoice2-official
ttslong_tts_eval_zh7.11(5.27)[8]model: cosyvoice2-official
ttslong_tts_eval_hard_en37.61(43.48)[9]model: cosyvoice2-official
ttslong_tts_eval_hard_zh34.31(32.76)[10]model: cosyvoice2-official

Evaluation Commands

[1] python audio_evals/main.py --dataset seed_tts_eval_en --model cosyvoice2-vc

[2] python audio_evals/main.py --dataset seed_tts_eval_zh --model cosyvoice2-vc

[3] python audio_evals/main.py --dataset cv3_zero_shot_en --model cosyvoice2-vc

[4] python audio_evals/main.py --dataset cv3_zero_shot_zh --model cosyvoice2-vc

[5] python audio_evals/main.py --dataset cv3_zero_shot_hard_en --model cosyvoice2-vc

[6] python audio_evals/main.py --dataset cv3_zero_shot_hard_zh --model cosyvoice2-vc

[7] python audio_evals/main.py --dataset long_tts_eval_en --model cosyvoice2-official

[8] python audio_evals/main.py --dataset long_tts_eval_zh --model cosyvoice2-official

[9] python audio_evals/main.py --dataset long_tts_eval_hard_en --model cosyvoice2-official

[10] python audio_evals/main.py --dataset long_tts_eval_hard_zh --model cosyvoice2-official