CosyVoice3 Evaluation Results

December 26, 2025 · View on GitHub

Model: cosyvoice3-latest (config) Evaluation Date: 2025/12/17 Paper/Repo: FunAudioLLM/Fun-CosyVoice3-0.5B-2512

Metrics Legend:

  • WER⬇️: Word Error Rate (lower is better)
  • CER⬇️: Character Error Rate (lower is better)
  • SIM⬆️: Speaker Similarity (higher is better)
  • P808_MOS⬆️: DNSMOS P.808 Mean Opinion Score (higher is better)

Note: Update (2025/12/17): results may change as FunAudioLLM/CosyVoice is updated.

Seed-TTS-Eval Benchmark

taskdatasetWER/CER⬇️SIM⬆️eval_clinote
ttsseed_tts_eval_en2.14(2.24)69.45(71.8)[1]
ttsseed_tts_eval_zh1.14(1.21)77.55(78.0)[2]

CV3 Benchmark (Zero-Shot)

taskdatasetWER/CER⬇️SIM⬆️P808_MOS⬆️eval_clinote
ttscv3_zero_shot_en5.0174.443.84[3]
ttscv3_zero_shot_zh4.0679.993.88[4]
ttscv3_zero_shot_hard_en11.0574.333.99[5]
ttscv3_zero_shot_hard_zh7.4378.633.84[6]

Long-TTS-Eval Benchmark

taskdatasetWER(%)⬇️eval_clinote
ttslong_tts_eval_en92.63[7]
ttslong_tts_eval_zh87.17[8]
ttslong_tts_eval_hard_en78.20[9]
ttslong_tts_eval_hard_zh69.59[10]

Long-TTS-Eval Benchmark (zero_shot-overall.json)

taskdatasetWER(%)⬇️note
ttslong_tts_eval_en-error: list index out of range (see res/cosyvoice3-latest/long_tts_eval_en/zero_shot-log.txt)
ttslong_tts_eval_zh-error: list index out of range (see res/cosyvoice3-latest/long_tts_eval_zh/zero_shot-log.txt)
ttslong_tts_eval_hard_en-error: list index out of range (see res/cosyvoice3-latest/long_tts_eval_hard_en/zero_shot-log.txt)
ttslong_tts_eval_hard_zh-error: list index out of range (see res/cosyvoice3-latest/long_tts_eval_hard_zh/zero_shot-log.txt)

Evaluation Commands

[1] python audio_evals/main.py --dataset seed_tts_eval_en --model cosyvoice3-latest --prompt cosyvoice3-vc [2] python audio_evals/main.py --dataset seed_tts_eval_zh --model cosyvoice3-latest --prompt cosyvoice3-vc

[3] python audio_evals/main.py --dataset cv3_zero_shot_en --model cosyvoice3-latest --prompt cosyvoice3-vc [4] python audio_evals/main.py --dataset cv3_zero_shot_zh --model cosyvoice3-latest --prompt cosyvoice3-vc [5] python audio_evals/main.py --dataset cv3_zero_shot_hard_en --model cosyvoice3-latest --prompt cosyvoice3-vc [6] python audio_evals/main.py --dataset cv3_zero_shot_hard_zh --model cosyvoice3-latest --prompt cosyvoice3-vc

[7] python audio_evals/main.py --dataset long_tts_eval_en --model cosyvoice3-latest --prompt cosyvoice3-tts [8] python audio_evals/main.py --dataset long_tts_eval_zh --model cosyvoice3-latest --prompt cosyvoice3-tts [9] python audio_evals/main.py --dataset long_tts_eval_hard_en --model cosyvoice3-latest --prompt cosyvoice3-tts [10] python audio_evals/main.py --dataset long_tts_eval_hard_zh --model cosyvoice3-latest --prompt cosyvoice3-tts