GLM-TTS Evaluation Results

December 26, 2025 · View on GitHub

Model: glmtts (config) Evaluation Date: 2025/12 (from res/glmtts/*/res-overall.json) Paper/Repo: zai-org/GLM-TTS

Metrics Legend:

  • WER⬇️: Word Error Rate (lower is better)
  • CER⬇️: Character Error Rate (lower is better)
  • SIM⬆️: Speaker Similarity (higher is better)
  • P808_MOS⬆️: DNSMOS P.808 Mean Opinion Score (higher is better)

Seed-TTS-Eval Benchmark

taskdatasetWER/CER⬇️SIM⬆️eval_clinote
ttsseed_tts_eval_en2.4867.25[1]
ttsseed_tts_eval_zh1.06(1.03)75.98(76.1)[2]

CV3 Benchmark (Zero-Shot)

taskdatasetWER/CER⬇️SIM⬆️P808_MOS⬆️eval_clinote
ttscv3_zero_shot_en6.6172.083.70[3]
ttscv3_zero_shot_zh3.6177.983.73[4]
ttscv3_zero_shot_hard_en9.4073.433.73[5]fail_rate: 3.12%
ttscv3_zero_shot_hard_zh9.1477.793.64[6]

Evaluation Commands

[1] python audio_evals/main.py --dataset seed_tts_eval_en --model glmtts [2] python audio_evals/main.py --dataset seed_tts_eval_zh --model glmtts

[3] python audio_evals/main.py --dataset cv3_zero_shot_en --model glmtts [4] python audio_evals/main.py --dataset cv3_zero_shot_zh --model glmtts [5] python audio_evals/main.py --dataset cv3_zero_shot_hard_en --model glmtts [6] python audio_evals/main.py --dataset cv3_zero_shot_hard_zh --model glmtts