Fish Speech S2 Pro 评测结果 / Evaluation Results

April 20, 2026 · View on GitHub

模型 / Model: fishaudio-s2-pro 评测日期 / Evaluation Date: 2026/04 Paper/Repo: fishaudio/s2-pro

指标说明 / Metrics:

  • WER⬇️: Word Error Rate — 词错误率,越低越好 / lower is better
  • CER⬇️: Character Error Rate — 字符错误率,越低越好 / lower is better
  • SIM⬆️: Speaker Similarity — 说话人相似度,越高越好 / higher is better

Seed-TTS-Eval Benchmark

taskdatasetWER/CER⬇️SIM⬆️eval_clinote
ttsseed_tts_eval_en1.8264.94[1]
ttsseed_tts_eval_zh1.0372.84[2]

说明: 上述 Seed-TTS-Eval 结果(EN WER=1.82, ZH CER=1.03)与官方 README / 技术报告中公布的数值(EN=0.99, ZH=0.54)存在较大差距。原因是论文中公布的数值使用的是 fishaudio 线上服务的模型,而非开源模型;本评测基于公开权重 fishaudio/s2-profish-speech 仓库公开的本地推理路径完成,因此无法与论文数值对齐。相关讨论参考 fishaudio/fish-speech#1268

Note (EN): The Seed-TTS-Eval numbers above (EN WER=1.82, ZH CER=1.03) differ noticeably from the values reported in the official README / technical report (EN=0.99, ZH=0.54). The reason is that the paper's reported numbers were produced by fishaudio's online service model, not the open-source release. This evaluation is based on the publicly released weights fishaudio/s2-pro and the local inference pipeline provided in the fish-speech repository, so the results are not directly comparable to the paper. See the related discussion in fishaudio/fish-speech#1268.


MiniMax TTS 多语言 Benchmark / MiniMax TTS Multilingual Benchmark

来源数据集 / Source dataset: MiniMaxAI/TTS-Multilingual-Test-Set

tasklanguagedatasetWER/CER⬇️SIM⬆️eval_cli
ttsArabicminimax_tts_arabic8.02 (WER)73.26[3]
ttsCantoneseminimax_tts_cantonese46.15 (CER)74.75[4]
ttsChineseminimax_tts_chinese1.08 (CER)76.90[5]
ttsCzechminimax_tts_czech6.57 (WER)76.68[6]
ttsDutchminimax_tts_dutch1.40 (WER)71.59[7]
ttsEnglishminimax_tts_english2.39 (WER)78.71[8]
ttsFinnishminimax_tts_finnish7.69 (WER)80.43[9]
ttsFrenchminimax_tts_french4.18 (WER)68.12[10]
ttsGermanminimax_tts_german1.04 (WER)71.04[11]
ttsGreekminimax_tts_greek12.45 (WER)79.71[12]
ttsHindiminimax_tts_hindi22.38 (WER)78.84[13]
ttsIndonesianminimax_tts_indonesian2.82 (WER)73.29[14]
ttsJapaneseminimax_tts_japanese3.65 (CER)75.99[15]
ttsKoreanminimax_tts_korean1.59 (CER)75.32[16]
ttsPolishminimax_tts_polish2.41 (WER)79.02[17]
ttsPortugueseminimax_tts_portuguese1.53 (WER)79.31[18]
ttsRomanianminimax_tts_romanian15.83 (WER)75.55[19]
ttsRussianminimax_tts_russian3.89 (WER)76.31[20]
ttsSpanishminimax_tts_spanish1.56 (WER)73.80[21]
ttsThaiminimax_tts_thai7.59 (CER)74.87[22]
ttsTurkishminimax_tts_turkish2.03 (WER)77.99[23]
ttsVietnameseminimax_tts_vietnamese15.74 (WER)70.87[24]

Evaluation Commands

[1] python audio_evals/main.py --dataset seed_tts_eval_en --model fishaudio-s2-pro

[2] python audio_evals/main.py --dataset seed_tts_eval_zh --model fishaudio-s2-pro

[3] python audio_evals/main.py --dataset minimax_tts_arabic --model fishaudio-s2-pro

[4] python audio_evals/main.py --dataset minimax_tts_cantonese --model fishaudio-s2-pro

[5] python audio_evals/main.py --dataset minimax_tts_chinese --model fishaudio-s2-pro

[6] python audio_evals/main.py --dataset minimax_tts_czech --model fishaudio-s2-pro

[7] python audio_evals/main.py --dataset minimax_tts_dutch --model fishaudio-s2-pro

[8] python audio_evals/main.py --dataset minimax_tts_english --model fishaudio-s2-pro

[9] python audio_evals/main.py --dataset minimax_tts_finnish --model fishaudio-s2-pro

[10] python audio_evals/main.py --dataset minimax_tts_french --model fishaudio-s2-pro

[11] python audio_evals/main.py --dataset minimax_tts_german --model fishaudio-s2-pro

[12] python audio_evals/main.py --dataset minimax_tts_greek --model fishaudio-s2-pro

[13] python audio_evals/main.py --dataset minimax_tts_hindi --model fishaudio-s2-pro

[14] python audio_evals/main.py --dataset minimax_tts_indonesian --model fishaudio-s2-pro

[15] python audio_evals/main.py --dataset minimax_tts_japanese --model fishaudio-s2-pro

[16] python audio_evals/main.py --dataset minimax_tts_korean --model fishaudio-s2-pro

[17] python audio_evals/main.py --dataset minimax_tts_polish --model fishaudio-s2-pro

[18] python audio_evals/main.py --dataset minimax_tts_portuguese --model fishaudio-s2-pro

[19] python audio_evals/main.py --dataset minimax_tts_romanian --model fishaudio-s2-pro

[20] python audio_evals/main.py --dataset minimax_tts_russian --model fishaudio-s2-pro

[21] python audio_evals/main.py --dataset minimax_tts_spanish --model fishaudio-s2-pro

[22] python audio_evals/main.py --dataset minimax_tts_thai --model fishaudio-s2-pro

[23] python audio_evals/main.py --dataset minimax_tts_turkish --model fishaudio-s2-pro

[24] python audio_evals/main.py --dataset minimax_tts_vietnamese --model fishaudio-s2-pro