supported_metrics.md

August 5, 2026 ยท View on GitHub

Independent Metrics

We include x mark if the metric is auto-installed in versa.

NumberAuto-InstallMetric Name (Auto-Install)Key in configKey in reportCode SourceReferences
1xDeep Noise Suppression MOS Score of P.835 (DNSMOS)pseudo_mosdnsmos_overallspeechmos (MS)paper
2xDeep Noise Suppression MOS Score of P.808 (DNSMOS)pseudo_mosdnsmos_p808speechmos (MS)paper
3xNon-intrusive Speech Quality and Naturalness Assessment (NISQA)nisqa{nisqa_mos_pred, nisqa_noi_pred, nisqa_dis_pred, nisqa_col_pred, nisqa_loud_pred}NISQApaper
4xUTokyo-SaruLab System for VoiceMOS Challenge 2022 (UTMOS)pseudo_mosutmosspeechmospaper
5xPacket Loss Concealment-related MOS Score (PLCMOS)pseudo_mosplcmosspeechmos (MS)paper
6xPESQ in TorchAudio-Squimsquim_no_reftorch_squim_pesqtorch_squimpaper
7xSTOI in TorchAudio-Squimsquim_no_reftorch_squim_stoitorch_squimpaper
8xSI-SDR in TorchAudio-Squimsquim_no_reftorch_squim_si_sdrtorch_squimpaper
9xSinging voice MOSsingmossingmossingmospaper
10xSheet SSQA MOS Modelssheet_ssqasheet_ssqaSheetpaper
11UTMOSv2: UTokyo-SaruLab MOS Prediction Systemutmosv2utmosv2UTMOSv2paper
12Speech Contrastive Regression for Quality Assessment without reference (ScoreQ)scoreq_nrscoreq_nrScoreQpaper
13xSpeech enhancement-based SI-SNRse_snrse_si_snrESPnet
14xSpeech enhancement-based CI-SDRse_snrse_ci_sdrESPnet
15xSpeech enhancement-based SARse_snrse_sarESPnet
16xSpeech enhancement-based SDRse_snrse_sdrESPnet
17xPAM: Prompting Audio-Language Models for Audio Quality AssessmentpampamPAMPaper
18Speech-to-Reverberation Modulation energy Ratio (SRMR)srmrsrmrSRMRpyPaper
19xVoice Activity Detection (VAD)vadvad_infoSileroVAD
20Speaker Turn Taking (SPK-TT)
21xSpeaking Word/Character Rate (SWR)speaking_ratespeaking_rate--
22xAuti-spoofing Score (SpoofS) with AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networksasvspoof_scoreasvspoof_scoreAASISTPaper
23xLanguage IdentificationlidlanguageESPnetPaper
24Audiobox Aestheticsaudiobox_aesthetics{audiobox_aesthetics_CE, audiobox_aesthetics_CU, audiobox_aesthetics_PC, audiobox_aesthetics_PQ}Audiobox-AestheticsPaper
25xQwen2 Speaker Characteristics - Countqwen2_speaker_count_metricqwen2_speaker_count_metricQwen2 Audiopaper
26xQwen2 Speaker Characteristics - Genderqwen2_speaker_gender_metricqwen2_speaker_gender_metricQwen2 Audiopaper
27xQwen2 Speaker Characteristics - Ageqwen2_speaker_age_metricqwen2_speaker_age_metricQwen2 Audiopaper
28xQwen2 Speaker Characteristics - Speech Impairmentqwen2_speech_impairment_metricqwen2_speech_impairment_metricQwen2 Audiopaper
29xQwen2 Voice Properties - Pitchqwen2_voice_pitch_metricqwen2_voice_pitch_metricQwen2 Audiopaper
30xQwen2 Voice Properties - Pitch Rangeqwen2_pitch_range_metricqwen2_pitch_range_metricQwen2 Audiopaper
31xQwen2 Voice Properties - Voice Typeqwen2_voice_type_metricqwen2_voice_type_metricQwen2 Audiopaper
32xQwen2 Voice Properties - Volume Levelqwen2_speech_volume_level_metricqwen2_speech_volume_level_metricQwen2 Audiopaper
33xQwen2 Speech Content - Languageqwen2_language_metricqwen2_language_metricQwen2 Audiopaper
34xQwen2 Speech Content - Registerqwen2_speech_register_metricqwen2_speech_register_metricQwen2 Audiopaper
35xQwen2 Speech Content - Vocabulary Complexityqwen2_vocabulary_complexity_metricqwen2_vocabulary_complexity_metricQwen2 Audiopaper
36xQwen2 Speech Content - Purposeqwen2_speech_purpose_metricqwen2_speech_purpose_metricQwen2 Audiopaper
37xQwen2 Speech Delivery - Emotionqwen2_speech_emotion_metricqwen2_speech_emotion_metricQwen2 Audiopaper
38xQwen2 Speech Delivery - Clarityqwen2_speech_clarity_metricqwen2_speech_clarity_metricQwen2 Audiopaper
39xQwen2 Speech Delivery - Rateqwen2_speech_rate_metricqwen2_speech_rate_metricQwen2 Audiopaper
40xQwen2 Speech Delivery - Styleqwen2_speaking_style_metricqwen2_speaking_style_metricQwen2 Audiopaper
41xQwen2 Speech Delivery - Emotional Vocalizationsqwen2_laughter_crying_metricqwen2_laughter_crying_metricQwen2 Audiopaper
42xQwen2 Interaction Patterns - Overlapping Speechqwen2_overlapping_speech_metricqwen2_overlapping_speech_metricQwen2 Audiopaper
43xQwen2 Recording Environment - Backgroundqwen2_speech_background_environment_metricqwen2_speech_background_environment_metricQwen2 Audiopaper
44xQwen2 Recording Environment - Qualityqwen2_recording_quality_metricqwen2_recording_quality_metricQwen2 Audiopaper
45xQwen2 Recording Environment - Channel Typeqwen2_channel_type_metricqwen2_channel_type_metricQwen2 Audiopaper
46xQwen2.5-Omni Speech and Singing Characteristicsqwen_omni_{sub_metrics}, qwen_omni_{sub_metrics}_metricqwen_omni_{sub_metrics}Qwen2.5-Omni-
47xDimensional Emotionemo_vadarousal_emo_vad, valence_emo_vad, dominance_emo_vadw2v2-how-topaper
48xUni-VERSA (Versatile Speech Assessment with a Unified Framework)universa, universa_noref, universa_audioref, universa_textref, universa_fullrefuniversa_{sub_metrics}Uni-VERSApaper
49ARECHO (Audio Reference Echo Cancellation and Codec Quality Assessment) - No Referencearecho, arecho_norefarecho_{sub_metrics}ARECHOpaper
50xDNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speechpseudo_mosdnsmos_pro_bvccDNSMOSPropaper
51xDNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speechpseudo_mosdnsmos_pro_nisqaDNSMOSPropaper
52xDNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speechpseudo_mosdnsmos_pro_vcc2018DNSMOSPropaper
53WV-MOS (MOS score prediction by fine-tuned wav2vec2.0 model)wvmoswvmoswvmospaper
54SIG-MOSsigmos{SIGMOS_COL, SIGMOS_DISC, SIGMOS_LOUD, SIGMOS_REVERB, SIGMOS_SIG, SIGMOS_OVRL}sigmospaper
55xVQScore (Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech)vqscorevqscoreVQScorepaper
56xSinging voice MOSpseudo_mossingmos_prosingmospaper
57SongEval (A Benchmark Dataset for Song Aesthetics Evaluation)songeval{songeval_coherence, songeval_musicality, songeval_memorability, songeval_clarity, songeval_naturalness}SongEvalpaper
58Multivariate Probabilistic Assessment of Speech Qualitymultigaussmultigauss_{mos,noi,col,dis,loud}, multigauss_covarianceMultiGausspaper

Dependent Metrics

NumberAuto-InstallMetric Name (Auto-Install)Key in configKey in reportCode SourceReferences
1xMel Cepstral Distortion (MCD)mcd_f0mcdespnet and s3prl-vcpaper
2xF0 Correlationmcd_f0f0_correspnet and s3prl-vcpaper
3xF0 Root Mean Square Errormcd_f0f0_rmseespnet and s3prl-vcpaper
4xSignal-to-interference Ratio (SIR)signal_metricsirespnet-
5xSignal-to-artifact Ratio (SAR)signal_metricsarespnet-
6xSignal-to-distortion Ratio (SDR)signal_metricsdrespnet-
7xConvolutional scale-invariant signal-to-distortion ratio (CI-SDR)signal_metricci-sdrci_sdrpaper
8xScale-invariant signal-to-noise ratio (SI-SNR)signal_metricsi-snrespnetpaper
9xPerceptual Evaluation of Speech Quality (PESQ)pesqpesqpesqpaper
10xShort-Time Objective Intelligibility (STOI)stoistoipystoipaper
11xSpeech BERT Scorediscrete_speechspeech_bertdiscrete speech metricpaper
12xDiscrete Speech BLEU Scorediscrete_speechspeech_beludiscrete speech metricpaper
13xDiscrete Speech Token Edit Distancediscrete_speechspeech_token_distancediscrete speech metricpaper
14Dynamic Time Warping Cost MetricwarpqwarpqWARP-Qpaper
15Speech Contrastive Regression for Quality Assessment with reference (ScoreQ)scoreq_refscoreq_refScoreQpaper
162f-Model
17xLog-Weighted Mean Square Errorlog_wmselog_wmselog_wmse
18xASR-oriented Mismatch Error Rate (ASR-Mismatch)asr_matchasr_match_error_rate--
19Virtual Speech Quality Objective Listener (VISQOL)visqolvisqolgoogle-visqolpaper
20Frequency-Weighted SEGmental SNR (FWSEGSNR)pysepmpysepm_fwsegsnrpysepmPaper
21Weighted Spectral Slope (WSS)pysepmpysepm_wsspysepmPaper
22Cepstrum Distance Objective Speech Quality Measure (CD)pysepmpysepm_cdpysepmPaper
23Composite Objective Speech Quality (composite)pysepmpysepm_Csig, pysepm_Cbak, pysepm_CovlpysepmPaper
24Coherence and speech intelligibility index (CSII)pysepmpysepm_csii_high, pysepm_csii_mid, pysepm_csii_lowpysepmPaper
25Normalized-covariance measure (NCM)pysepmpysepm_ncmpysepmPaper
26xUni-VERSA (Versatile Speech Assessment with a Unified Framework) with Paired Referenceuniversauniversa_{sub_metrics}Uni-VERSApaper
27xChroma-related Alignmentchroma_alignmentchroma_{stft,cqt,cens}_{cosine, euclidean}_dtw{"", _log, _raw}--
28xDeep Perceptual Audio Metric (DPAM)dpamdpam_distancePerceptualAudio_Pytorchpaper
29xContrastive learning-based Deep Perceptual Audio Metric (CDPAM)cdpamcdpam_distancePerceptualAudiopaper

Non-match Metrics

NumberAuto-InstallMetric Name (Auto-Install)Key in configKey in reportCode SourceReferences
1NORESQA : A Framework for Speech Quality Assessment using Non-Matching ReferencesnoresqanoresqaNoresqaPaper
2xMOS in TorchAudio-Squimsquim_reftorch_squim_mostorch_squimpaper
3xESPnet Speech Recognition-based Error Rateespnet_werespnet_werESPnetpaper
4xESPnet-OWSM Speech Recognition-based Error Rateowsm_werowsm_werESPnetpaper
5xOpenAI-Whisper Speech Recognition-based Error Rate (WER/CER, optional PER)whisper_werwhisper_werWhisperpaper
6Faster-Whisper Speech Recognition-based Error Ratefwhisper_werfwhisper_werFaster-Whisper-
7NVIDIA Conformer-Transducer X-Large Speech Recognition-based Error Ratenemo_wernemo_werNeMopaper
8xFacebook Hubert-Large-Finetuned Speech Recognition-based Error Ratehubert_werhubert_werHuBERTpaper
9Emotion2vec similarity (emo2vec)emo2vec_similarityemotion_similarityemo2vecpaper
10xSpeaker Embedding Similarityspeakerspk_similarityespnet, transformers x-vector (e.g. WavLM)paper
11NOMAD: Unsupervised Learning of Perceptual Embeddings For Speech Enhancement and Non-Matching Reference Audio Quality AssessmentnomadnomadNomadpaper
12Contrastive Language-Audio Pretraining Score (CLAP Score)clap_scoreclap_scorefrechet-audio-distancepaper
13Accompaniment Prompt Adherence (APA)apaapaSony-audio-metricspaper
14Log Likelihood Ratio (LLR)pysepmpysepm_llrpysepmPaper
15xUni-VERSA (Versatile Speech Assessment with a Unified Framework) with Paired Textuniversauniversa_{sub_metrics}Uni-VERSApaper
16Singer Embedding Similaritysingersinger_similaritySSL-Singer-Identitypaper

Distributional Metrics (in verifying)

NumberAuto-InstallMetric Name (Auto-Install)Key in configKey in reportCode SourceReferences
1Frechet Audio Distance (FAD)fadfadfadtkpaper
2Individual Frechet Audio Distanceindividual_fadindividual_fadfadtkpaper
3Kullback-Leibler Divergence on Embedding Distributionkl_embeddingkl_embeddingStability-AI
4Audio Density Scoreaudio_density_coverageaudio_densitySony-audio-metricspaper
5Audio Coverage Scoreaudio_density_coverageaudio_coverageSony-audio-metricspaper
6KID : Kernel Distance Metric for Audio/Music Qualitykidkid_mean, kid_stdKIDPaper

Acknowledgement

We sincerely thank all the open-source implementations listed in https://github.com/shinjiwlab/versa/tree/main#list-of-metrics