| 1 | x | Deep Noise Suppression MOS Score of P.835 (DNSMOS) | pseudo_mos | dnsmos_overall | speechmos (MS) | paper |
| 2 | x | Deep Noise Suppression MOS Score of P.808 (DNSMOS) | pseudo_mos | dnsmos_p808 | speechmos (MS) | paper |
| 3 | x | Non-intrusive Speech Quality and Naturalness Assessment (NISQA) | nisqa | {nisqa_mos_pred, nisqa_noi_pred, nisqa_dis_pred, nisqa_col_pred, nisqa_loud_pred} | NISQA | paper |
| 4 | x | UTokyo-SaruLab System for VoiceMOS Challenge 2022 (UTMOS) | pseudo_mos | utmos | speechmos | paper |
| 5 | x | Packet Loss Concealment-related MOS Score (PLCMOS) | pseudo_mos | plcmos | speechmos (MS) | paper |
| 6 | x | PESQ in TorchAudio-Squim | squim_no_ref | torch_squim_pesq | torch_squim | paper |
| 7 | x | STOI in TorchAudio-Squim | squim_no_ref | torch_squim_stoi | torch_squim | paper |
| 8 | x | SI-SDR in TorchAudio-Squim | squim_no_ref | torch_squim_si_sdr | torch_squim | paper |
| 9 | x | Singing voice MOS | singmos | singmos | singmos | paper |
| 10 | x | Sheet SSQA MOS Models | sheet_ssqa | sheet_ssqa | Sheet | paper |
| 11 | | UTMOSv2: UTokyo-SaruLab MOS Prediction System | utmosv2 | utmosv2 | UTMOSv2 | paper |
| 12 | | Speech Contrastive Regression for Quality Assessment without reference (ScoreQ) | scoreq_nr | scoreq_nr | ScoreQ | paper |
| 13 | x | Speech enhancement-based SI-SNR | se_snr | se_si_snr | ESPnet | |
| 14 | x | Speech enhancement-based CI-SDR | se_snr | se_ci_sdr | ESPnet | |
| 15 | x | Speech enhancement-based SAR | se_snr | se_sar | ESPnet | |
| 16 | x | Speech enhancement-based SDR | se_snr | se_sdr | ESPnet | |
| 17 | x | PAM: Prompting Audio-Language Models for Audio Quality Assessment | pam | pam | PAM | Paper |
| 18 | | Speech-to-Reverberation Modulation energy Ratio (SRMR) | srmr | srmr | SRMRpy | Paper |
| 19 | x | Voice Activity Detection (VAD) | vad | vad_info | SileroVAD | |
| 20 | | Speaker Turn Taking (SPK-TT) | | | | |
| 21 | x | Speaking Word/Character Rate (SWR) | speaking_rate | speaking_rate | - | - |
| 22 | x | Auti-spoofing Score (SpoofS) with AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networks | asvspoof_score | asvspoof_score | AASIST | Paper |
| 23 | x | Language Identification | lid | language | ESPnet | Paper |
| 24 | | Audiobox Aesthetics | audiobox_aesthetics | {audiobox_aesthetics_CE, audiobox_aesthetics_CU, audiobox_aesthetics_PC, audiobox_aesthetics_PQ} | Audiobox-Aesthetics | Paper |
| 25 | x | Qwen2 Speaker Characteristics - Count | qwen2_speaker_count_metric | qwen2_speaker_count_metric | Qwen2 Audio | paper |
| 26 | x | Qwen2 Speaker Characteristics - Gender | qwen2_speaker_gender_metric | qwen2_speaker_gender_metric | Qwen2 Audio | paper |
| 27 | x | Qwen2 Speaker Characteristics - Age | qwen2_speaker_age_metric | qwen2_speaker_age_metric | Qwen2 Audio | paper |
| 28 | x | Qwen2 Speaker Characteristics - Speech Impairment | qwen2_speech_impairment_metric | qwen2_speech_impairment_metric | Qwen2 Audio | paper |
| 29 | x | Qwen2 Voice Properties - Pitch | qwen2_voice_pitch_metric | qwen2_voice_pitch_metric | Qwen2 Audio | paper |
| 30 | x | Qwen2 Voice Properties - Pitch Range | qwen2_pitch_range_metric | qwen2_pitch_range_metric | Qwen2 Audio | paper |
| 31 | x | Qwen2 Voice Properties - Voice Type | qwen2_voice_type_metric | qwen2_voice_type_metric | Qwen2 Audio | paper |
| 32 | x | Qwen2 Voice Properties - Volume Level | qwen2_speech_volume_level_metric | qwen2_speech_volume_level_metric | Qwen2 Audio | paper |
| 33 | x | Qwen2 Speech Content - Language | qwen2_language_metric | qwen2_language_metric | Qwen2 Audio | paper |
| 34 | x | Qwen2 Speech Content - Register | qwen2_speech_register_metric | qwen2_speech_register_metric | Qwen2 Audio | paper |
| 35 | x | Qwen2 Speech Content - Vocabulary Complexity | qwen2_vocabulary_complexity_metric | qwen2_vocabulary_complexity_metric | Qwen2 Audio | paper |
| 36 | x | Qwen2 Speech Content - Purpose | qwen2_speech_purpose_metric | qwen2_speech_purpose_metric | Qwen2 Audio | paper |
| 37 | x | Qwen2 Speech Delivery - Emotion | qwen2_speech_emotion_metric | qwen2_speech_emotion_metric | Qwen2 Audio | paper |
| 38 | x | Qwen2 Speech Delivery - Clarity | qwen2_speech_clarity_metric | qwen2_speech_clarity_metric | Qwen2 Audio | paper |
| 39 | x | Qwen2 Speech Delivery - Rate | qwen2_speech_rate_metric | qwen2_speech_rate_metric | Qwen2 Audio | paper |
| 40 | x | Qwen2 Speech Delivery - Style | qwen2_speaking_style_metric | qwen2_speaking_style_metric | Qwen2 Audio | paper |
| 41 | x | Qwen2 Speech Delivery - Emotional Vocalizations | qwen2_laughter_crying_metric | qwen2_laughter_crying_metric | Qwen2 Audio | paper |
| 42 | x | Qwen2 Interaction Patterns - Overlapping Speech | qwen2_overlapping_speech_metric | qwen2_overlapping_speech_metric | Qwen2 Audio | paper |
| 43 | x | Qwen2 Recording Environment - Background | qwen2_speech_background_environment_metric | qwen2_speech_background_environment_metric | Qwen2 Audio | paper |
| 44 | x | Qwen2 Recording Environment - Quality | qwen2_recording_quality_metric | qwen2_recording_quality_metric | Qwen2 Audio | paper |
| 45 | x | Qwen2 Recording Environment - Channel Type | qwen2_channel_type_metric | qwen2_channel_type_metric | Qwen2 Audio | paper |
| 46 | x | Qwen2.5-Omni Speech and Singing Characteristics | qwen_omni_{sub_metrics}, qwen_omni_{sub_metrics}_metric | qwen_omni_{sub_metrics} | Qwen2.5-Omni | - |
| 47 | x | Dimensional Emotion | emo_vad | arousal_emo_vad, valence_emo_vad, dominance_emo_vad | w2v2-how-to | paper |
| 48 | x | Uni-VERSA (Versatile Speech Assessment with a Unified Framework) | universa, universa_noref, universa_audioref, universa_textref, universa_fullref | universa_{sub_metrics} | Uni-VERSA | paper |
| 49 | | ARECHO (Audio Reference Echo Cancellation and Codec Quality Assessment) - No Reference | arecho, arecho_noref | arecho_{sub_metrics} | ARECHO | paper |
| 50 | x | DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech | pseudo_mos | dnsmos_pro_bvcc | DNSMOSPro | paper |
| 51 | x | DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech | pseudo_mos | dnsmos_pro_nisqa | DNSMOSPro | paper |
| 52 | x | DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech | pseudo_mos | dnsmos_pro_vcc2018 | DNSMOSPro | paper |
| 53 | | WV-MOS (MOS score prediction by fine-tuned wav2vec2.0 model) | wvmos | wvmos | wvmos | paper |
| 54 | | SIG-MOS | sigmos | {SIGMOS_COL, SIGMOS_DISC, SIGMOS_LOUD, SIGMOS_REVERB, SIGMOS_SIG, SIGMOS_OVRL} | sigmos | paper |
| 55 | x | VQScore (Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech) | vqscore | vqscore | VQScore | paper |
| 56 | x | Singing voice MOS | pseudo_mos | singmos_pro | singmos | paper |
| 57 | | SongEval (A Benchmark Dataset for Song Aesthetics Evaluation) | songeval | {songeval_coherence, songeval_musicality, songeval_memorability, songeval_clarity, songeval_naturalness} | SongEval | paper |
| 58 | | Multivariate Probabilistic Assessment of Speech Quality | multigauss | multigauss_{mos,noi,col,dis,loud}, multigauss_covariance | MultiGauss | paper |