Required only for pymss/MSST vocal separation

July 22, 2026 · View on GitHub

Retrieval-based-Voice-Conversion-WebUI

Un framework simple et facile à utiliser pour la conversion du timbre vocal / le changement de voix.

madewithlove


Licence Huggingface

Journal de mise à jour | FAQ | AutoDL·Formation d'un chanteur AI pour 5 centimes | Enregistrement des expériences comparatives | Démonstration en ligne


English | 中文简体 | 日本語 | 한국어 (韓國語) | Français | Turc | Português

Cliquez ici pour voir notre vidéo de démonstration !

Conversion vocale en temps réel avec RVC : w-okada/voice-changer

Le modèle de base est formé avec près de 50 heures de données VCTK de haute qualité et open source. Aucun souci concernant les droits d'auteur, n'hésitez pas à l'utiliser.

Attendez-vous au modèle de base RVCv3 : plus de paramètres, plus de données, de meilleurs résultats, une vitesse d'inférence presque identique, et nécessite moins de données pour la formation.

Introduction

Ce dépôt a les caractéristiques suivantes :

  • Utilise le top1 pour remplacer les caractéristiques de la source d'entrée par les caractéristiques de l'ensemble d'entraînement pour éliminer les fuites de timbre vocal.
  • Peut être formé rapidement même sur une carte graphique relativement moins performante.
  • Obtient de bons résultats même avec peu de données pour la formation (il est recommandé de collecter au moins 10 minutes de données vocales avec un faible bruit de fond).
  • Peut changer le timbre vocal en fusionnant des modèles (avec l'aide de l'onglet ckpt-merge).
  • Interface web simple et facile à utiliser.
  • Peut appeler le modèle pymss/MSST pour séparer rapidement la voix et l'accompagnement.
  • Utilise l'algorithme de pitch vocal le plus avancé InterSpeech2023-RMVPE pour éliminer les problèmes de voix muette. Meilleurs résultats, plus rapide que crepe_full, et moins gourmand en ressources.
  • Les systèmes AMD/Intel utilisent les dépendances CPU ; Windows peut utiliser DirectML et Linux utilise le CPU.

Configuration de l'environnement

Cette branche cible Python 3.12 x64. Exécutez toutes les commandes depuis la racine du dépôt. Ubuntu 24.04 x86_64 est recommandé.

Ubuntu 24.04

sudo apt update
sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2

python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip setuptools wheel

Windows

Installez Python 3.12 x64, puis créez un environnement virtuel :

py -3.12 -m venv .venv
.venv\Scripts\activate
python -m pip install --upgrade pip setuptools wheel

Choisir les dépendances selon le matériel

MatérielInstallation
CPU, AMD, IntelUtiliser requirments_cpu_py312.txt ; Windows peut utiliser DirectML, Linux utilise le CPU
NVIDIA RTX série 50Installer d'abord Torch CUDA 12.8, puis requirments_cu128_py312.txt
NVIDIA antérieure à la série RTX 50Installer d'abord Torch CUDA 11.8, puis requirments_cu118_py312.txt

CPU, AMD, Intel

python -m pip install -r requirments_cpu_py312.txt

NVIDIA RTX série 50 : installation en deux étapes

python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 \
  --index-url https://download.pytorch.org/whl/cu128 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu128_py312.txt

NVIDIA antérieure à la série RTX 50 : installation en deux étapes

python -m pip install torch==2.7.1+cu118 torchaudio==2.7.1+cu118 \
  --index-url https://download.pytorch.org/whl/cu118 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu118_py312.txt

Vérifiez Torch et CUDA :

python -c "import torch; print('torch:', torch.__version__); print('cuda:', torch.version.cuda); print('cuda available:', torch.cuda.is_available())"

Sources de paquets

Les trois fichiers requirments_*.txt définissent leurs sources en haut. Pour utiliser les sources officielles, remplacez uniquement --index-url et --extra-index-url, en conservant les versions, les suffixes CUDA et l'ordre des deux étapes.

Default mirrorOfficial source
https://mirrors.pku.edu.cn/pypi/simplehttps://pypi.org/simple
https://mirrors.nju.edu.cn/pytorch/whl/cpuhttps://download.pytorch.org/whl/cpu
https://mirrors.nju.edu.cn/pytorch/whl/cu118https://download.pytorch.org/whl/cu118
https://mirrors.nju.edu.cn/pytorch/whl/cu128https://download.pytorch.org/whl/cu128

Modèles et répertoires d'exécution

Le WebUI crée automatiquement les répertoires d'exécution. Téléchargez les modèles depuis le dépôt de modèles Hugging Face et conservez cette structure :

assets/
├── hubert_base/
│   ├── config.json
│   ├── preprocessor_config.json
│   └── pytorch_model.bin
├── rmvpe/rmvpe.pt
├── pretrained/
├── pretrained_v2/
├── pymss_weights/
├── weights/        # user RVC .pth models
└── indices/        # user .index files
logs/
└── mute/           # training silence samples

# Exact paths used by the code
assets/hubert_base/config.json
assets/hubert_base/preprocessor_config.json
assets/hubert_base/pytorch_model.bin
assets/rmvpe/rmvpe.pt
assets/pretrained/*.pth
assets/pretrained_v2/*.pth
assets/pymss_weights/*
assets/weights/*.pth
assets/indices/*.index
logs/mute/*

Télécharger les modèles

python -m pip install --upgrade huggingface_hub

# Required for inference and feature extraction
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "hubert_base/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \
  --local-dir assets/rmvpe

# Required for v1/v2 training
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "pretrained/*" "pretrained_v2/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI mute.zip --revision main \
  --local-dir .model-downloads
python -m zipfile -e .model-downloads/mute.zip logs

# Required only for pymss/MSST vocal separation
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "pymss_weights/*" --local-dir assets

Les environnements Windows AMD/Intel DirectML nécessitent aussi :

hf download lj1995/VoiceConversionWebUI rmvpe.onnx --revision main \
  --local-dir assets/rmvpe

FFmpeg

La commande Ubuntu précédente installe FFmpeg. Sous Windows, placez ces fichiers à la racine du dépôt :

Démarrer le WebUI

python webui.py

Serveur Ubuntu sans interface graphique :

python webui.py --noautoopen

Le port par défaut est 7865. Placez les modèles .pth dans assets/weights/ et les fichiers .index dans assets/indices/.

Crédits

Remerciements à tous les contributeurs pour leurs efforts