Required only for pymss/MSST vocal separation
July 22, 2026 · View on GitHub
Retrieval-based-Voice-Conversion-WebUI
Un framework simple et facile à utiliser pour la conversion du timbre vocal / le changement de voix.Journal de mise à jour | FAQ | AutoDL·Formation d'un chanteur AI pour 5 centimes | Enregistrement des expériences comparatives | Démonstration en ligne
English | 中文简体 | 日本語 | 한국어 (韓國語) | Français | Turc | Português
Cliquez ici pour voir notre vidéo de démonstration !
Conversion vocale en temps réel avec RVC : w-okada/voice-changer
Le modèle de base est formé avec près de 50 heures de données VCTK de haute qualité et open source. Aucun souci concernant les droits d'auteur, n'hésitez pas à l'utiliser.
Attendez-vous au modèle de base RVCv3 : plus de paramètres, plus de données, de meilleurs résultats, une vitesse d'inférence presque identique, et nécessite moins de données pour la formation.
Introduction
Ce dépôt a les caractéristiques suivantes :
- Utilise le top1 pour remplacer les caractéristiques de la source d'entrée par les caractéristiques de l'ensemble d'entraînement pour éliminer les fuites de timbre vocal.
- Peut être formé rapidement même sur une carte graphique relativement moins performante.
- Obtient de bons résultats même avec peu de données pour la formation (il est recommandé de collecter au moins 10 minutes de données vocales avec un faible bruit de fond).
- Peut changer le timbre vocal en fusionnant des modèles (avec l'aide de l'onglet ckpt-merge).
- Interface web simple et facile à utiliser.
- Peut appeler le modèle pymss/MSST pour séparer rapidement la voix et l'accompagnement.
- Utilise l'algorithme de pitch vocal le plus avancé InterSpeech2023-RMVPE pour éliminer les problèmes de voix muette. Meilleurs résultats, plus rapide que crepe_full, et moins gourmand en ressources.
- Les systèmes AMD/Intel utilisent les dépendances CPU ; Windows peut utiliser DirectML et Linux utilise le CPU.
Configuration de l'environnement
Cette branche cible Python 3.12 x64. Exécutez toutes les commandes depuis la racine du dépôt. Ubuntu 24.04 x86_64 est recommandé.
Ubuntu 24.04
sudo apt update
sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip setuptools wheel
Windows
Installez Python 3.12 x64, puis créez un environnement virtuel :
py -3.12 -m venv .venv
.venv\Scripts\activate
python -m pip install --upgrade pip setuptools wheel
Choisir les dépendances selon le matériel
| Matériel | Installation |
|---|---|
| CPU, AMD, Intel | Utiliser requirments_cpu_py312.txt ; Windows peut utiliser DirectML, Linux utilise le CPU |
| NVIDIA RTX série 50 | Installer d'abord Torch CUDA 12.8, puis requirments_cu128_py312.txt |
| NVIDIA antérieure à la série RTX 50 | Installer d'abord Torch CUDA 11.8, puis requirments_cu118_py312.txt |
CPU, AMD, Intel
python -m pip install -r requirments_cpu_py312.txt
NVIDIA RTX série 50 : installation en deux étapes
python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 \
--index-url https://download.pytorch.org/whl/cu128 \
--extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu128_py312.txt
NVIDIA antérieure à la série RTX 50 : installation en deux étapes
python -m pip install torch==2.7.1+cu118 torchaudio==2.7.1+cu118 \
--index-url https://download.pytorch.org/whl/cu118 \
--extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu118_py312.txt
Vérifiez Torch et CUDA :
python -c "import torch; print('torch:', torch.__version__); print('cuda:', torch.version.cuda); print('cuda available:', torch.cuda.is_available())"
Sources de paquets
Les trois fichiers requirments_*.txt définissent leurs sources en haut. Pour utiliser les sources officielles, remplacez uniquement --index-url et --extra-index-url, en conservant les versions, les suffixes CUDA et l'ordre des deux étapes.
| Default mirror | Official source |
|---|---|
https://mirrors.pku.edu.cn/pypi/simple | https://pypi.org/simple |
https://mirrors.nju.edu.cn/pytorch/whl/cpu | https://download.pytorch.org/whl/cpu |
https://mirrors.nju.edu.cn/pytorch/whl/cu118 | https://download.pytorch.org/whl/cu118 |
https://mirrors.nju.edu.cn/pytorch/whl/cu128 | https://download.pytorch.org/whl/cu128 |
Modèles et répertoires d'exécution
Le WebUI crée automatiquement les répertoires d'exécution. Téléchargez les modèles depuis le dépôt de modèles Hugging Face et conservez cette structure :
assets/
├── hubert_base/
│ ├── config.json
│ ├── preprocessor_config.json
│ └── pytorch_model.bin
├── rmvpe/rmvpe.pt
├── pretrained/
├── pretrained_v2/
├── pymss_weights/
├── weights/ # user RVC .pth models
└── indices/ # user .index files
logs/
└── mute/ # training silence samples
# Exact paths used by the code
assets/hubert_base/config.json
assets/hubert_base/preprocessor_config.json
assets/hubert_base/pytorch_model.bin
assets/rmvpe/rmvpe.pt
assets/pretrained/*.pth
assets/pretrained_v2/*.pth
assets/pymss_weights/*
assets/weights/*.pth
assets/indices/*.index
logs/mute/*
Télécharger les modèles
python -m pip install --upgrade huggingface_hub
# Required for inference and feature extraction
hf download lj1995/VoiceConversionWebUI --revision main \
--include "hubert_base/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \
--local-dir assets/rmvpe
# Required for v1/v2 training
hf download lj1995/VoiceConversionWebUI --revision main \
--include "pretrained/*" "pretrained_v2/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI mute.zip --revision main \
--local-dir .model-downloads
python -m zipfile -e .model-downloads/mute.zip logs
# Required only for pymss/MSST vocal separation
hf download lj1995/VoiceConversionWebUI --revision main \
--include "pymss_weights/*" --local-dir assets
Les environnements Windows AMD/Intel DirectML nécessitent aussi :
hf download lj1995/VoiceConversionWebUI rmvpe.onnx --revision main \
--local-dir assets/rmvpe
FFmpeg
La commande Ubuntu précédente installe FFmpeg. Sous Windows, placez ces fichiers à la racine du dépôt :
Démarrer le WebUI
python webui.py
Serveur Ubuntu sans interface graphique :
python webui.py --noautoopen
Le port par défaut est 7865. Placez les modèles .pth dans assets/weights/ et les fichiers .index dans assets/indices/.
Crédits
- ContentVec
- VITS
- HIFIGAN
- Gradio
- FFmpeg
- Ultimate Vocal Remover
- pymss-project/pymss
- audio-slicer
- Extraction de la hauteur vocale : RMVPE