Required only for pymss/MSST vocal separation
July 22, 2026 · View on GitHub
Retrieval-based-Voice-Conversion-WebUI
シンプルで使いやすい声質変換/ボイスチェンジャーフレームワーク。更新日誌 | よくある質問 | AutoDL·5 円で AI 歌手をトレーニング | 対照実験記録 | オンラインデモ
English | 中文简体 | 日本語 | 한국어 (韓國語) | Français | Türkçe | Português
デモ動画はこちらでご覧ください。
RVC によるリアルタイム音声変換: w-okada/voice-changer
著作権侵害を心配することなく使用できるように、基底モデルは約 50 時間の高品質なオープンソースデータセットで訓練されています。
RVCv3 の基底モデルルをご期待ください。より大きなパラメータ、より大きなデータ、より良い効果を提供し、基本的に同様の推論速度を維持しながら、トレーニングに必要なデータ量はより少なくなります。
| トレーニングと推論インターフェース | リアルタイム音声変換インターフェース |
| go-webui.bat | go-realtime_gui.bat |
| 実行したい操作を自由に選択できます。 | 既に端から端までの170msの遅延を実現しました。ASIO入出力デバイスを使用すれば、端から端までの90msの遅延を達成できますが、ハードウェアドライバーのサポートに非常に依存しています。 |
はじめに
本リポジトリには下記の特徴があります。
- Top1 検索を用いることで、生の特徴量を訓練用データセット特徴量に変換し、トーンリーケージを削減します。
- 比較的貧弱な GPU でも、高速かつ簡単に訓練できます。
- 少量のデータセットからでも、比較的良い結果を得ることができます。(10 分以上のノイズの少ない音声を推奨します。)
- モデルを融合することで、音声を混ぜることができます。(ckpt processing タブの、ckpt merge を使用します。)
- 使いやすい WebUI。
- pymss/MSST Model も含んでいるため、人の声と BGM を素早く分離できます。
- 最先端の人間の声のピッチ抽出アルゴリズム InterSpeech2023-RMVPEを使用して無声音問題を解決します。効果は最高(著しく)で、crepe_full よりも速く、リソース使用が少ないです。
- A カードと I カードの加速サポート
私たちのデモビデオをチェックしてください!
環境構築
このブランチは Python 3.12 x64 を対象としています。すべてのコマンドはリポジトリのルートで実行してください。Ubuntu 24.04 x86_64 を推奨します。
Ubuntu 24.04
sudo apt update
sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2
python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip setuptools wheel
Windows
Python 3.12 x64 をインストールし、仮想環境を作成します。
py -3.12 -m venv .venv
.venv\Scripts\activate
python -m pip install --upgrade pip setuptools wheel
ハードウェア別の依存関係
| ハードウェア | インストール方法 |
|---|---|
| CPU、AMD、Intel | requirments_cpu_py312.txt を使用。Windows は DirectML、Linux は CPU を使用 |
| NVIDIA RTX 50 シリーズ | CUDA 12.8 版 Torch を先にインストールし、その後 requirments_cu128_py312.txt |
| RTX 50 シリーズより前の NVIDIA | CUDA 11.8 版 Torch を先にインストールし、その後 requirments_cu118_py312.txt |
CPU、AMD、Intel
python -m pip install -r requirments_cpu_py312.txt
NVIDIA RTX 50 シリーズ:2 段階
python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 \
--index-url https://download.pytorch.org/whl/cu128 \
--extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu128_py312.txt
RTX 50 シリーズより前の NVIDIA:2 段階
python -m pip install torch==2.7.1+cu118 torchaudio==2.7.1+cu118 \
--index-url https://download.pytorch.org/whl/cu118 \
--extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu118_py312.txt
Torch と CUDA を確認します。
python -c "import torch; print('torch:', torch.__version__); print('cuda:', torch.version.cuda); print('cuda available:', torch.cuda.is_available())"
パッケージのダウンロード元
3 つの requirments_*.txt の先頭にダウンロード元があります。公式の配布元を使用する場合は --index-url と --extra-index-url だけを置き換え、バージョン、CUDA 接尾辞、2 段階の順序は維持してください。
| Default mirror | Official source |
|---|---|
https://mirrors.pku.edu.cn/pypi/simple | https://pypi.org/simple |
https://mirrors.nju.edu.cn/pytorch/whl/cpu | https://download.pytorch.org/whl/cpu |
https://mirrors.nju.edu.cn/pytorch/whl/cu118 | https://download.pytorch.org/whl/cu118 |
https://mirrors.nju.edu.cn/pytorch/whl/cu128 | https://download.pytorch.org/whl/cu128 |
モデルと実行ディレクトリ
WebUI は実行ディレクトリを自動作成します。Hugging Face モデルリポジトリからモデルをダウンロードし、次の構成を維持してください。
assets/
├── hubert_base/
│ ├── config.json
│ ├── preprocessor_config.json
│ └── pytorch_model.bin
├── rmvpe/rmvpe.pt
├── pretrained/
├── pretrained_v2/
├── pymss_weights/
├── weights/ # user RVC .pth models
└── indices/ # user .index files
logs/
└── mute/ # training silence samples
# Exact paths used by the code
assets/hubert_base/config.json
assets/hubert_base/preprocessor_config.json
assets/hubert_base/pytorch_model.bin
assets/rmvpe/rmvpe.pt
assets/pretrained/*.pth
assets/pretrained_v2/*.pth
assets/pymss_weights/*
assets/weights/*.pth
assets/indices/*.index
logs/mute/*
モデルのダウンロード
python -m pip install --upgrade huggingface_hub
# Required for inference and feature extraction
hf download lj1995/VoiceConversionWebUI --revision main \
--include "hubert_base/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \
--local-dir assets/rmvpe
# Required for v1/v2 training
hf download lj1995/VoiceConversionWebUI --revision main \
--include "pretrained/*" "pretrained_v2/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI mute.zip --revision main \
--local-dir .model-downloads
python -m zipfile -e .model-downloads/mute.zip logs
# Required only for pymss/MSST vocal separation
hf download lj1995/VoiceConversionWebUI --revision main \
--include "pymss_weights/*" --local-dir assets
Windows の AMD/Intel DirectML 環境では、さらに次のファイルが必要です。
hf download lj1995/VoiceConversionWebUI rmvpe.onnx --revision main \
--local-dir assets/rmvpe
FFmpeg
上記の Ubuntu コマンドで FFmpeg がインストールされます。Windows では次のファイルをリポジトリのルートに配置します。
WebUI の起動
python webui.py
画面のない Ubuntu サーバー:
python webui.py --noautoopen
既定のポートは 7865 です。.pth モデルは assets/weights/、.index ファイルは assets/indices/ に配置します。
参考プロジェクト
- ContentVec
- VITS
- HIFIGAN
- Gradio
- FFmpeg
- Ultimate Vocal Remover
- pymss-project/pymss
- audio-slicer
- Vocal pitch extraction:RMVPE