Required only for pymss/MSST vocal separation

July 22, 2026 · View on GitHub

Retrieval-based-Voice-Conversion-WebUI

シンプルで使いやすい声質変換/ボイスチェンジャーフレームワーク。

madewithlove


Licence Huggingface

更新日誌 | よくある質問 | AutoDL·5 円で AI 歌手をトレーニング | 対照実験記録 | オンラインデモ

English | 中文简体 | 日本語 | 한국어 (韓國語) | Français | Türkçe | Português

デモ動画はこちらでご覧ください。

RVC によるリアルタイム音声変換: w-okada/voice-changer

著作権侵害を心配することなく使用できるように、基底モデルは約 50 時間の高品質なオープンソースデータセットで訓練されています。

RVCv3 の基底モデルルをご期待ください。より大きなパラメータ、より大きなデータ、より良い効果を提供し、基本的に同様の推論速度を維持しながら、トレーニングに必要なデータ量はより少なくなります。

トレーニングと推論インターフェース リアルタイム音声変換インターフェース
go-webui.bat go-realtime_gui.bat
実行したい操作を自由に選択できます。 既に端から端までの170msの遅延を実現しました。ASIO入出力デバイスを使用すれば、端から端までの90msの遅延を達成できますが、ハードウェアドライバーのサポートに非常に依存しています。

はじめに

本リポジトリには下記の特徴があります。

  • Top1 検索を用いることで、生の特徴量を訓練用データセット特徴量に変換し、トーンリーケージを削減します。
  • 比較的貧弱な GPU でも、高速かつ簡単に訓練できます。
  • 少量のデータセットからでも、比較的良い結果を得ることができます。(10 分以上のノイズの少ない音声を推奨します。)
  • モデルを融合することで、音声を混ぜることができます。(ckpt processing タブの、ckpt merge を使用します。)
  • 使いやすい WebUI。
  • pymss/MSST Model も含んでいるため、人の声と BGM を素早く分離できます。
  • 最先端の人間の声のピッチ抽出アルゴリズム InterSpeech2023-RMVPEを使用して無声音問題を解決します。効果は最高(著しく)で、crepe_full よりも速く、リソース使用が少ないです。
  • A カードと I カードの加速サポート

私たちのデモビデオをチェックしてください!

環境構築

このブランチは Python 3.12 x64 を対象としています。すべてのコマンドはリポジトリのルートで実行してください。Ubuntu 24.04 x86_64 を推奨します。

Ubuntu 24.04

sudo apt update
sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2

python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip setuptools wheel

Windows

Python 3.12 x64 をインストールし、仮想環境を作成します。

py -3.12 -m venv .venv
.venv\Scripts\activate
python -m pip install --upgrade pip setuptools wheel

ハードウェア別の依存関係

ハードウェアインストール方法
CPU、AMD、Intelrequirments_cpu_py312.txt を使用。Windows は DirectML、Linux は CPU を使用
NVIDIA RTX 50 シリーズCUDA 12.8 版 Torch を先にインストールし、その後 requirments_cu128_py312.txt
RTX 50 シリーズより前の NVIDIACUDA 11.8 版 Torch を先にインストールし、その後 requirments_cu118_py312.txt

CPU、AMD、Intel

python -m pip install -r requirments_cpu_py312.txt

NVIDIA RTX 50 シリーズ:2 段階

python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 \
  --index-url https://download.pytorch.org/whl/cu128 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu128_py312.txt

RTX 50 シリーズより前の NVIDIA:2 段階

python -m pip install torch==2.7.1+cu118 torchaudio==2.7.1+cu118 \
  --index-url https://download.pytorch.org/whl/cu118 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu118_py312.txt

Torch と CUDA を確認します。

python -c "import torch; print('torch:', torch.__version__); print('cuda:', torch.version.cuda); print('cuda available:', torch.cuda.is_available())"

パッケージのダウンロード元

3 つの requirments_*.txt の先頭にダウンロード元があります。公式の配布元を使用する場合は --index-url--extra-index-url だけを置き換え、バージョン、CUDA 接尾辞、2 段階の順序は維持してください。

Default mirrorOfficial source
https://mirrors.pku.edu.cn/pypi/simplehttps://pypi.org/simple
https://mirrors.nju.edu.cn/pytorch/whl/cpuhttps://download.pytorch.org/whl/cpu
https://mirrors.nju.edu.cn/pytorch/whl/cu118https://download.pytorch.org/whl/cu118
https://mirrors.nju.edu.cn/pytorch/whl/cu128https://download.pytorch.org/whl/cu128

モデルと実行ディレクトリ

WebUI は実行ディレクトリを自動作成します。Hugging Face モデルリポジトリからモデルをダウンロードし、次の構成を維持してください。

assets/
├── hubert_base/
│   ├── config.json
│   ├── preprocessor_config.json
│   └── pytorch_model.bin
├── rmvpe/rmvpe.pt
├── pretrained/
├── pretrained_v2/
├── pymss_weights/
├── weights/        # user RVC .pth models
└── indices/        # user .index files
logs/
└── mute/           # training silence samples

# Exact paths used by the code
assets/hubert_base/config.json
assets/hubert_base/preprocessor_config.json
assets/hubert_base/pytorch_model.bin
assets/rmvpe/rmvpe.pt
assets/pretrained/*.pth
assets/pretrained_v2/*.pth
assets/pymss_weights/*
assets/weights/*.pth
assets/indices/*.index
logs/mute/*

モデルのダウンロード

python -m pip install --upgrade huggingface_hub

# Required for inference and feature extraction
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "hubert_base/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \
  --local-dir assets/rmvpe

# Required for v1/v2 training
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "pretrained/*" "pretrained_v2/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI mute.zip --revision main \
  --local-dir .model-downloads
python -m zipfile -e .model-downloads/mute.zip logs

# Required only for pymss/MSST vocal separation
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "pymss_weights/*" --local-dir assets

Windows の AMD/Intel DirectML 環境では、さらに次のファイルが必要です。

hf download lj1995/VoiceConversionWebUI rmvpe.onnx --revision main \
  --local-dir assets/rmvpe

FFmpeg

上記の Ubuntu コマンドで FFmpeg がインストールされます。Windows では次のファイルをリポジトリのルートに配置します。

WebUI の起動

python webui.py

画面のない Ubuntu サーバー:

python webui.py --noautoopen

既定のポートは 7865 です。.pth モデルは assets/weights/.index ファイルは assets/indices/ に配置します。

参考プロジェクト

すべての貢献者の努力に感謝します