installation.md

May 14, 2025 · View on GitHub

Flash-TTS 安装指南

本文档详细介绍 Flash-TTS 推理引擎的安装与部署流程,包括环境要求、模型权重下载及依赖安装步骤。


环境要求

  • Python:3.10 及以上版本

  • 操作系统:Linux x86_64、macOS,或 Windows(推荐使用 WSL2)

  • 必备依赖

    • fastapi
    • 至少一种推理后端:vllmsglangllama-cpp-pythonmlx-lmtensorrt-llm

模型权重下载

模型huggingfacemodelscopegguf
Spark-TTSSparkAudio/Spark-TTS-0.5BSparkAudio/Spark-TTS-0.5BSparkTTS-LLM-GGUF
Orpheus-TTScanopylabs/orpheus-3b-0.1-ft & hubertsiuzdak/snac_24khzcanopylabs/orpheus-3b-0.1-ftorpheus-gguf
Orpheus-TTS(Multilingual)orpheus-multilingual-research-release & hubertsiuzdak/snac_24khz--
MegaTTS3ByteDance/MegaTTS3--

安装依赖

1. 安装 PyTorch

请前往 PyTorch 官网 获取适配您系统和 CUDA 版本的安装命令。 例如,针对 CUDA 12.4:

pip install torch==2.6.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124

2. 安装 Flash-TTS

  • 使用 pip 安装:
pip install flashtts
  • 或通过源码安装:
git clone https://github.com/HuiResearch/FlashTTS.git
cd FlashTTS
pip install .

Windows 用户提示: 若在安装 WeTextProcessing 时遇到编译错误,可先通过 Conda 安装依赖:

conda install -c conda-forge pynini==2.1.6
pip install WeTextProcessing==1.0.4.1

安装推理后端(按需选择)

vLLM (推荐)

  • 需版本 ≥ 0.7.2。针对 CUDA 12.4:
pip install vllm

llama-cpp-python

pip install llama-cpp-python
  • 如果使用 GGUF 格式权重,请将 model.gguf 文件放入 checkpoints/<model>/LLM/ 路径下。
  • 若需转换权重,可参考以下命令:
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
python convert_hf_to_gguf.py Spark-TTS-0.5B/LLM --outfile Spark-TTS-0.5B/LLM/model.gguf

sglang

pip install sglang

mlx-lm(仅支持 Apple Silicon)

pip install mlx-lm

TensorRT-LLM

以 CUDA 12.4 为例:

pip install tensorrt-llm --extra-index-url https://pypi.nvidia.com --extra-index-url https://download.pytorch.org/whl/cu124

注意事项:

  • 当前 TensorRT-LLM Windows 仅支持 Python 3.10。
  • Windows环境最新支持版本:0.16.0(截止 2025-05-05)
  • 详情见:NVIDIA PyPI 仓库

安装验证:

python -c "import tensorrt_llm; print(tensorrt_llm.__version__)"
转换 LLM 权重为 TensorRT Engine
  1. 参考官方模型转换文档: https://github.com/NVIDIA/TensorRT-LLM/tree/main/examples/models/core/

  2. 选择与所用模型匹配的类型(例如:Spark-TTS 使用 qwen)。

  3. 转换完成后,将输出的 Engine 文件夹重命名为 tensorrt-engine,并移动至模型路径中,例如:

Spark-TTS-0.5B/LLM/tensorrt-engine

此后即可在 Flash-TTS 中加载该模型进行推理。


环境支持矩阵

推理后端Linux ✅Windows ✅macOS ✅说明
vllm仅支持 Linux,需 CUDA 环境
sglang仅支持 Linux,适配大多数 GPU
tensorrt-llm⚠️Windows 仅支持 Python 3.10,版本 ≤ 0.16.0
llama-cpp支持 GGUF 权重格式,跨平台
mlx-lm仅支持 macOS(Apple Silicon)
torch核心依赖,所有平台均支持

⚠️ 说明

  • Windows 下推荐使用 WSL2 获取完整 Linux 功能支持。
  • 若在 macOS 使用非 Apple Silicon 芯片,mlx-lm 将不可用。