Installation

May 15, 2026 ยท View on GitHub

The project is based on Python and PyTorch. We usually run experiments with multi-GPU training.

Tested runtime:

  • Python 3.12.3
  • PyTorch 2.8.0+cu128

๐Ÿ“ฅ Clone the Git repo

$ https://github.com/yyliu01/AuralSAM2
$ cd AuralSAM2

๐Ÿงฉ Install dependencies

  1. create conda env from yaml
$ conda env create -f docs/auralsam2.yml
  1. activate env
$ conda activate auralsam2
  1. install PyTorch (recommended: match tested runtime)
# CUDA 12.8 (tested):
$ pip install torch==2.8.0 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
  1. install python packages (if needed)
$ pip install -r docs/requirements.txt

๐Ÿ—‚๏ธ Prepare dataset

AVSBench (avs.code)

  1. download and prepare AVSBench under repository root.
  2. ensure the dataset root path is:
    • AVSBench/
    • AVSBench/avss_index/metadata.csv (and subset folders v1s/, v1m/, v2/)

Ref-AVS (ref-avs.code)

  1. download and prepare the Ref-AVS (REFAVS) dataset under repository root.
  2. ensure the dataset root path is:
    • REFAVS/
    • REFAVS/metadata.csv (splits: train, test_s, test_u, test_n)

Checkpoints (shared)

Prepare under repository root:

  • ckpts/sam_ckpts/sam2_hiera_large.pt
  • ckpts/vggish-10086976.pth

๐Ÿ—๏ธ Workspace structure

AuralSAM2/
โ”œโ”€โ”€ avs.code/
โ”‚   โ”œโ”€โ”€ v1s.code/
โ”‚   โ”œโ”€โ”€ v1m.code/
โ”‚   โ””โ”€โ”€ v2.code/
โ”œโ”€โ”€ ref-avs.code/
โ”œโ”€โ”€ scripts/
โ”‚   โ”œโ”€โ”€ run_avs_train.sh
โ”‚   โ””โ”€โ”€ run_ref_train.sh
โ”œโ”€โ”€ AVSBench/
โ”‚   โ”œโ”€โ”€ avss_index
โ”‚   โ”‚   โ”œโ”€โ”€ metadata.csv
โ”‚   โ”‚   โ”œโ”€โ”€ metadata_v1m_man.csv
โ”‚   โ”‚   โ””โ”€โ”€ metadata_v2_man.csv
โ”‚   โ”œโ”€โ”€ v1m
โ”‚   โ”‚   โ”œโ”€โ”€ 01uIJMwnUvA_0
โ”‚   โ”‚   โ”œโ”€โ”€ 0WxgIKuetYI_0
โ”‚   โ”‚   ... (419 more)
โ”‚   โ”œโ”€โ”€ v1s
โ”‚   โ”‚   โ”œโ”€โ”€ --FenyW2i_4_5000_10000
โ”‚   โ”‚   โ”œโ”€โ”€ --ZHUMfueO0_5000_10000
โ”‚   โ”‚   ... (4927 more)
โ”‚   โ””โ”€โ”€ v2
โ”‚       โ”œโ”€โ”€ --KCIeTv6PM_14000_24000
โ”‚       โ”œโ”€โ”€ --iSerV5DbY_68000_78000
โ”‚       ... (5995 more)
โ”œโ”€โ”€ REFAVS/
โ”‚   โ”œโ”€โ”€ gt_mask
โ”‚   โ”‚   โ”œโ”€โ”€ --KCIeTv6PM_14000_24000
โ”‚   โ”‚   โ”œโ”€โ”€ --iSerV5DbY_68000_78000
โ”‚   โ”‚   ... (~4000 more)
โ”‚   โ”œโ”€โ”€ media
โ”‚   โ”‚   โ”œโ”€โ”€ --KCIeTv6PM_14000_24000
โ”‚   โ”‚   โ”œโ”€โ”€ --iSerV5DbY_68000_78000
โ”‚   โ”‚   ... (~4300 more)
โ”‚   โ””โ”€โ”€ metadata.csv
โ”œโ”€โ”€ ckpts/
โ”‚   โ”œโ”€โ”€ sam_ckpts/
โ”‚   โ”‚   โ””โ”€โ”€ sam2_hiera_large.pt
โ”‚   โ””โ”€โ”€ vggish-10086976.pth
โ””โ”€โ”€ docs/
    โ”œโ”€โ”€ installation.md
    โ”œโ”€โ”€ before_start.md
    โ”œโ”€โ”€ requirements.txt
    โ””โ”€โ”€ auralsam2.yml

๐Ÿ“ Notes

  • use docs/before_start.md for training and inference commands.
  • if wandb is not needed, disable online logging in your config.