README.md
January 28, 2025 ยท View on GitHub
Pretrained Model Weights and Configurations
Notes:
- For reproducibility, make sure overall batch size remains 4096 across GPUs/Nodes. Flag
accum_itercan be used. - trainer/global_step in log files refers to gradient steps with batch size 4096.
- Modify
imagenet_train_dir_pathflag in datasets_mae.py.
Finetuned Model Weights and Configurations
Notes:
- For reproducibility, make sure overall batch size remains 1024 across GPUs/Nodes. Flag
accum_itercan be used. - trainer/global_step in log files refers to gradient steps with batch size 1024.
- Modify
imagenet_train_dir_pathandimagenet_val_dir_pathflags in datasets_finetune.py.