Model Zoo

January 29, 2024 · View on GitHub

Note

  • For all the pretraining and finetuning, we adopt spaese/uniform sampling.
  • #Frame == #input_frame ×\times #crop ×\times #clip
  • #input_frame means how many frames are input for model per inference
  • #crop means spatial crops (e.g., 3 for left/right/center)
  • #clip means temporal clips (e.g., 4 means repeted sampling four clips with different start indices)

Pretraining

ModelSettingModelShellLog
UMT-B/16K710 200eckptrun.shlog
UMT-L/16K710 200eckptrun.shlog

Finetuning

K710

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT8x3x481.9ckptrun.shlog
UMT-L/16K710 PT8x3x486.0ckptrun.shlog

K400

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT+FT8x3x487.4ckptrun.shlog
UMT-L/16K710 PT+FT8x3x490.3ckptrun.shlog
UMT-L/16K710 PT+FT16x3x490.6ckptrun.shlog

K600

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT+FT8x3x487.8ckptrun.shlog
UMT-L/16K710 PT+FT8x3x490.4ckptrun.shlog
UMT-L/16K710 PT+FT16x3x490.5ckptrun.shlog

K700

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT+FT8x3x478.5ckptrun.shlog
UMT-L/16K710 PT+FT8x3x483.2ckptrun.shlog
UMT-L/16K710 PT+FT16x3x483.6ckptrun.shlog

MiT V1

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT+FT, K400 FT8x3x444.6ckptrun.shlog
UMT-L/16 384↑K710 PT+FT, K400 FT8x3x445.5ckptrun.shlog
UMT-L/16K710 PT+FT, K400 FT8x3x448.0ckptrun.shlog
UMT-L/16 384↑K710 PT+FT, K400 FT8x3x448.7ckptrun.shlog

SthSth V2

ModelSetting#FrameTop-1ModelShellLog
UMT-B/16K710 PT8x3x470.8ckptrun.shlog
UMT-L/16K710 PT8x3x474.7ckptrun.shlog

AVA v2.2

See action_detection.