MODELS.md

April 30, 2022 ยท View on GitHub

Scene Parsing

Accurate Models

MethodBackboneADE20K
(mIoU)
Cityscapes
(mIoU)
COCO-Stuff
(mIoU)
Params
(M)
GFLOPs
(512x512)
GFLOPs
(1024x1024)
Weights
SegFormerMiT-B142.278.540.21416244ade
MiT-B246.581.044.62862717ade
MiT-B349.481.745.54779963ade
Light-HamVAN-S45.7--1521--
VAN-B49.6--2734--
VAN-L51.0--4655--
LawinMiT-B142.179.040.51413218-
MiT-B247.881.745.23045563-
MiT-B350.382.546.65062809-
TopFormerTopFormer-T34.6--1.40.6--
TopFormer-S37.0--3.11.2--
TopFormer-B39.2--5.11.8--
  • mIoU results are with a single scale from official papers.
  • ADE20K image size = 512x512
  • Cityscapes image size = 1024x1024
  • COCO-Stuff image size = 512x512

Real-time Models

MethodBackboneCityScapes-val
(mIoU)
CamVid
(mIoU)
Params (M)GFLOPs
(1024x2048)
Weights
BiSeNetv1ResNet-1874.868.71449-
BiSeNetv2-73.472.41821-
SFNetResNetD-1879.0-13--
DDRNetDDRNet-23slim77.874.7636city
  • mIoU results are with a single scale from official papers.
  • Cityscapes image size = 1024x2048 (except BiSeNetv1 & 2 which uses 512x1024)
  • CamVid image size = 960x720

Face Parsing

MethodBackboneHELEN-val
(mIoU)
Params
(M)
GFLOPs
(512x512)
FPS
(GTX1660ti)
Weights
BiSeNetv1ResNet-1858.501413263HELEN
BiSeNetv2-58.581815195HELEN
DDRNetDDRNet-23slim61.1165180HELEN
SFNetResNetD-1861.00143156HELEN