Vision Transformer Lab

Experiment with state-of-the-art Vision Transformers and hybrid architectures

ViT Architecture Configuration

16x16
12
8
4x

Image Patches Visualization

Transformer Blocks

Self-Attention Visualization

Performance Metrics

12.6G
FLOPs
22M
Parameters
312
Images/sec
96.2%
Top-1 Acc

Attention Pattern Analysis