Skip to main content
Vision Transformer Lab
Experiment with state-of-the-art Vision Transformers and hybrid architectures
ViT Architecture Configuration
Model Variant
ViT-Tiny (5.7M params)
ViT-Small (22M params)
ViT-Base (86M params)
Hybrid CNN-ViT (45M params)
Patch Size
16x16
Number of Layers
12
Attention Heads
8
Hidden Dimension
192
384
768
1024
MLP Ratio
4x
Image Patches Visualization
Transformer Blocks
Self-Attention Visualization
Performance Metrics
12.6G
FLOPs
22M
Parameters
312
Images/sec
96.2%
Top-1 Acc
Attention Pattern Analysis
Run Inference
Compare Architectures
Export Model