Model Explorer

Explore and compare multimodal model architectures

Models

Filter

CLIP ViT-L/14

Contrastive Language-Image Pre-training

Multimodal
428M
Parameters
768
Embedding Dim
89.1 GFLOPs
Compute
45ms
Latency (GPU)

Architecture

Vision Encoder:ViT-L/14
Text Encoder:Transformer
Layers:24
Heads:16
Input Resolution:224×224

Capabilities

Zero-shot Image-Text Retrieval Classification

Benchmark Performance

Size vs Accuracy

Layer Visualization

Usage Example

import torch
from transformers import CLIPProcessor, CLIPModel

model = CLIPModel.from_pretrained("openai/clip-vit-large-patch14")
processor = CLIPProcessor.from_pretrained("openai/clip-vit-large-patch14")

# Encode image and text
inputs = processor(
    text=["a cat", "a dog"],
    images=image,
    return_tensors="pt",
    padding=True
)

outputs = model(**inputs)
logits_per_image = outputs.logits_per_image
probs = logits_per_image.softmax(dim=1)