Models
Filter
CLIP ViT-L/14
Contrastive Language-Image Pre-training
428M
Parameters
768
Embedding Dim
89.1 GFLOPs
Compute
45ms
Latency (GPU)
Architecture
Vision Encoder:ViT-L/14
Text Encoder:Transformer
Layers:24
Heads:16
Input Resolution:224×224
Capabilities
Zero-shot
Image-Text
Retrieval
Classification
Benchmark Performance
Size vs Accuracy
Layer Visualization
Usage Example
import torch
from transformers import CLIPProcessor, CLIPModel
model = CLIPModel.from_pretrained("openai/clip-vit-large-patch14")
processor = CLIPProcessor.from_pretrained("openai/clip-vit-large-patch14")
# Encode image and text
inputs = processor(
text=["a cat", "a dog"],
images=image,
return_tensors="pt",
padding=True
)
outputs = model(**inputs)
logits_per_image = outputs.logits_per_image
probs = logits_per_image.softmax(dim=1)