Models / sentence-transformers / CLIP ViT-B/32 Multilingual v1

CLIP ViT-B/32 Multilingual v1

JSON →
multimodal

A multilingual vision-language embedding model that maps images and text to a shared embedding space.

textimagevision
Specs
Context & limits
context window
max output
Lifecycle
Dates
released2022-03-01
Resources