Models / lorebianchi98 / Talk2DINO ViT-B

Talk2DINO ViT-B

JSON →
multimodal

A vision-language model for referring segmentation using DINOv2 ViT-B backbone.

imagetextvision
Specs
Context & limits
context window
max output
Lifecycle
Dates
released2024-03-01
Resources