Models / laion / CLAP HTSAT Fused

CLAP HTSAT Fused

JSON →
multimodal

A contrastive language-audio pretraining model using HTSAT audio encoder, enabling zero-shot audio classification and retrieval.

audiotext
Specs
Context & limits
context window
max output
Lifecycle
Dates
released2023-03-01
Resources