A contrastive language-audio pretraining model using HTSAT audio encoder, enabling zero-shot audio classification and retrieval.