A Vision Transformer-based AudioMAE model fine-tuned on AudioSet for audio classification.
No lifecycle dates recorded.
No resource links recorded.