Skip to main navigation Skip to search Skip to main content

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

  • Panwei Ren
  • , Jinbo Hu
  • , Fang Kang
  • , Shan Liang
  • , Yin Cao*
  • *Corresponding author for this work

Research output: Chapter in Book or Report/Conference proceedingConference Proceedingpeer-review

Original languageEnglish
Title of host publicationInterspeech
Publication statusPublished - 2026

Cite this