publications
2026
- StreamAlign: Streaming Text-Aligned Speech TokenizationIn EMNLP 2026 Findings
2025
- In TTIC Summer Workshop on Foundations of Speech and Audio Foundation Models 2025
- DExTER: Can Omnimodal Language Models Resolve Audio-Visual Deixis?Manuscript under review
2024
- In DCASE2024 Challenge