Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation Haoran Wang, Jinchuan Tian, Shinji Watanabe, Siddhant Arora Published: 2026-07-02Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-07-02 | eess.AS | ai-safety, eessas, preprint | E9 / R5 (98%) | - |
| Improving multichannel speech enhancement through accurate room-acoustic simulations Alessia Milo, Daniel Gert Nielsen, Finnur Pind, Georg G枚tz Published: 2026-06-30Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-30 | eess.AS | ai-safety, eessas, preprint | E8 / R5 (96%) | - |
| Detecting Audio Deepfakes on the Edge:Lightweight SSL-Based Detection in a Browser Plugin Dan Oneata, Horia Cucu, Nicolas M. Muller, Octavian Pascu Published: 2026-06-29Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-29 | eess.AS | ai-safety, eessas, preprint | E8 / R4 (97%) | - |
| Semi-Supervised Sound Event Detection with Conditional Mixup and Embedding-Level Contrastive Loss Nian Shao, Xian Li, Xiaofei Li Published: 2026-06-29Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-29 | eess.AS | ai-safety, eessas, preprint | E9 / R6 (98%) | - |
| Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant Anna-Mariia Vitkovska, Daria Hemmerling, Kamil Kwarciak, Leonid Pavlovskyi Published: 2026-06-23Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-23 | eess.AS | ai-safety, eessas, preprint | E8 / R6 (90%) | - |
| Cross-Dataset, Age, and Gender Generalization: A Comprehensive Analysis of Fine-Tuning Strategies for Low-Resource Children's ASR Hemant Kumar Kathania, Mikko Kurimo, Paban Sapkota, Shrikanth Narayanan Published: 2026-06-18Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-18 | eess.AS | ai-safety, eessas, preprint | E8 / R6 (96%) | - |
| Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation Hemant Kumar Kathania, Paban Sapkota, Shrikanth Narayanan, Sudarsana Reddy Kadiri Published: 2026-06-18Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-18 | eess.AS | ai-safety, eessas, preprint | E11 / R7 (96%) | - |
| Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation Rostislav Makarov, Timo Gerkmann Published: 2026-06-18Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-18 | eess.AS | ai-safety, eessas, preprint | E7 / R4 (97%) | - |
| Systematic Study of Dysarthric Speech Recognition: Spectral Features and Acoustic Models Hemant Kumar Kathania, Mikko Kurimo, Paban Sapkota, Shrikanth Narayanan Published: 2026-06-18Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-18 | eess.AS | ai-safety, eessas, preprint | E11 / R5 (98%) | - |
| Augmenting Dysarthric Speech Severity Assessment with MOS Supervision Chao Zhang, Kaimeng Jia, Minzhu Tu, Siyin Wang Published: 2026-06-17Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-06-17 | eess.AS | ai-safety, eessas, preprint | E8 / R4 (96%) | - |
| Explainable AI in Speaker Recognition -- Making Latent Representations Understandable Mark D. Plumbley, Wenwu Wang, Yanze Xu Published: 2026-04-25Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-25 | eess.AS | ai-safety, eessas, preprint | E8 / R5 (98%) | - |
| UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions Cheng Gong, Chen Zhang, Chunyu Qiang, Jianwu Dang Published: 2026-04-24Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-24 | eess.AS | ai-safety, eessas, preprint | E8 / R5 (99%) | - |
| Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization Andrei Andrusenko, Boris Ginsburg, Lilit Grigoryan, Nune Tadevosyan Published: 2026-04-21Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-21 | eess.AS | ai-safety, eessas, preprint | E8 / R4 (98%) | - |
| X-VC: Zero-shot Streaming Voice Conversion in Codec Space Kai Yu, Kele Xu, Qinyuan Chen, Qixi Zheng Published: 2026-04-14Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-14 | eess.AS | ai-safety, eessas, preprint | E4 / R3 (94%) | - |
| PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing Chaewoon Bang, Changi Hong, Dayeon Gu, Do Hyun Lee Published: 2026-04-10Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-10 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing Chaewoon Bang, Changi Hong, Dayeon Gu, Do Hyun Lee Published: 2026-04-10Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-10 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs Chenghao Wang, Jing Peng, Junjie Li, Kai Yu Published: 2026-04-09Area: eess.ASCitations: - Tags: ai-safety, alignment-training, eessas, preprint | 2026-04-09 | eess.AS | ai-safety, alignment-training, eessas, preprint | E5 / R3 (94%) | - |
| ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining Anuj Diwan, David Harwath, Eunsol Choi Published: 2026-03-30Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-30 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition Jun Zhou, Keqin Li, Tao Meng, Wei Ai Published: 2026-03-27Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-27 | eess.AS | ai-safety, eessas, preprint | E6 / R4 (96%) | - |
| HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection Chenxu Guo, Cheol Jun Cho, Emma Yang, Giada Antonicelli Published: 2026-03-25Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-25 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers Adi Arbel, Ari Frummer, Helin Wang, Jesus Villalba Published: 2026-03-23Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-23 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech? Ashishkumar P. Gudmalwar, Lokesh Kumar, Nirmesh Shah, Pankaj Wasnik Published: 2026-03-20Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-20 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (97%) | - |
| Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations Berlin Chen, Cheng-Yeh Yang, Chien-Chun Wang, Hsin-Min Wang Published: 2026-03-17Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-17 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| Shared Representation Learning for Reference-Guided Targeted Sound Detection Adarsh Arigala, B. R. Dilleswari, Shubham Gupta, Sri Rama Murty Kodukula Published: 2026-03-17Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-17 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (97%) | - |
| Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech Chang D. Yoo, Jaesung Bae, Mark Hasegawa-Johnson, Minje Kim Published: 2026-03-16Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-16 | eess.AS | ai-safety, eessas, preprint | E6 / R3 (96%) | - |
| Spectrogram features for audio and speech analysis Donny Soh, Haoyu Song, Huy Phan, Ian McLoughlin Published: 2026-03-16Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-16 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| Controllable Accent Normalization via Discrete Diffusion Haizhou Li, Qibing Bai, Shuai Wang, Tom Ko Published: 2026-03-15Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-15 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| Affect Decoding in Phonated and Silent Speech Production from Surface EMG Bj枚rn W. Schuller, Jihwan Lee, Kleanthis Avramidis, Monica Gonzalez-Machorro Published: 2026-03-12Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-12 | eess.AS | ai-safety, eessas, preprint | E4 / R3 (95%) | - |
| G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition Dezhu Xu, Duo Ma, Haoyu Li, Jing Peng Published: 2026-03-11Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-11 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models Eng Siong Chng, Jiajun Deng, Kong Aik Lee, Nikita Kuzmin Published: 2026-03-09Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-09 | eess.AS | ai-safety, eessas, preprint | E6 / R4 (94%) | - |