Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 70 papers (page 1 of 3)路 80 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Color-based Emotion Representation for Speech Emotion Recognition Ryoichi Takashima, Ryotaro Nagase, Yoichi Yamashita Published: 2026-02-18Area: eess.ASCitations: 21 Tags: ai-safety, eessas, preprint | 2026-02-18 | eess.AS | ai-safety, eessas, preprint | E16 / R9 (90%) | 21 |
| Detection and Classification of Cetacean Echolocation Clicks using Image-based Object Detection Methods applied to Advanced Wavelet-based Transformations Christopher Hauer Published: 2026-02-19Area: eess.ASCitations: 58 Tags: ai-safety, eessas, preprint | 2026-02-19 | eess.AS | ai-safety, eessas, preprint | E10 / R7 (95%) | 58 |
| CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data Haizhou Li, Qibing Bai, Shuai Wang, Shuhao Shi Published: 2026-02-22Area: eess.ASCitations: 37 Tags: ai-safety, eessas, preprint | 2026-02-22 | eess.AS | ai-safety, eessas, preprint | E10 / R8 (90%) | 37 |
| CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment Hanwen Liu, Hao Huang, Saierdaer Yusuyin, Zhijian Ou Published: 2026-02-23Area: eess.ASCitations: - Tags: ai-safety, alignment-training, eessas, preprint | 2026-02-23 | eess.AS | ai-safety, alignment-training, eessas, preprint | E15 / R14 (90%) | - |
| Training-Free Intelligibility-Guided Observation Addition for Noisy ASR Changsong Liu, Eng Siong Chng, Hao Shi, Haoyang Li Published: 2026-02-24Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-02-24 | eess.AS | ai-safety, eessas, preprint | E13 / R8 (92%) | - |
| A Knowledge-Driven Approach to Music Segmentation, Music Source Separation and Cinematic Audio Source Separation Chin-Hui Lee, Chun-wei Ho, Kai Li, Sabato Marco Siniscalchi Published: 2026-02-25Area: eess.ASCitations: 48 Tags: ai-safety, eessas, preprint | 2026-02-25 | eess.AS | ai-safety, eessas, preprint | E12 / R9 (91%) | 48 |
| TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition Berlin Chen, Cheng-Yeh Yang, Chien-Chun Wang, Hsin-Min Wang Published: 2026-02-25Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-02-25 | eess.AS | ai-safety, eessas, preprint | E8 / R7 (94%) | - |
| Whisper-RIR-Mega: A Paired Clean-Reverberant Speech Benchmark for ASR Robustness to Room Acoustics Mandip Goswami Published: 2026-02-27Area: eess.ASCitations: 6 Tags: ai-safety, eessas, preprint | 2026-02-27 | eess.AS | ai-safety, eessas, preprint | E9 / R7 (95%) | 6 |
| StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation Eng Siong Chng, Kong Aik Lee, Nikita Kuzmin Published: 2026-03-06Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-06 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (98%) | - |
| Towards Lightweight Adaptation of Speech Enhancement Models in Real-World Environments Longbiao Cheng, Shih-Chii Liu Published: 2026-03-08Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-08 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models Eng Siong Chng, Jiajun Deng, Kong Aik Lee, Nikita Kuzmin Published: 2026-03-09Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-09 | eess.AS | ai-safety, eessas, preprint | E6 / R4 (94%) | - |
| G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition Dezhu Xu, Duo Ma, Haoyu Li, Jing Peng Published: 2026-03-11Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-11 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| Affect Decoding in Phonated and Silent Speech Production from Surface EMG Bj枚rn W. Schuller, Jihwan Lee, Kleanthis Avramidis, Monica Gonzalez-Machorro Published: 2026-03-12Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-12 | eess.AS | ai-safety, eessas, preprint | E4 / R3 (95%) | - |
| Controllable Accent Normalization via Discrete Diffusion Haizhou Li, Qibing Bai, Shuai Wang, Tom Ko Published: 2026-03-15Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-15 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| Something from Nothing: Data Augmentation for Robust Severity Level Estimation of Dysarthric Speech Chang D. Yoo, Jaesung Bae, Mark Hasegawa-Johnson, Minje Kim Published: 2026-03-16Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-16 | eess.AS | ai-safety, eessas, preprint | E6 / R3 (96%) | - |
| Spectrogram features for audio and speech analysis Donny Soh, Haoyu Song, Huy Phan, Ian McLoughlin Published: 2026-03-16Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-16 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| Robust Generative Audio Quality Assessment: Disentangling Quality from Spurious Correlations Berlin Chen, Cheng-Yeh Yang, Chien-Chun Wang, Hsin-Min Wang Published: 2026-03-17Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-17 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| Shared Representation Learning for Reference-Guided Targeted Sound Detection Adarsh Arigala, B. R. Dilleswari, Shubham Gupta, Sri Rama Murty Kodukula Published: 2026-03-17Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-17 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (97%) | - |
| Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech? Ashishkumar P. Gudmalwar, Lokesh Kumar, Nirmesh Shah, Pankaj Wasnik Published: 2026-03-20Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-20 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (97%) | - |
| DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers Adi Arbel, Ari Frummer, Helin Wang, Jesus Villalba Published: 2026-03-23Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-23 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection Chenxu Guo, Cheol Jun Cho, Emma Yang, Giada Antonicelli Published: 2026-03-25Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-25 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition Jun Zhou, Keqin Li, Tao Meng, Wei Ai Published: 2026-03-27Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-27 | eess.AS | ai-safety, eessas, preprint | E6 / R4 (96%) | - |
| ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining Anuj Diwan, David Harwath, Eunsol Choi Published: 2026-03-30Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-03-30 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (96%) | - |
| TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs Chenghao Wang, Jing Peng, Junjie Li, Kai Yu Published: 2026-04-09Area: eess.ASCitations: - Tags: ai-safety, alignment-training, eessas, preprint | 2026-04-09 | eess.AS | ai-safety, alignment-training, eessas, preprint | E5 / R3 (94%) | - |
| PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing Chaewoon Bang, Changi Hong, Dayeon Gu, Do Hyun Lee Published: 2026-04-10Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-10 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (94%) | - |
| PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing Chaewoon Bang, Changi Hong, Dayeon Gu, Do Hyun Lee Published: 2026-04-10Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-10 | eess.AS | ai-safety, eessas, preprint | E5 / R3 (95%) | - |
| X-VC: Zero-shot Streaming Voice Conversion in Codec Space Kai Yu, Kele Xu, Qinyuan Chen, Qixi Zheng Published: 2026-04-14Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-14 | eess.AS | ai-safety, eessas, preprint | E4 / R3 (94%) | - |
| Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization Andrei Andrusenko, Boris Ginsburg, Lilit Grigoryan, Nune Tadevosyan Published: 2026-04-21Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-21 | eess.AS | ai-safety, eessas, preprint | E8 / R4 (98%) | - |
| UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions Cheng Gong, Chen Zhang, Chunyu Qiang, Jianwu Dang Published: 2026-04-24Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-24 | eess.AS | ai-safety, eessas, preprint | E8 / R5 (99%) | - |
| Explainable AI in Speaker Recognition -- Making Latent Representations Understandable Mark D. Plumbley, Wenwu Wang, Yanze Xu Published: 2026-04-25Area: eess.ASCitations: - Tags: ai-safety, eessas, preprint | 2026-04-25 | eess.AS | ai-safety, eessas, preprint | E8 / R5 (98%) | - |