Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 261 papers (page 1 of 9)路 3518 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Training-Free Proactive Defense Against Partial Speech Manipulation via Self-Embedding Steganography Junichi Yamagishi, Wanying Ge, Xin Wang, Yigitcan 脰zer Published: 2026-08-26Area: cs.SDCitations: 41 Tags: ai-safety, cssd, preprint | 2026-08-26 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (93%) | 41 |
| Combining Self-Embedding Audio Watermarking with Ultra-Low-Bitrate Neural Codecs Junichi Yamagishi, Xin Wang, Yigitcan 脰zer, Zhe Zhang Published: 2026-08-26Area: cs.SDCitations: 29 Tags: ai-safety, cssd, preprint | 2026-08-26 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (95%) | 29 |
| Decay-Region Group Delay as a Forensic Cue for AI-Generated Impulsive Sounds Chengzhe Sun, JaeHyeong Chang, Siwei Lyu Published: 2026-08-26Area: cs.SDCitations: 21 Tags: ai-safety, cssd, preprint | 2026-08-26 | cs.SD | ai-safety, cssd, preprint | E13 / R8 (94%) | 21 |
| Dissonance Spectrum explicitly models perceptual frequency interactions for better music understanding Duo Xu, Haoxin Zhang, Jishang Chen, Liangke Zhao Published: 2026-08-26Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-26 | cs.SD | ai-safety, cssd, preprint | E8 / R6 (93%) | - |
| SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning Ge Liu, Ivan Bulyko, Jia-Hong Huang, Jiajun Fan Published: 2026-08-26Area: cs.SDCitations: 38 Tags: ai-safety, cssd, preprint | 2026-08-26 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (91%) | 38 |
| AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models Hanning Chen, Jiang Gui, Mohsen Imani, Pengfei Zhang Published: 2026-08-25Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-08-25 | cs.SD | ai-safety, cssd, preprint | E13 / R9 (86%) | 15 |
| Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace Ge Liu, Ivan Bulyko, Jia-Hong Huang, Jiajun Fan Published: 2026-08-25Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-25 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (89%) | - |
| Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding Dong Zhang, Guodong Zhou, Quanwei Tang, Shoushan Li Published: 2026-08-25Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-25 | cs.SD | ai-safety, cssd, preprint | E15 / R13 (92%) | - |
| SPECTRA: Subspace-Preserving Embedding Calibration, Transport, and Replay for Fully Few-Shot Class-Incremental Audio Classification Giries Abu Ayoub, Loay Mualem, Simon Korman Published: 2026-08-25Area: cs.SDCitations: 26 Tags: ai-safety, cssd, preprint | 2026-08-25 | cs.SD | ai-safety, cssd, preprint | E10 / R8 (94%) | 26 |
| EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$ Jiawen Wang, Nancy F. Chen, Xiaoxue Gao, Zi Haur Pang Published: 2026-08-24Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-08-24 | cs.SD | ai-safety, cssd, preprint | E18 / R15 (90%) | 15 |
| EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$ Jiawen Wang, Nancy F. Chen, Xiaoxue Gao, Zi Haur Pang Published: 2026-08-24Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-08-24 | cs.SD | ai-safety, cssd, preprint | E21 / R20 (92%) | 15 |
| Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings Aoke Zhang, Bo Wang, Heping Cheng, Jing Chen Published: 2026-08-23Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-23 | cs.SD | ai-safety, cssd, preprint | - | - |
| Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition Amos Roche, Anamika Ragu, Aneesh Jonelagadda, Haoze Zheng Published: 2026-08-23Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-23 | cs.SD | ai-safety, cssd, preprint | - | - |
| DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization Diqun Yan, Li Dong, Naiyuan Li Published: 2026-08-21Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-21 | cs.SD | ai-safety, cssd, preprint | - | - |
| Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding Haonan Deng, Haoyue Liu, Xiaoying Tang, Ye Chen Published: 2026-08-21Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-21 | cs.SD | ai-safety, cssd, preprint | E8 / R6 (96%) | - |
| Towards Quantifying Benchmark Optimization in ASR Models Alice Baird, David Ayllon, Jakub Piotr C艂apa, Jens Madsen Published: 2026-08-20Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-20 | cs.SD | ai-safety, cssd, preprint | E10 / R8 (94%) | - |
| Finetuning Strategies for Querying Sounds by Vocal Imitation Aditya Bhattacharjee, Christos Plachouras, Emmanouil Benetos, Sungkyun Chang Published: 2026-08-19Area: cs.SDCitations: 7 Tags: ai-safety, cssd, preprint | 2026-08-19 | cs.SD | ai-safety, cssd, preprint | E11 / R8 (93%) | 7 |
| Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization Armin Mustafa, Ismail Elezi, Jiankang Deng, Muhammad Awais Published: 2026-08-17Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-08-17 | cs.SD | ai-safety, cssd, preprint | E14 / R9 (95%) | 15 |
| Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer Alexey Letunovskiy, Anna Dmitrienko, Denis Dimitrov, Ivan Kirillov Published: 2026-08-16Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-08-16 | cs.SD | ai-safety, cssd, preprint | E14 / R12 (93%) | 15 |
| ARENA: Automated Red-Teaming for Large Audio Language Models Cheng Hong, Jiaming He, Tian Jin, Wenbo Jiang Published: 2026-08-16Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-16 | cs.SD | ai-safety, cssd, preprint | E11 / R9 (94%) | - |
| AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization Sahil Gangurde Published: 2026-08-15Area: cs.SDCitations: 1 Tags: ai-safety, cssd, preprint | 2026-08-15 | cs.SD | ai-safety, cssd, preprint | E8 / R6 (91%) | 1 |
| Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels Andrii Shevtsov, Vadym Vilhurin, Volodymyr Sydorskyi Published: 2026-08-14Area: cs.SDCitations: 39 Tags: ai-safety, cssd, preprint | 2026-08-14 | cs.SD | ai-safety, cssd, preprint | E10 / R9 (94%) | 39 |
| Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task Alexandru-Stefan Morosanu, Laura Erhan, Stefan-Daniel Achirei, Valerian Cecan Published: 2026-08-14Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-14 | cs.SD | ai-safety, cssd, preprint | E8 / R8 (88%) | - |
| HybridSB-MoE: Dual-Domain Schr枚dinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement Aswini Sivakumar, Jie Hu, Yao Qiang, Zhengyi Lu Published: 2026-08-13Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-13 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (92%) | - |
| DuplexWorld: Can voice agents help you get through the day? Abhishek Mukherji, Akhil Pothanapalli, Aryan Vijay Bhosale, Asif Shaik Published: 2026-08-11Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-11 | cs.SD | ai-safety, cssd, preprint | E14 / R13 (94%) | - |
| Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models Dongxiao Liu, Ji Zhang, Kunlan Xiang, Mingxuan Li Published: 2026-08-11Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-11 | cs.SD | ai-safety, cssd, preprint | E9 / R7 (93%) | - |
| Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition Gaopeng Xu, Haitao Yao, Yinfeng Xia, Zheng Xue Published: 2026-08-11Area: cs.SDCitations: 20 Tags: ai-safety, cssd, preprint | 2026-08-11 | cs.SD | ai-safety, cssd, preprint | E10 / R7 (93%) | 20 |
| Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions Anke Koelzer, Fanny Riols, Hoang H Nguyen, Jash Shah Published: 2026-08-10Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-10 | cs.SD | ai-safety, cssd, preprint | - | - |
| DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation Haitao Qian, Qianxiao Fang, Wanyi Ning, Wei Zhou Published: 2026-08-10Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-10 | cs.SD | ai-safety, cssd, preprint | - | - |
| From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs Chen Li, Haoran Gao, Jie Ren, Kun Wang Published: 2026-08-10Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-08-10 | cs.SD | ai-safety, cssd, preprint | - | - |