Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models An-Yu Cheng, Chih-Kai Yang, Hung-yi Lee, Ke-Han Lu Published: 2026-07-13Area: cs.SDCitations: 69 Tags: ai-safety, cssd, preprint | 2026-07-13 | cs.SD | ai-safety, cssd, preprint | E10 / R9 (91%) | 69 |
| MusicMark: A Robust Generative Watermarking Framework for Music Generation Jeeyoung Yun, Juyeon Lee, Seohwan Yun, Sungwoong Kim Published: 2026-07-13Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-13 | cs.SD | ai-safety, cssd, preprint | E7 / R6 (91%) | - |
| VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion Aastha Sharma, Guangjing Wang Published: 2026-07-13Area: cs.SDCitations: 28 Tags: ai-safety, cssd, preprint | 2026-07-13 | cs.SD | ai-safety, cssd, preprint | E16 / R12 (91%) | 28 |
| An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge Shuifei Zeng, Shuming Fang Published: 2026-07-14Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-14 | cs.SD | ai-safety, cssd, preprint | E10 / R7 (94%) | - |
| ChartGenEval: Corruption-Tested Multi-Dimensional Feedback for Rhythm-Game Chart Generation Jhen-Ke Lin Published: 2026-07-14Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-14 | cs.SD | ai-safety, cssd, preprint | E10 / R10 (91%) | - |
| Explainable-by-Design Audio Deepfake Detection via Wiener-Hopf Linear Prediction Marco Fontani, Massimo Iuliani, Mattia Tamiazzo, Simone Milani Published: 2026-07-14Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-14 | cs.SD | ai-safety, cssd, preprint | E10 / R9 (93%) | - |
| From Prediction to Collaboration: Interactive Symbolic Music Analysis Emmanouil Karystinaios, Gerhard Widmer, Johannes Hentschel, Markus Neuwirth Published: 2026-07-15Area: cs.SDCitations: 20 Tags: ai-safety, cssd, preprint | 2026-07-15 | cs.SD | ai-safety, cssd, preprint | E10 / R7 (93%) | 20 |
| Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026 Adrian Cheung, Anthony Miyaguchi, Murilo Gustineli Published: 2026-07-16Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-16 | cs.SD | ai-safety, cssd, preprint | E14 / R11 (94%) | - |
| Large Audio Language Models for Spoofing-Aware Speaker Verification Artem Dvirniak, Dmitrii Korzh, Evgeny Kushnir, Mariia Perunova Published: 2026-07-16Area: cs.SDCitations: 53 Tags: ai-safety, cssd, preprint | 2026-07-16 | cs.SD | ai-safety, cssd, preprint | E10 / R8 (93%) | 53 |
| RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems Alice Baird, David Ayllon, Franc Camps-Febrer, Georg Streich Published: 2026-07-16Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-16 | cs.SD | ai-safety, cssd, preprint | E9 / R8 (92%) | - |
| AuEmoChat: Authentic Emotion Understanding and Rendering for Conversational Speech Synthesis Aruukhan, Haizhou Li, Rui Liu, Yuan Zhao Published: 2026-07-17Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-07-17 | cs.SD | ai-safety, cssd, preprint | E14 / R13 (95%) | 15 |
| Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models Li Liu, Runze Liu, Shen Wang, Ye Lu Published: 2026-07-18Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-18 | cs.SD | ai-safety, cssd, preprint | E9 / R8 (94%) | - |
| Explainable Lightweight Compact Deep Models for Speech Emotion Recognition Nelly Elsayed Published: 2026-07-18Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-18 | cs.SD | ai-safety, cssd, preprint | E8 / R6 (92%) | - |
| Addressing Limited Data in Auditory Attention Decoding with Diffusion Generative Models Bo Bernhardsson, David Rannaleet, Emina Alickovic, Martin A. Skoglund Published: 2026-07-20Area: cs.SDCitations: 34 Tags: ai-safety, cssd, preprint | 2026-07-20 | cs.SD | ai-safety, cssd, preprint | E9 / R6 (92%) | 34 |
| Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture Jiayong Jiang, Junkun Wang, Xin Zhao, Yifan Xu Published: 2026-07-20Area: cs.SDCitations: 30 Tags: ai-safety, cssd, preprint | 2026-07-20 | cs.SD | ai-safety, cssd, preprint | E7 / R8 (94%) | 30 |
| Time-Frequency Consistency Learning for Robust Speech Deepfake Detection Guanxiang Feng, Jiajun Liu, Jiayu Xiong, Jun Xue Published: 2026-07-20Area: cs.SDCitations: 15 Tags: ai-safety, cssd, preprint | 2026-07-20 | cs.SD | ai-safety, cssd, preprint | E11 / R8 (93%) | 15 |
| What the Waveform Knows: Transparent-first Speech and Audio Intelligence with Caption Studio Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar Published: 2026-07-21Area: cs.SDCitations: 21 Tags: ai-safety, cssd, preprint | 2026-07-21 | cs.SD | ai-safety, cssd, preprint | E14 / R13 (91%) | 21 |
| Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning Baolong Bi, Chaozhuo Li, Chengpeng Hao, Shenghua Liu Published: 2026-07-22Area: cs.SDCitations: 12 Tags: ai-safety, cssd, preprint | 2026-07-22 | cs.SD | ai-safety, cssd, preprint | E10 / R9 (92%) | 12 |
| Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering Bin Ma, Chongjia Ni, Haina Zhu, Han Zhao Published: 2026-07-22Area: cs.SDCitations: 25 Tags: ai-safety, cssd, preprint | 2026-07-22 | cs.SD | ai-safety, cssd, preprint | E8 / R5 (92%) | 25 |
| Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering Biao Tian, Bin Ma, Chongjia Ni, Haina Zhu Published: 2026-07-22Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-22 | cs.SD | ai-safety, cssd, preprint | E8 / R6 (92%) | - |
| RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling Genfang Chen, Jiaxing Yu, Kejun Zhang, Tieyao Zhang Published: 2026-07-22Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-22 | cs.SD | ai-safety, cssd, preprint | E8 / R7 (92%) | - |
| Probing Speaker Identity Sensitivity in Audio Deepfake Detectors Arun Ross, Daniyal Kabir Dar Published: 2026-07-23Area: cs.SDCitations: 34 Tags: ai-safety, cssd, preprint | 2026-07-23 | cs.SD | ai-safety, cssd, preprint | E9 / R8 (93%) | 34 |
| Enhancing Law-Enforcement Audio Transcription: A LoRA-Based Adaptation of Whisper for BWC Footage Ernest Fokou茅, Vivek Senthil, Zhiqiang Tao Published: 2026-07-27Area: cs.SDCitations: 5 Tags: ai-safety, cssd, preprint | 2026-07-27 | cs.SD | ai-safety, cssd, preprint | E7 / R5 (90%) | 5 |
| Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection Gencheng Liu, Haotian Mo, Jie Liu, Keqi Yang Published: 2026-07-29Area: cs.SDCitations: 1 Tags: ai-safety, cssd, preprint | 2026-07-29 | cs.SD | ai-safety, cssd, preprint | E7 / R8 (93%) | 1 |
| MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning Junbo Li, Jun Fang, Lin Li, Qingyang Hong Published: 2026-07-29Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-29 | cs.SD | ai-safety, cssd, preprint | - | - |
| MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning Junbo Li, Jun Fang, Lin Li, Qingyang Hong Published: 2026-07-29Area: cs.SDCitations: 28 Tags: ai-safety, cssd, preprint | 2026-07-29 | cs.SD | ai-safety, cssd, preprint | E14 / R12 (87%) | 28 |
| MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation Chih-Pin Tan, Fang-Duo Tsai, Hsuan-Yu Yeh, Ting-Yi Hu Published: 2026-07-29Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-29 | cs.SD | ai-safety, cssd, preprint | E10 / R8 (91%) | - |
| Teffic-Audio: Tell Fact from Fiction Jindong Wang, Kunyu Feng, Li Wang, Wan Lin Published: 2026-07-30Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-30 | cs.SD | ai-safety, cssd, preprint | E10 / R9 (93%) | - |
| TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models Abhishek Mukherji, Aryan Vijay Bhosale, Dinesh Manocha, Harshit Rajgarhia Published: 2026-07-30Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-30 | cs.SD | ai-safety, cssd, preprint | E18 / R17 (91%) | - |
| VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition EngSiong Chng, Tianrui Wang, Xinyu Yang, Yukun Chen Published: 2026-07-30Area: cs.SDCitations: - Tags: ai-safety, cssd, preprint | 2026-07-30 | cs.SD | ai-safety, cssd, preprint | E32 / R17 (87%) | - |