Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment Hyunbin Jin, Kyubyung Chae, Taesup Kim Published: 2025-06-07Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| A Systematic Review of Poisoning Attacks Against Large Language Models Edward W. Staley, Joshua Carney, Marie Chau, Nathan Drenkow Published: 2025-06-06Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, survey | 2025-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E4 / R3 (95%) | 6 |
| Benchmarking Misuse Mitigation Against Covert Adversaries Alexander Robey, Davis Brown, Eric Wong, George J. Pappas Published: 2025-06-06Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 4 |
| Saffron-1: Towards an Inference Scaling Paradigm for LLM Safety Assurance Gaotang Li, Hanghang Tong, Jingrui He, Ruizhong Qiu Published: 2025-06-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets Lei Hsiung, Linyue Song, Pin-Yu Chen, Tianyu Pang Published: 2025-06-05Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models Anders Holst, Jia Fu, Kunyu Peng, Sepideh Pashami Published: 2025-06-04Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 2 |
| RedDebate: Safer Responses through Multi-Agent Red Teaming Debates Ali Asad, Radin Shayanfar, Stephen Obadinma, Xiaodan Zhu Published: 2025-06-04Area: Safety EvaluationCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R4 (97%) | 3 |
| Adversarial Attacks on Robotic Vision Language Action Models Alexander Robey, Andy Zou, Eliot Krzysztof Jones, George J. Pappas Published: 2025-06-03Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 13 |
| BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage Kalyan Nakka, Nitesh Saxena Published: 2025-06-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R3 (97%) | - |
| Align Is Not Enough: Multimodal Universal Jailbreak Attack Against Multimodal Large Language Models Hanwang Zhang, Jing Liu, Richang Hong, Wenbo Hu Published: 2025-06-02Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (98%) | 12 |
| Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model Guoqing Jin, Mingjie Deng, Yan Song, Yuanhe Tian Published: 2025-06-02Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-06-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| ReGA: Representation-Guided Abstraction for Model-based Safeguarding of LLMs Chengcan Wu, Meng Sun, Zeming Wei Published: 2025-06-02Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 3 |
| CoP: Agentic Red-teaming for Large Language Models using Composition of Principles Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho Published: 2025-06-01Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution Daria Stetsenko, Fabrizio Gilardi, Meysam Alizadeh, Zeynab Samei Published: 2025-06-01Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 10 |
| Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities Iryna Gurevych, Jiahui Geng, Preslav Nakov, Thy Thy Tran Published: 2025-05-31Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 2 |
| Adversarial Preference Learning for Robust LLM Alignment Bo Tang, Chaochao Lu, Chao Yang, Chen Chen Published: 2025-05-30Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| Cascading Adversarial Bias from Injection to Distillation in Language Models Alina Oprea, Harsh Chaudhari, Ilia Shumailov, Jamie Hayes Published: 2025-05-30Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| COSMIC: Generalized Refusal Direction Identification in LLM Activations Chenguang Wang, Dawn Song, Nicholas Crispino, Sam Pan Published: 2025-05-30Area: Representation AnalysisCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-05-30 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 5 |
| From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models Haibo Jin, Haohan Wang, Man Luo, Peiran Wang Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | 3 |
| Learning Safety Constraints for Large Language Models Andreas Krause, Xin Chen, Yarden As Published: 2025-05-30Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 11 |
| Model Unlearning via Sparse Autoencoder Subspace Guided Projections Benyou Wang, Difan Zou, Xu Wang, Yan Hu Published: 2025-05-30Area: Model EditingCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-30 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 7 |
| TRAPDOC: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documents Hyundong Jin, SeungYeop Baik, Shinwoo Park, Sicheol Sung Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 3 |
| When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs Michael Backes, Xinyue Shen, Yang Zhang, Yun Shen Published: 2025-05-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| OmniGuard: An Efficient Approach for AI Safety Moderation Across Languages and Modalities Chandan Singh, Charlotte Siska, Hila Gonen, Jeff Bilmes Published: 2025-05-29Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 6 |
| Understanding Refusal in Language Models with Sparse Autoencoders Clement Neo, Erik Cambria, Nirmalendu Prakash, Ranjan Satapathy Published: 2025-05-29Area: Mechanistic Interp.Citations: 7 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-05-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 7 |
| Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models Ganesh Gopalakrishnan, Harvey Dam, Jonas Knochelmann, Vinu Joseph Published: 2025-05-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance Le Cong, Mengdi Wang, Ruofan Jin, Zaixi Zhang Published: 2025-05-28Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (98%) | 8 |
| Jailbreak Distillation: Renewable Safety Benchmarking Ahmed Elgohary, Ahmed Magooda, A S M Iftekhar, Benjamin Van Durme Published: 2025-05-28Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| Operationalizing CaMeL: Strengthening LLM Defenses for Enterprise Deployment Emma Miller, Krti Tallam Published: 2025-05-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |