Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Operationalizing CaMeL: Strengthening LLM Defenses for Enterprise Deployment Emma Miller, Krti Tallam Published: 2025-05-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments Eric Fosler-Lussier, Huan Sun, Jaylen Jones, Linxi Jiang Published: 2025-05-28Area: Agent SafetyCitations: 12 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-05-28 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E6 / R3 (95%) | 12 |
| OmniGuard: An Efficient Approach for AI Safety Moderation Across Languages and Modalities Chandan Singh, Charlotte Siska, Hila Gonen, Jeff Bilmes Published: 2025-05-29Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 6 |
| Understanding Refusal in Language Models with Sparse Autoencoders Clement Neo, Erik Cambria, Nirmalendu Prakash, Ranjan Satapathy Published: 2025-05-29Area: Mechanistic Interp.Citations: 7 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-05-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 7 |
| Adversarial Preference Learning for Robust LLM Alignment Bo Tang, Chaochao Lu, Chao Yang, Chen Chen Published: 2025-05-30Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-05-30 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| Cascading Adversarial Bias from Injection to Distillation in Language Models Alina Oprea, Harsh Chaudhari, Ilia Shumailov, Jamie Hayes Published: 2025-05-30Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| COSMIC: Generalized Refusal Direction Identification in LLM Activations Chenguang Wang, Dawn Song, Nicholas Crispino, Sam Pan Published: 2025-05-30Area: Representation AnalysisCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-05-30 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 5 |
| From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models Haibo Jin, Haohan Wang, Man Luo, Peiran Wang Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, theoretical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (95%) | 3 |
| Learning Safety Constraints for Large Language Models Andreas Krause, Xin Chen, Yarden As Published: 2025-05-30Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 11 |
| Model Unlearning via Sparse Autoencoder Subspace Guided Projections Benyou Wang, Difan Zou, Xu Wang, Yan Hu Published: 2025-05-30Area: Model EditingCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-05-30 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 7 |
| TRAPDOC: Deceiving LLM Users by Injecting Imperceptible Phantom Tokens into Documents Hyundong Jin, SeungYeop Baik, Shinwoo Park, Sicheol Sung Published: 2025-05-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 3 |
| When GPT Spills the Tea: Comprehensive Assessment of Knowledge File Leakage in GPTs Michael Backes, Xinyue Shen, Yang Zhang, Yun Shen Published: 2025-05-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities Iryna Gurevych, Jiahui Geng, Preslav Nakov, Thy Thy Tran Published: 2025-05-31Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-05-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 2 |
| CoP: Agentic Red-teaming for Large Language Models using Composition of Principles Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho Published: 2025-06-01Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 5 |
| Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution Daria Stetsenko, Fabrizio Gilardi, Meysam Alizadeh, Zeynab Samei Published: 2025-06-01Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 10 |
| Align Is Not Enough: Multimodal Universal Jailbreak Attack Against Multimodal Large Language Models Hanwang Zhang, Jing Liu, Richang Hong, Wenbo Hu Published: 2025-06-02Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (98%) | 12 |
| Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model Guoqing Jin, Mingjie Deng, Yan Song, Yuanhe Tian Published: 2025-06-02Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-06-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| ReGA: Representation-Guided Abstraction for Model-based Safeguarding of LLMs Chengcan Wu, Meng Sun, Zeming Wei Published: 2025-06-02Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 3 |
| Adversarial Attacks on Robotic Vision Language Action Models Alexander Robey, Andy Zou, Eliot Krzysztof Jones, George J. Pappas Published: 2025-06-03Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 13 |
| BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage Kalyan Nakka, Nitesh Saxena Published: 2025-06-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R3 (97%) | - |
| DiffCAP: Diffusion-based Cumulative Adversarial Purification for Vision Language Models Anders Holst, Jia Fu, Kunyu Peng, Sepideh Pashami Published: 2025-06-04Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 2 |
| RedDebate: Safer Responses through Multi-Agent Red Teaming Debates Ali Asad, Radin Shayanfar, Stephen Obadinma, Xiaodan Zhu Published: 2025-06-04Area: Safety EvaluationCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R4 (97%) | 3 |
| Normative conflicts and shallow AI alignment Rapha毛l Milli猫re Published: 2025-06-05Area: Deception & FailureCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | 2025-06-05 | Deception & Failure | adversarial-robustness, ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 4 |
| Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets Lei Hsiung, Linyue Song, Pin-Yu Chen, Tianyu Pang Published: 2025-06-05Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| A Systematic Review of Poisoning Attacks Against Large Language Models Edward W. Staley, Joshua Carney, Marie Chau, Nathan Drenkow Published: 2025-06-06Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, survey | 2025-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E4 / R3 (95%) | 6 |
| Benchmarking Misuse Mitigation Against Covert Adversaries Alexander Robey, Davis Brown, Eric Wong, George J. Pappas Published: 2025-06-06Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 4 |
| Saffron-1: Towards an Inference Scaling Paradigm for LLM Safety Assurance Gaotang Li, Hanghang Tong, Jingrui He, Ruizhong Qiu Published: 2025-06-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment Hyunbin Jin, Kyubyung Chae, Taesup Kim Published: 2025-06-07Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-06-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint An Zhang, Changshuo Shen, Junfeng Fang, Leheng Sheng Published: 2025-06-08Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2025-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 15 |
| Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations Ramtin Pedarsani, Reza Abbasi-Asl, Zhiyu Xue Published: 2025-06-08Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-06-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 1 |