Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks Liang He, Linlin Wang, Xiaoling Wang, Xin Yi Published: 2025-01-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity Adam Oberman, David Williams-King, Linh Le, Yoshua Bengio Published: 2025-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, position | 2025-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E6 / R4 (93%) | - |
| Dagger Behind Smile: Fool LLMs with a Happy Ending Story Jiayi Kong, Jun Luo, Shuo Huai, Xurui Song Published: 2025-01-19Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (99%) | 6 |
| Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment Andy Luo, Huy Nghiem, Melissa Kazemi Rad, Mohammad Sorower Published: 2025-01-22Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (95%) | 18 |
| HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor Haichang Gao, Jiacheng Luo, Zhaoxiang Liu, Zihui Wu Published: 2025-01-23Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 2 |
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |
| Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink Chenyue Wang, Hui Xue, Jialing Tao, Jiexi Liu Published: 2025-01-25Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-01-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 7 |
| Smoothed Embeddings for Robust Language Models Ashley Lewis, Jing Liu, Kieran Parsons, Md Rafi Ur Rashid Published: 2025-01-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 3 |
| Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs Eric Pauley, Jean-Charles Noirot Ferrand, Patrick McDaniel, Ryan Sheatsley Published: 2025-01-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| TombRaider: Entering the Vault of History to Jailbreak Large Language Models Gelei Deng, Jiahao Zhang, Junchen Ding, Yi Liu Published: 2025-01-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation Daniel Schwartz, Dmitriy Bespalov, Ninad Kulkarni, Yanjun Qi Published: 2025-01-28Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 7 |
| xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking Ahmadreza Argha, Chi Wei, Hamid Alinejad-Rokny, Liyang Fan Published: 2025-01-28Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 12 |
| SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders Bartosz Cywinski, Kamil Deja Published: 2025-01-29Area: Mechanistic Interp.Citations: 37 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-01-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 37 |
| GuardReasoner: Towards Reasoning-based LLM Safeguards Bryan Hooi, Hongcheng Gao, Jiaheng Zhang, Jun Xia Published: 2025-01-30Area: Adversarial RobustnessCitations: 60 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 60 |
| Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models Bo Zhang, Haoyu Liang, Jun Zhu, Youran Sun Published: 2025-01-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (93%) | 3 |
| o3-mini vs DeepSeek-R1: Which One is Safer? Aitor Arrieta, Jos茅 Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-30Area: Safety EvaluationCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 31 |
| Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation Dacheng Tao, Haotian Luo, Huanjin Yao, Jiaxing Huang Published: 2025-01-30Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 14 |
| A Three-Branch Checks-and-Balances Framework for Context-Aware Ethical Alignment of Large Language Models Edward Y. Chang Published: 2025-01-31Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-01-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (95%) | 3 |
| Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming Alex Silverstein, Alwin Peng, Amanda Askell, Andy Dau Published: 2025-01-31Area: Adversarial RobustnessCitations: 105 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (97%) | 105 |
| Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning Gelei Deng, Jieming Shi, Jin Song Dong, Tianwei Zhang Published: 2025-01-31Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 6 |
| Towards the Worst-case Robustness of Large Language Models Hang Su, Huanran Chen, Jun Zhu, Yinpeng Dong Published: 2025-01-31Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 12 |
| Trading Inference-Time Compute for Adversarial Robustness Amelia Glaese, Boaz Barak, Eric Wallace, Evgenia Nitishinskaya Published: 2025-01-31Area: Adversarial RobustnessCitations: 52 Tags: adversarial-robustness, ai-safety, empirical | 2025-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 52 |
| AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement Jakob Foerster, J Rosser Published: 2025-02-02Area: Agent SafetyCitations: 6 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-02-02 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R4 (94%) | 6 |
| "I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models David Khachaturov, Isha Gupta, Robert Mullins Published: 2025-02-02Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| LLM Safety Alignment is Divergence Estimation in Disguise Guang Lin, Qifan Song, Rajdeep Haldar, Yue Xing Published: 2025-02-02Area: Alignment TrainingCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-02-02 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (93%) | 3 |
| Towards Robust Multimodal Large Language Models Against Jailbreak Attacks Fenglong Ma, Han Liu, Jinghui Chen, Ting Wang Published: 2025-02-02Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 2 |
| Adversarial Reasoning at Jailbreaking Time Amin Karbasi, George Pappas, Hamed Hassani, Mahdi Sabbaghi Published: 2025-02-03Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | 19 |
| Robust-LLaVA: On the Effectiveness of Large-Scale Robust Image Encoders for Multi-modal Large Language Models Fahad Khan, Fahad Shamshad, Hashmat Shadab Malik, Karthik Nandakumar Published: 2025-02-03Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (94%) | 8 |
| Topic-FlipRAG: Topic-Orientated Adversarial Opinion Manipulation Attacks to Retrieval-Augmented Generation Models Fengchang Yu, Jiawei Liu, Miaokun Chen, Wei Lu Published: 2025-02-03Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2025-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 10 |
| Adversarial ML Problems Are Getting Harder to Solve and to Evaluate Florian Tram猫r, Javier Rando, Jie Zhang, Nicholas Carlini Published: 2025-02-04Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, position | 2025-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (94%) | 24 |