Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding Guanxu Chen, Huming Qiu, Min Yang, Mi Zhang Published: 2024-11-15Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit Chun Chen, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-11-17Area: Mechanistic Interp.Citations: 16 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-11-17 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R3 (93%) | 16 |
| CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization Jun Sun, Long H. Pham, Nay Myat Min, Yige Li Published: 2024-11-18Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 15 |
| Steering Language Model Refusal with Sparse Autoencoders David Majercak, Dean Carignan, Eric Horvitz, Forough Poursabzi-Sangdeh Published: 2024-11-18Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-11-18 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 49 |
| The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models Jizhong Han, Songlin Hu, Xikang Yang, Xuehai Tang Published: 2024-11-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations Huaizhi Ge, Qifan Wang, Ruixiang Tang, Yiming Li Published: 2024-11-19Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 11 |
| A Flexible Large Language Models Guardrail Development Methodology Applied to Off-Topic Prompt Detection Chan Shing Yee, Gabriel Chua, Shaun Khoo Published: 2024-11-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (98%) | 1 |
| GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs Advik Raj Basani, Xiao Zhang Published: 2024-11-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 12 |
| Sycophancy in Large Language Models: Causes and Mitigations Lars Malmqvist Published: 2024-11-22Area: Deception & FailureCitations: 71 Tags: adversarial-robustness, ai-safety, deception-failure, survey | 2024-11-22 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, survey | E5 / R3 (96%) | 71 |
| ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain Arman Cohan, Di Jin, Haochen Zhao, Mark Gerstein Published: 2024-11-23Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-11-23 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 6 |
| "Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks Libo Wang Published: 2024-11-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-11-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (96%) | - |
| Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks Gang Wang, Han Wang, Huan Zhang Published: 2024-11-23Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 25 |
| Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks Hao Chen, Jianda Mao, Kani Chen, Peng Xie Published: 2024-11-24Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 14 |
| In-Context Experience Replay Facilitates Safety Red-Teaming of Text-to-Image Diffusion Models Kuan-Chen Mu, Mario Fritz, Pin-Yu Chen, Wei-Chen Chiu Published: 2024-11-25Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (96%) | 2 |
| Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective D'Jeff K. Nkashama, Froduald Kabanza, Jean Marie Tshimula, Marc Frappier Published: 2024-11-25Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, survey | 2024-11-25 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R4 (94%) | 4 |
| PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning Chenhao Lin, Rongmao Chen, Tianshuo Cong, Xingshuo Han Published: 2024-11-26Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 18 |
| Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models Bryan Hooi, Jun Liu, Kai-Wei Chang, Shuyang Hao Published: 2024-11-27Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 6 |
| Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment Ahmad Beirami, Alvaro Velasquez, Amrit Singh Bedi, Dinesh Manocha Published: 2024-11-27Area: Multimodal SafetyCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 18 |
| Neutralizing Backdoors through Information Conflicts for Large Language Models Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Xueluan Gong Published: 2024-11-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| DIESEL - Dynamic Inference-Guidance via Evasion of Semantic Embeddings in LLMs Alon Zolfi, Asaf Shabtai, Ben Ganon, Hisashi Kojima Published: 2024-11-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Jailbreak Large Vision-Language Models Through Multi-Modal Linkage Geyuan Zhang, Tianxing He, Xiaofei Zhou, Yichen Wang Published: 2024-11-30Area: Multimodal SafetyCitations: 37 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 37 |
| Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach Ethan Perez, Fazl Barez, Henry Sleight, Jesse Mu Published: 2024-12-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 6 |
| Best-of-N Jailbreaking Aengus Lynch, Erik Jones, Ethan Perez, Fazl Barez Published: 2024-12-04Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 34 |
| Does Safety Training of LLMs Generalize to Semantically Related Natural Prompts? Arun Suggala, Karthikeyan Shanmugam, Prateek Jain, Sravanti Addepalli Published: 2024-12-04Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 7 |
| LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds Amrit Singh Bedi, Furong Huang, James Beetham, Mengdi Wang Published: 2024-12-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-12-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage Dawn Song, Wenbo Guo, Xian Wu, Xuandong Zhao Published: 2024-12-07Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 8 |
| Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models Chu Zhixuan, Duan Ranjie, Huang Yihao, Jia Xiaojun Published: 2024-12-08Area: Multimodal SafetyCitations: 21 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 21 |
| Buster: Incorporating Backdoor Attacks into Text Encoder to Mitigate NSFW Content Generation Xiaojun Chen, Xin Zhao, Yuexin Xuan, Zhendong Zhao Published: 2024-12-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks Bocheng Chen, Hanqing Guo, Qiben Yan Published: 2024-12-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| On Evaluating the Durability of Safeguards for Open-Weight LLMs Boyi Wei, Luxi He, Matthew Jagielski, Milad Nasr Published: 2024-12-10Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 42 |