Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-05-28Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 67 |
| Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization Bochuan Cao, Fenglong Ma, Jinghui Chen, Lu Lin Published: 2024-05-28Area: Representation AnalysisCitations: 81 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2024-05-28 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 81 |
| White-box Multimodal Jailbreaks Against Large Vision-Language Models Chuanjun Ji, Guangnan Ye, Hanxu Zhou, Ruofan Wang Published: 2024-05-28Area: Multimodal SafetyCitations: 47 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 47 |
| AI Risk Management Should Incorporate Both Safety and Security Arvind Narayanan, Bo Li, Boyi Wei, Chaowei Xiao Published: 2024-05-29Area: Surveys & ReviewsCitations: 20 Tags: adversarial-robustness, ai-safety, position, surveys-reviews | 2024-05-29 | Surveys & Reviews | adversarial-robustness, ai-safety, position, surveys-reviews | E5 / R4 (97%) | 20 |
| Voice Jailbreak Attacks Against GPT-4o Michael Backes, Xinyue Shen, Yang Zhang, Yixin Wu Published: 2024-05-29Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 30 |
| Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho, Xiangyu Qi Published: 2024-05-30Area: Adversarial RobustnessCitations: 36 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 36 |
| Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters Andy Zhou, Haibo Jin, Haohan Wang, Joe D. Menke Published: 2024-05-30Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 43 |
| Phantom: General Trigger Attacks on Retrieval Augmented Language Generation Alina Oprea, Christopher A. Choquette-Choo, Cristina Nita-Rotaru, Giorgio Severi Published: 2024-05-30Area: Adversarial RobustnessCitations: 45 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 45 |
| Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-05-31Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 24 |
| Exploring Vulnerabilities and Protections in Large Language Models: A Survey Chenhui Hu, Frank Weizhen Liu Published: 2024-06-01Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, survey | 2024-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E8 / R5 (98%) | 12 |
| Get My Drift? Catching LLM Task Drift with Activation Deltas Ahmed Salem, Aideen Fay, Andrew Paverd, Giovanni Cherubin Published: 2024-06-02Area: Adversarial RobustnessCitations: 38 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 38 |
| From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation Eugene Belilovsky, Geraldin Nanfack, Michael Eickenberg Published: 2024-06-03Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-06-03 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 1 |
| Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-06-03Area: Adversarial RobustnessCitations: 72 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 72 |
| Safeguarding Large Language Models: A Survey Changshun Wu, Gaojie Jin, Jie Meng, Jinwei Hu Published: 2024-06-03Area: Surveys & ReviewsCitations: 82 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-06-03 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 82 |
| Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA Hussein Jawad, Nicolas J-B. Brunel Published: 2024-06-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Defending Large Language Models Against Attacks With Residual Stream Activation Analysis Amelia Kawasaki, Andrew Davis, Houssam Abbas Published: 2024-06-05Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens Hai Yan, Jiawen Shi, Lin Lu, Pan Zhou Published: 2024-06-06Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 13 |
| Improving Alignment and Robustness with Circuit Breakers Andy Zou, Dan Hendrycks, Derek Duenas, Justin Wang Published: 2024-06-06Area: Adversarial RobustnessCitations: 230 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 230 |
| Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt Aishan Liu, Dacheng Tao, Siyuan Liang, Tianyuan Zhang Published: 2024-06-06Area: Multimodal SafetyCitations: 83 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-06-06 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 83 |
| Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 30 |
| SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner Daoyuan Wu, Juergen Rahmel, Ning Liu, Pingchuan Ma Published: 2024-06-08Area: Adversarial RobustnessCitations: 39 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 39 |
| Machine Against the RAG: Jamming Retrieval-Augmented Generation with Blocker Documents Avital Shafran, Roei Schuster, Vitaly Shmatikov Published: 2024-06-09Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 68 |
| A Survey of Recent Backdoor Attacks and Defenses in Large Language Models Fengjun Pan, Jie Fu, Leilei Gan, Luu Anh Tuan Published: 2024-06-10Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, survey | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (96%) | 32 |
| Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models Chen Wu, Jiaqi Wang, Renze Lou, Xi Li Published: 2024-06-10Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 21 |
| Safety Alignment Should Be Made More Than Just a Few Tokens Deep Ahmad Beirami, Ashwinee Panda, Kaifeng Lyu, Peter Henderson Published: 2024-06-10Area: Adversarial RobustnessCitations: 315 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 315 |
| Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag Competition Ahmed Salem, Chenhao Li, Daniel Paleka, Dragos Albastroiu Published: 2024-06-12Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, dataset | 2024-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (97%) | 19 |
| Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-13Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, benchmark | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R3 (98%) | 34 |
| JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models Anyu Wang, Delong Ran, Jingyi Zheng, Jinyuan Liu Published: 2024-06-13Area: Safety EvaluationCitations: 27 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (94%) | 27 |
| RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs Lu Yan, Wenbo Guo, Xiangyu Zhang, Xuan Chen Published: 2024-06-13Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 20 |
| Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models Frauke Kreuter, Nina Rimsky, Sarah Ball Published: 2024-06-13Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (92%) | 30 |