Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Attention Shift: Steering AI Away from Unsafe Content Manyana Tiwari, Shivank Garg Published: 2024-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| AnyAttack: Towards Large-scale Self-supervised Generation of Targeted Adversarial Examples for Vision-Language Models Dit-Yan Yeung, Jiaming Zhang, Jitao Sang, Junhong Ye Published: 2024-10-07Area: Multimodal SafetyCitations: 17 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | 17 |
| SecAlign: Defending Against Prompt Injection with Preference Optimization Arman Zharmagambetov, Chuan Guo, Kamalika Chaudhuri, Saeed Mahloujifar Published: 2024-10-07Area: Adversarial RobustnessCitations: 79 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 79 |
| Non-Halting Queries: Exploiting Fixed Points in LLMs Berk Sunar, Ghaith Hammouri, Kemal Derya Published: 2024-10-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Bridging Today and the Future of Humanity: AI Safety in 2024 and Beyond Shanshan Han Published: 2024-10-09Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, red-teaming, survey, surveys-reviews | 2024-10-09 | Surveys & Reviews | adversarial-robustness, ai-safety, red-teaming, survey, surveys-reviews | E6 / R3 (92%) | 1 |
| Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy Chong Xiang, Kaiqiang Song, Prateek Mittal, Ravi Agrawal Published: 2024-10-09Area: Adversarial RobustnessCitations: 37 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 37 |
| AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents Alexandra Souly, Andy Zou, Dan Hendrycks, Derek Duenas Published: 2024-10-11Area: Adversarial RobustnessCitations: 148 Tags: adversarial-robustness, ai-safety, benchmark | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 148 |
| Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger Published: 2024-10-11Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-10-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 49 |
| JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework Dawei Yin, Fan Liu, Hao Liu, Lixin Su Published: 2024-10-11Area: Safety EvaluationCitations: 36 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-10-11 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 36 |
| JurEE not Judges: safeguarding llm interactions with small, specialised Encoder Ensembles Dom Nasrabadi Published: 2024-10-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | 2 |
| PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning David Krueger, Fazl Barez, Mrinank Sharma, Philip Torr Published: 2024-10-11Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, benchmark | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E6 / R4 (94%) | 26 |
| RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process Chaowei Xiao, Peiran Wang, Xiaogeng Liu Published: 2024-10-11Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 9 |
| Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense Li Shen, Minhao Cheng, Nevin L. Zhang, Rui Min Published: 2024-10-13Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 8 |
| Jailbreak Instruction-Tuned LLMs via end-of-sentence MLP Re-weighting Bin Dong, Meitan Wang, Yifan Luo, Zhennan Zhou Published: 2024-10-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts Dongrui Liu, Hao Li, Jing Shao, Junchi Yan Published: 2024-10-14Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 42 |
| AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment Furong Huang, Michael-Andrei Panaitescu-Liess, Pankayaraj Pathmanathan, Udari Madhushani Sehwag Published: 2024-10-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Cognitive Overload Attack: Prompt Injection for Long Context Amin Karbasi, Bibek Upadhayay, Vahid Behzadan Published: 2024-10-15Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 13 |
| Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation Qizhang Li, Wangmeng Zuo, Xiaochen Yang, Yiwen Guo Published: 2024-10-15Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 3 |
| Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models Ehsan Shareghi, Gholamreza Haffari, Hao Yang, Lizhen Qu Published: 2024-10-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (97%) | 11 |
| Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts Chao Du, Hongcheng Gao, Min Lin, Taihang Hu Published: 2024-10-16Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-16 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 18 |
| SoK: Prompt Hacking of Large Language Models Baha Rababah, Carson Leung, Cuneyt Gurcan Akcora, Matthew Kwiatkowski Published: 2024-10-16Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, survey | 2024-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (96%) | 8 |
| BiasJailbreak: Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models Haebin Seong, Isack Lee Published: 2024-10-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Jailbreaking LLM-Controlled Robots Alexander Robey, George J. Pappas, Hamed Hassani, Vijay Kumar Published: 2024-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (99%) | 1 |
| Persistent Pre-Training Poisoning of LLMs Daphne Ippolito, Eric Michael Smith, Florian Tram猫r, Ivan Evtimov Published: 2024-10-17Area: Adversarial RobustnessCitations: 38 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (93%) | 38 |
| Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models Bingze Lee, Jinghao Cui, Qiongxiu Li, Xiao Li Published: 2024-10-20Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 17 |
| Jailbreaking and Mitigation of Vulnerabilities in Large Language Models Benji Peng, Caitlyn Heqi Yin, Lawrence K.Q. Yan, Ming Liu Published: 2024-10-20Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, survey | 2024-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E7 / R3 (96%) | 27 |
| Erasing Undesirable Concepts in Diffusion Models with Adversarial Preservation Anh Bui, Dinh Phung, Khanh Doan, Long Vuong Published: 2024-10-21Area: Model EditingCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 31 |
| NetSafe: Exploring the Topological Safety of Multi-agent Networks Chenlong Yin, Guibin Zhang, Junyuan Mao, Kun Wang Published: 2024-10-21Area: Agent SafetyCitations: 26 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2024-10-21 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (94%) | 26 |
| SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis Aidan Wong, He Cao, Yu Li, Zijing Liu Published: 2024-10-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents Bo Li, Chejian Xu, Huan Sun, Jiawei Zhang Published: 2024-10-22Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 29 |