Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Evil Geniuses: Delving into the Safety of LLM-based Agents Hang Su, Jingyuan Zhang, Xiao Yang, Yinpeng Dong Published: 2023-11-20Area: Agent SafetyCitations: 101 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2023-11-20 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E7 / R4 (95%) | 101 |
| Exploiting Large Language Models (LLMs) through Deception Techniques and Persuasion Principles Akbar Siami Namin, Faranak Abri, Sonali Singh Published: 2023-11-24Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 29 |
| Universal Jailbreak Backdoors from Poisoned Human Feedback Florian Tram猫r, Javier Rando Published: 2023-11-24Area: Adversarial RobustnessCitations: 115 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 115 |
| Scalable Extraction of Training Data from (Production) Language Models A. Feder Cooper, Christopher A. Choquette-Choo, Daphne Ippolito, Eric Wallace Published: 2023-11-28Area: Adversarial RobustnessCitations: 495 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (94%) | 495 |
| The Philosopher's Stone: Trojaning Plugins of Large Language Models Guoxing Chen, Haojin Zhu, Minhui Xue, Rayne Holland Published: 2023-12-01Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 31 |
| Tree of Attacks: Jailbreaking Black-Box LLMs Automatically Amin Karbasi, Anay Mehrotra, Blaine Nelson, Hyrum Anderson Published: 2023-12-04Area: Adversarial RobustnessCitations: 500 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 500 |
| Scaling Laws for Adversarial Attacks on Language Model Activations Stanislav Fort Published: 2023-12-05Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | 20 |
| Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations Brian Fuller, Davide Testuggine, Hakan Inan, Jianfeng Chi Published: 2023-12-07Area: Adversarial RobustnessCitations: 813 Tags: adversarial-robustness, ai-safety, tool | 2023-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 813 |
| Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack Cong Liu, Wen Xiao, Yue Dong, Yufei Li Published: 2023-12-12Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (94%) | 10 |
| Forbidden Facts: An Investigation of Competing Objectives in Llama-2 Kaivalya Hariharan, Miles Wang, Nir Shavit, Tony T. Wang Published: 2023-12-14Area: Mechanistic Interp.Citations: 3 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-12-14 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 3 |
| A Mutation-Based Method for Multi-Modal Jailbreaking Attack Detection Cen Zhang, Chao Shen, Tianlin Li, Xiaofei Xie Published: 2023-12-17Area: Adversarial RobustnessCitations: 44 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 44 |
| Bypassing the Safety Training of Open-Source LLMs with Priming Attacks Changming Xu, Gagandeep Singh, Isha Chaudhary, Jason Vega Published: 2023-12-19Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 43 |
| Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models Bin Zhu, Emre Kiciman, Fangzhao Wu, Guangzhong Sun Published: 2023-12-21Area: Adversarial RobustnessCitations: 172 Tags: adversarial-robustness, ai-safety, benchmark | 2023-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 172 |
| Exploiting Novel GPT-4 APIs Adam Gleave, Euan McLean, Kellin Pelrine, Micha艂 Zaj膮c Published: 2023-12-21Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 28 |
| Jatmo: Prompt Injection Defense by Task-Specific Finetuning Basel Alomair, Chawin Sitawarin, David Wagner, Elizabeth Sun Published: 2023-12-29Area: Adversarial RobustnessCitations: 102 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 102 |
| Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training Adam Jermyn, Amanda Askell, Ansh Radhakrishnan, Buck Shlegeris Published: 2024-01-10Area: Deception & FailureCitations: 303 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-01-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E8 / R3 (97%) | 303 |
| Manipulating Feature Visualizations with Gradient Slingshots Alexander Warnecke, Dilyara Bareeva, Kirill Bykov, Klaus-Robert M眉ller Published: 2024-01-11Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning Fengjun Pan, Jinming Wen, Luu Anh Tuan, Meihuizi Jia Published: 2024-01-11Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 73 |
| How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs Diyi Yang, Hongpeng Lin, Jingwen Zhang, Ruoxi Jia Published: 2024-01-12Area: Adversarial RobustnessCitations: 529 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 529 |
| Intention Analysis Makes LLMs A Good Jailbreak Defender Dacheng Tao, Lefei Zhang, Liang Ding, Yuqi Zhang Published: 2024-01-12Area: Adversarial RobustnessCitations: 63 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 63 |
| Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective Changze Lv, Muling Wu, Shihan Dou, Tianlong Li Published: 2024-01-12Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 34 |
| AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models Beichen Wang, Chong Zhang, Dong Shu, Mingyu Jin Published: 2024-01-17Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-01-17 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 27 |
| BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Radha Poovendran Published: 2024-01-20Area: Adversarial RobustnessCitations: 85 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 85 |
| Fluent dreaming for language models Michael Sklar, T. Ben Thompson, Zygimantas Straznickas Published: 2024-01-24Area: Mechanistic Interp.Citations: 4 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-01-24 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E4 / R2 (97%) | 4 |
| Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models Jianling Qiu, Wei Zhang, Yunhong He, Zhengqing Yuan Published: 2024-01-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 3 |
| Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks Andy Zhou, Bo Li, Haohan Wang Published: 2024-01-30Area: Adversarial RobustnessCitations: 141 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 141 |
| Security and Privacy Challenges of Large Language Models: A Survey Badhan Chandra Das, M. Hadi Amini, Yanzhao Wu Published: 2024-01-30Area: Surveys & ReviewsCitations: 351 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-01-30 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 351 |
| Weak-to-Strong Jailbreaking on Large Language Models Chao Du, Lei Li, Tianyu Pang, William Yang Wang Published: 2024-01-30Area: Adversarial RobustnessCitations: 96 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 96 |
| Building Guardrails for Large Language Models Gaojie Jin, Jie Meng, Jinwei Hu, Ronghui Mu Published: 2024-02-02Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, position | 2024-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 74 |
| Preference Poisoning Attacks on Reward Model Learning Chaowei Xiao, Chenguang Wang, Jiongxiao Wang, Junlin Wu Published: 2024-02-02Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 12 |