Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Backdoor Attacks for In-Context Learning with Language Models Florian Tram猫r, Matthew Jagielski, Nicholas Carlini, Nikhil Kandpal Published: 2023-07-27Area: Adversarial RobustnessCitations: 111 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 111 |
| Universal and Transferable Adversarial Attacks on Aligned Language Models Andy Zou, J. Zico Kolter, Matt Fredrikson, Milad Nasr Published: 2023-07-27Area: Adversarial RobustnessCitations: 2514 Tags: adversarial-robustness, ai-safety, empirical | 2023-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2514 |
| The Hydra Effect: Emergent Self-repair in Language Model Computations Janos Kramar, Matthew Rahtz, Shane Legg, Thomas McGrath Published: 2023-07-28Area: Mechanistic Interp.Citations: 96 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-07-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | 96 |
| Circumventing Concept Erasure Methods For Text-to-Image Generative Models Chinmay Hegde, Govind Mittal, Kelly O. Marshall, Minh Pham Published: 2023-08-03Area: Adversarial RobustnessCitations: 73 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 73 |
| "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models Michael Backes, Xinyue Shen, Yang Zhang, Yun Shen Published: 2023-08-07Area: Adversarial RobustnessCitations: 497 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (97%) | 497 |
| Simple synthetic data reduces sycophancy in large language models Da Huang, Denny Zhou, Jerry Wei, Quoc V. Le Published: 2023-08-07Area: Deception & FailureCitations: 112 Tags: ai-safety, deception-failure, empirical | 2023-08-07 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 112 |
| Studying Large Language Model Generalization with Influence Functions Alex Tamkin, Amirhossein Tajdini, Benoit Steiner, Cem Anil Published: 2023-08-07Area: Training DynamicsCitations: 286 Tags: ai-safety, empirical, training-dynamics | 2023-08-07 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (94%) | 286 |
| FLIRT: Feedback Loop In-context Red Teaming Aram Galstyan, Christophe Dupuy, Kai-Wei Chang, Ninareh Mehrabi Published: 2023-08-08Area: Safety EvaluationCitations: 93 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-08-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 93 |
| GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher Jen-tse Huang, Pinjia He, Shuming Shi, Wenxiang Jiao Published: 2023-08-12Area: Adversarial RobustnessCitations: 408 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-08-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 408 |
| Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models Michael Backes, Tianshuo Cong, Yang Zhang, Yugeng Liu Published: 2023-08-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 11 |
| Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation Baotian Hu, Dongfang Li, Min Zhang, Xinshuo Hu Published: 2023-08-16Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2023-08-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | 40 |
| Linearity of Relation Decoding in Transformer Language Models Arnab Sen Sharma, David Bau, Evan Hernandez, Jacob Andreas Published: 2023-08-17Area: Representation AnalysisCitations: 146 Tags: ai-safety, empirical, representation-analysis | 2023-08-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (90%) | 146 |
| Precise Model Editing in a Transformer (PMET) Jie Yu, Jing Yang, Jun Ma, Shasha Li Published: 2023-08-17Area: Model EditingCitations: 190 Tags: ai-safety, empirical, model-editing | 2023-08-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 190 |
| Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment Rishabh Bhardwaj, Soujanya Poria Published: 2023-08-18Area: Safety EvaluationCitations: 229 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2023-08-18 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 229 |
| Activation Addition: Steering Language Models Without Optimization Alexander Matt Turner, David Udell, Gavin Leech, Lisa Thiergart Published: 2023-08-20Area: Representation AnalysisCitations: 362 Tags: ai-safety, empirical, representation-analysis | 2023-08-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 362 |
| Adversarial Illusions in Multi-Modal Embeddings Eugene Bagdasaryan, Rishi Jha, Tingwei Zhang, Vitaly Shmatikov Published: 2023-08-22Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-08-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 30 |
| Unified Concept Editing in Diffusion Models David Bau, Hadas Orgad, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-08-25Area: Model EditingCitations: 320 Tags: ai-safety, empirical, model-editing | 2023-08-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 320 |
| Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content Charles O'Neill, Ioana Ciuc膬, Jack Miller, Thang Bui Published: 2023-08-26Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 10 |
| Detecting Language Model Attacks with Perplexity Gabriel Alon, Michael Kamfonas Published: 2023-08-27Area: Adversarial RobustnessCitations: 392 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 392 |
| Baseline Defenses for Adversarial Attacks Against Aligned Language Models Aniruddha Saha, Avi Schwarzschild, Gowthami Somepalli, John Kirchenbauer Published: 2023-09-01Area: Adversarial RobustnessCitations: 612 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 612 |
| Efficient RLHF: Reducing the Memory Usage of PPO Han Yu, Michael Santacroce, Yadong Lu, Yelong Shen Published: 2023-09-01Area: Alignment TrainingCitations: 42 Tags: ai-safety, alignment-training, empirical | 2023-09-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 42 |
| Image Hijacks: Adversarial Images can Control Generative Models at Runtime Euan Ong, Luke Bailey, Scott Emmons, Stuart Russell Published: 2023-09-01Area: Multimodal SafetyCitations: 146 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (99%) | 146 |
| RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback Abhinav Rastogi, Colton Bishop, Ethan Hall, Harrison Lee Published: 2023-09-01Area: Alignment TrainingCitations: 538 Tags: ai-safety, alignment-training, empirical | 2023-09-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 538 |
| Taken out of Context: On Measuring Situational Awareness in LLMs Asa Cooper Stickland, Daniel Kokotajlo, Lukas Berglund, Max Kaufmann Published: 2023-09-01Area: Safety EvaluationCitations: 107 Tags: ai-safety, empirical, safety-evaluation | 2023-09-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 107 |
| Open Sesame! Universal Black Box Jailbreaking of Large Language Models Moshe Sipper, Raz Lapid, Ron Langberg Published: 2023-09-04Area: Adversarial RobustnessCitations: 155 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 155 |
| Explaining Grokking Through Circuit Efficiency J谩nos Kram谩r, Ramana Kumar, Rohin Shah, Vikrant Varma Published: 2023-09-05Area: Training DynamicsCitations: 80 Tags: ai-safety, empirical, training-dynamics | 2023-09-05 | Training Dynamics | ai-safety, empirical, training-dynamics | E6 / R3 (93%) | 80 |
| Certifying LLM Safety against Adversarial Prompting Aaron Jiaxun Li, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju Published: 2023-09-06Area: Adversarial RobustnessCitations: 287 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (93%) | 287 |
| Neurons in Large Language Models: Dead, N-gram, Positional Christoforos Nalmpantis, Elena Voita, Javier Ferrando Published: 2023-09-09Area: Mechanistic Interp.Citations: 75 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 75 |
| Uncovering Mesa-Optimization Algorithms in Transformers Alexander Meulemans, Blaise Ag眉era y Arcas, Eyvind Niklasson, Jo茫o Sacramento Published: 2023-09-11Area: Mechanistic Interp.Citations: 86 Tags: ai-safety, empirical, mechanistic-interp | 2023-09-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 86 |
| Circuit Breaking: Removing Model Behaviors with Targeted Ablation Maximilian Li, Max Nadeau, Xander Davies Published: 2023-09-12Area: Model EditingCitations: 34 Tags: ai-safety, empirical, model-editing | 2023-09-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (94%) | 34 |