Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SALMON: Self-Alignment with Principle-Following Reward Models Chuang Gan, David Cox, Hongxin Zhang, Qinhong Zhou Published: 2023-10-09Area: Alignment TrainingCitations: 55 Tags: ai-safety, alignment-training, empirical | 2023-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 55 |
| The Importance of Prompt Tuning for Automated Neuron Explanations Arjun Chatha, Justin Lee, Keng-Chi Chang, Tsui-Wei Weng Published: 2023-10-09Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 11 |
| Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation Danqi Chen, Kai Li, Mengzhou Xia, Samyak Gupta Published: 2023-10-10Area: Adversarial RobustnessCitations: 437 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R4 (96%) | 437 |
| Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations Yifei Wang, Yisen Wang, Zeming Wei Published: 2023-10-10Area: Adversarial RobustnessCitations: 423 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (95%) | 423 |
| Multilingual Jailbreak Challenges in Large Language Models Lidong Bing, Sinno Jialin Pan, Wenxuan Zhang, Yue Deng Published: 2023-10-10Area: Adversarial RobustnessCitations: 207 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 207 |
| The Geometry of Truth: Emergent Linear Structure in LLM Representations of True/False Datasets Max Tegmark, Samuel Marks Published: 2023-10-10Area: Representation AnalysisCitations: 402 Tags: ai-safety, empirical, representation-analysis | 2023-10-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 402 |
| Understanding the Effects of RLHF on LLM Generalisation and Diversity Christoforos Nalmpantis, Edward Grefenstette, Eric Hambro, Ishita Mediratta Published: 2023-10-10Area: Alignment TrainingCitations: 295 Tags: ai-safety, alignment-training, empirical | 2023-10-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 295 |
| An Adversarial Example for Direct Logit Attribution: Memory Management in GELU-4L Can Rager, James Dao, Jett Janiak, Yeu-Tong Lau Published: 2023-10-11Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-10-11 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 6 |
| In-Context Unlearning: Language Models as Few Shot Unlearners Himabindu Lakkaraju, Martin Pawelczyk, Seth Neel Published: 2023-10-11Area: Model EditingCitations: 197 Tags: ai-safety, empirical, model-editing | 2023-10-11 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 197 |
| Circuit Component Reuse Across Tasks in Transformer Language Models Carsten Eickhoff, Ellie Pavlick, Jack Merullo Published: 2023-10-12Area: Mechanistic Interp.Citations: 99 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (96%) | 99 |
| Interpreting Learned Feedback Patterns in Large Language Models Amir Abdullah, Clement Neo, Fazl Barez, Luke Marks Published: 2023-10-12Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 5 |
| Jailbreaking Black Box Large Language Models in Twenty Queries Alexander Robey, Edgar Dobriban, Eric Wong, George J. Pappas Published: 2023-10-12Area: Adversarial RobustnessCitations: 1175 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1175 |
| Understanding and Controlling a Maze-Solving Policy Network Alexander Matt Turner, Austin Meek, Monte MacDiarmid, Mrinank Sharma Published: 2023-10-12Area: Mechanistic Interp.Citations: 22 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | 22 |
| Large Language Model Unlearning Xiaojun Xu, Yang Liu, Yuanshun Yao Published: 2023-10-14Area: Model EditingCitations: 248 Tags: ai-safety, empirical, model-editing | 2023-10-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (92%) | 248 |
| Attribution Patching Outperforms Automated Circuit Discovery Aaquib Syed, Arthur Conmy, Can Rager Published: 2023-10-16Area: Mechanistic Interp.Citations: 108 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 108 |
| Prompt Packer: Deceiving LLMs through Compositional Instruction with Hidden Attacks Rui Tang, Shuyu Jiang, Xingshu Chen Published: 2023-10-16Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 34 |
| Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models? Bo Li, Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin Published: 2023-10-16Area: Adversarial RobustnessCitations: 179 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 179 |
| Compositional Preference Models for Aligning LMs Dongyoung Go, Germ谩n Kruszewski, Jos Rozen, Marc Dymetman Published: 2023-10-17Area: Alignment TrainingCitations: 26 Tags: ai-safety, alignment-training, empirical | 2023-10-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (94%) | 26 |
| Identifying Interpretable Visual Features in Artificial and Biological Neural Systems David Klindt, Francisco Acosta, Fr茅d茅ric Poitevin, Nina Miolane Published: 2023-10-17Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-10-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 10 |
| Improving Generalization of Alignment with Human Preferences through Group Invariant Learning Haoran Huang, Qi Zhang, Rui Zheng, Shihan Dou Published: 2023-10-18Area: Alignment TrainingCitations: 24 Tags: ai-safety, alignment-training, empirical | 2023-10-18 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 24 |
| The Curious Case of Hallucinatory (Un)answerability: Finding Truths in the Hidden States of Over-Confident Large Language Models Avi Caciularu, Aviv Slobodkin, Ido Dagan, Omer Goldman Published: 2023-10-18Area: Representation AnalysisCitations: 52 Tags: ai-safety, empirical, representation-analysis | 2023-10-18 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (95%) | 52 |
| Attack Prompt Generation for Red Teaming and Defending Large Language Models Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang Published: 2023-10-19Area: Adversarial RobustnessCitations: 92 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 92 |
| Safe RLHF: Safe Reinforcement Learning from Human Feedback Jiaming Ji, Josef Dai, Mickel Liu, Ruiyang Sun Published: 2023-10-19Area: Alignment TrainingCitations: 574 Tags: ai-safety, alignment-training, empirical | 2023-10-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 574 |
| SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation Chongyu Fan, Dennis Wei, Eric Wong, Jiancheng Liu Published: 2023-10-19Area: Model EditingCitations: 290 Tags: ai-safety, empirical, model-editing | 2023-10-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 290 |
| Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models Ben Y. Zhao, Haitao Zheng, Josephine Passananti, Shawn Shan Published: 2023-10-20Area: Adversarial RobustnessCitations: 91 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 91 |
| Specific versus General Principles for Constitutional AI Amanda Askell, Andrew Callahan, Anna Chen, Anna Goldie Published: 2023-10-20Area: Alignment TrainingCitations: 45 Tags: ai-safety, alignment-training, empirical | 2023-10-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 45 |
| Towards Understanding Sycophancy in Language Models Amanda Askell, David Duvenaud, Da Yan, Esin Durmus Published: 2023-10-20Area: Deception & FailureCitations: 553 Tags: ai-safety, deception-failure, empirical | 2023-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 553 |
| Language Model Unalignment: Parametric Red-Teaming to Expose Hidden Harms and Biases Rishabh Bhardwaj, Soujanya Poria Published: 2023-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-10-22 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 23 |
| AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models Ani Nenkova, Bang An, Furong Huang, Gang Wu Published: 2023-10-23Area: Adversarial RobustnessCitations: 93 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 93 |
| Function Vectors in Large Language Models Aaron Mueller, Arnab Sen Sharma, Byron C. Wallace, David Bau Published: 2023-10-23Area: Mechanistic Interp.Citations: 201 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 201 |