Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Prompt Packer: Deceiving LLMs through Compositional Instruction with Hidden Attacks Rui Tang, Shuyu Jiang, Xingshu Chen Published: 2023-10-16Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 34 |
| Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models? Bo Li, Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin Published: 2023-10-16Area: Adversarial RobustnessCitations: 179 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 179 |
| Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks Erfan Shayegani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh, Pedram Zaree Published: 2023-10-16Area: Surveys & ReviewsCitations: 238 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2023-10-16 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R3 (96%) | 238 |
| Compositional Preference Models for Aligning LMs Dongyoung Go, Germán Kruszewski, Jos Rozen, Marc Dymetman Published: 2023-10-17Area: Alignment TrainingCitations: 26 Tags: ai-safety, alignment-training, empirical | 2023-10-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (94%) | 26 |
| Identifying Interpretable Visual Features in Artificial and Biological Neural Systems David Klindt, Francisco Acosta, Frédéric Poitevin, Nina Miolane Published: 2023-10-17Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-10-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 10 |
| A General Theoretical Paradigm to Understand Learning from Human Feedback Bilal Piot, Daniele Calandriello, Daniel Guo, Mark Rowland Published: 2023-10-18Area: Alignment TrainingCitations: 894 Tags: ai-safety, alignment-training, theoretical | 2023-10-18 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (97%) | 894 |
| Improving Generalization of Alignment with Human Preferences through Group Invariant Learning Haoran Huang, Qi Zhang, Rui Zheng, Shihan Dou Published: 2023-10-18Area: Alignment TrainingCitations: 24 Tags: ai-safety, alignment-training, empirical | 2023-10-18 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 24 |
| Sociotechnical Safety Evaluation of Generative AI Systems Arianna Manzini, Ben Bariach, Conor Griffin, Iason Gabriel Published: 2023-10-18Area: Safety EvaluationCitations: 190 Tags: ai-safety, safety-evaluation, survey | 2023-10-18 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R4 (96%) | 190 |
| The Curious Case of Hallucinatory (Un)answerability: Finding Truths in the Hidden States of Over-Confident Large Language Models Avi Caciularu, Aviv Slobodkin, Ido Dagan, Omer Goldman Published: 2023-10-18Area: Representation AnalysisCitations: 52 Tags: ai-safety, empirical, representation-analysis | 2023-10-18 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (95%) | 52 |
| Attack Prompt Generation for Red Teaming and Defending Large Language Models Boyi Deng, Fuli Feng, Qifan Wang, Wenjie Wang Published: 2023-10-19Area: Adversarial RobustnessCitations: 92 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (93%) | 92 |
| Prompt Injection Attacks and Defenses in LLM-Integrated Applications Jinyuan Jia, Neil Zhenqiang Gong, Runpeng Geng, Yupei Liu Published: 2023-10-19Area: Adversarial RobustnessCitations: 236 Tags: adversarial-robustness, ai-safety, benchmark | 2023-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (93%) | 236 |
| Safe RLHF: Safe Reinforcement Learning from Human Feedback Jiaming Ji, Josef Dai, Mickel Liu, Ruiyang Sun Published: 2023-10-19Area: Alignment TrainingCitations: 574 Tags: ai-safety, alignment-training, empirical | 2023-10-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 574 |
| SalUn: Empowering Machine Unlearning via Gradient-based Weight Saliency in Both Image Classification and Generation Chongyu Fan, Dennis Wei, Eric Wong, Jiancheng Liu Published: 2023-10-19Area: Model EditingCitations: 290 Tags: ai-safety, empirical, model-editing | 2023-10-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 290 |
| Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models Ben Y. Zhao, Haitao Zheng, Josephine Passananti, Shawn Shan Published: 2023-10-20Area: Adversarial RobustnessCitations: 91 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 91 |
| Specific versus General Principles for Constitutional AI Amanda Askell, Andrew Callahan, Anna Chen, Anna Goldie Published: 2023-10-20Area: Alignment TrainingCitations: 45 Tags: ai-safety, alignment-training, empirical | 2023-10-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 45 |
| The History and Risks of Reinforcement Learning and Human Feedback Nathan Lambert, Thomas Krendl Gilbert, Tom Zick Published: 2023-10-20Area: Alignment TrainingCitations: 50 Tags: ai-safety, alignment-training, safety-evaluation, survey | 2023-10-20 | Alignment Training | ai-safety, alignment-training, safety-evaluation, survey | E5 / R3 (96%) | 50 |
| Towards Understanding Sycophancy in Language Models Amanda Askell, David Duvenaud, Da Yan, Esin Durmus Published: 2023-10-20Area: Deception & FailureCitations: 553 Tags: ai-safety, deception-failure, empirical | 2023-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 553 |
| Language Model Unalignment: Parametric Red-Teaming to Expose Hidden Harms and Biases Rishabh Bhardwaj, Soujanya Poria Published: 2023-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2023-10-22 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 23 |
| AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models Ani Nenkova, Bang An, Furong Huang, Gang Wu Published: 2023-10-23Area: Adversarial RobustnessCitations: 93 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 93 |
| Function Vectors in Large Language Models Aaron Mueller, Arnab Sen Sharma, Byron C. Wallace, David Bau Published: 2023-10-23Area: Mechanistic Interp.Citations: 201 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 201 |
| Linear Representations of Sentiment in Large Language Models Atticus Geiger, Curt Tigges, Neel Nanda, Oskar John Hollinsworth Published: 2023-10-23Area: Representation AnalysisCitations: 131 Tags: ai-safety, empirical, representation-analysis | 2023-10-23 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (95%) | 131 |
| Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition Anaum Khan, Anson Liu Kost, Chenglei Si, Christopher Carnahan Published: 2023-10-24Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 66 |
| In-Context Learning Creates Task Vectors Amir Globerson, Mor Geva, Roee Hendel Published: 2023-10-24Area: Mechanistic Interp.Citations: 258 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 258 |
| Attention Lens: A Tool for Mechanistically Interpreting the Attention Head Information Retrieval Mechanism André Bauer, Arham Khan, Aswathy Ajith, Daniel Grzenda Published: 2023-10-25Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, mechanistic-interp, tool | 2023-10-25 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (95%) | 18 |
| Multi-scale Diffusion Denoised Smoothing Jinwoo Shin, Jongheon Jeong Published: 2023-10-25Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2023-10-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 14 |
| SuperHF: Supervised Iterative Learning from Human Feedback Gabriel Mukobi, Gitta Kutyniok, Kush Bhatia, Oliver Fong Published: 2023-10-25Area: Alignment TrainingCitations: 13 Tags: ai-safety, alignment-training, empirical | 2023-10-25 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 13 |
| Zephyr: Direct Distillation of LM Alignment Alexander M. Rush, Clémentine Fourrier, Edward Beeching, Kashif Rasul Published: 2023-10-25Area: Alignment TrainingCitations: 542 Tags: ai-safety, alignment-training, empirical | 2023-10-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 542 |
| Codebook Features: Sparse and Discrete Interpretability for Neural Networks Alex Tamkin, Mohammad Taufeeque, Noah D. Goodman Published: 2023-10-26Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-10-26 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 41 |
| How Do Language Models Bind Entities in Context? Jacob Steinhardt, Jiahai Feng Published: 2023-10-26Area: Mechanistic Interp.Citations: 70 Tags: ai-safety, empirical, mechanistic-interp | 2023-10-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 70 |
| Managing AI Risks in an Era of Rapid Progress Anca Dragan, Andrew Yao, Ashwin Acharya, Atılım Güneş Baydin Published: 2023-10-26Area: Surveys & ReviewsCitations: 80 Tags: ai-safety, position, surveys-reviews | 2023-10-26 | Surveys & Reviews | ai-safety, position, surveys-reviews | E5 / R3 (93%) | 80 |