Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks Nathalie Maria Kirch, Severin Field, Stephen Casper Published: 2024-11-02Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 23 |
| SQL Injection Jailbreak: a structural disaster of large language models Jiawei Zhao, Kejiang Chen, Nenghai Yu, Weiming Zhang Published: 2024-11-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 6 |
| UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models Donghyun Kim, Eric Ma, Gaurav Verma, Megha Sharma Published: 2024-11-03Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (97%) | 14 |
| Adaptive Sparse Allocation with Mutual Choice & Feature Choice Sparse Autoencoders Kola Ayonrinde Published: 2024-11-04Area: Mechanistic Interp.Citations: 8 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 8 |
| Attacking Vision-Language Computer Agents via Pop-ups Diyi Yang, Tao Yu, Yanzhe Zhang Published: 2024-11-04Area: Adversarial RobustnessCitations: 80 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 80 |
| Enhancing Multiple Dimensions of Trustworthiness in LLMs via Sparse Activation Control Binbin Lin, Chaoqun Wan, Jieping Ye, Wenxiao Wang Published: 2024-11-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-11-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 5 |
| Extracting Unlearned Information from LLMs with Activation Steering Aleksei Kuvshinov, Atakan Seyito臒lu, Leo Schwinn, Stephan G眉nnemann Published: 2024-11-04Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-11-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 14 |
| Improving Steering Vectors by Targeting Sparse Autoencoder Features Arthur Conmy, Matthew Siu, Sviatoslav Chalnev Published: 2024-11-04Area: Representation AnalysisCitations: 53 Tags: ai-safety, empirical, representation-analysis | 2024-11-04 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 53 |
| On Targeted Manipulation and Deception when Optimizing LLMs for User Feedback Adhyyan Narang, Anca Dragan, Brendan Murphy, Constantin Weisser Published: 2024-11-04Area: Deception & FailureCitations: 44 Tags: ai-safety, deception-failure, empirical | 2024-11-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (93%) | 44 |
| Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment Gagandeep Singh, Gaokai Zhang, Hangoo Kang, Jason Vega Published: 2024-11-05Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| A Implies B: Circuit Analysis in LLMs for Propositional Logical Reasoning Cyrus Rashtchian, Enming Luo, Guan Zhe Hong, Nishanth Dikkala Published: 2024-11-06Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 4 |
| Diversity Helps Jailbreak Large Language Models Chengzhi Mao, Daniel Ben-Levi, Junfeng Yang, Weiliang Zhao Published: 2024-11-06Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 4 |
| MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue Chongwen Wang, Fengxiang Wang, Hang Su, Hui Xue Published: 2024-11-06Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 29 |
| Unfair Alignment: Examining Safety Alignment Across Vision Encoder Layers in Vision-Language Models Amit K. Roy-Chowdhury, Arindam Dutta, Chengyu Song, Erfan Shayegani Published: 2024-11-06Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-06 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 2 |
| Adversarial Robustness of In-Context Learning in Transformers for Linear Regression David Krueger, Johannes von Oswald, Louis Kirsch, Spencer Frei Published: 2024-11-07Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| Towards Unifying Interpretability and Control: Evaluation via Intervention Asma Ghandeharioun, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2024-11-07Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2024-11-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (94%) | 20 |
| Unlearning in- vs. out-of-distribution data in LLMs under gradient-based method Daniel Tarlow, Fabian Pedregosa, Gintare Karolina Dziugaite, Pascal Lamblin Published: 2024-11-07Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-11-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 4 |
| Ablation is Not Enough to Emulate DPO: How Neuron Dynamics Drive Toxicity Reduction Adam Mahdi, Filip Sondej, Harry Mayne, Yushi Yang Published: 2024-11-10Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R2 (95%) | 3 |
| SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains Bijoy Ahmed Saiem, Md Rafi ur Rashid, MD Sadik Hossain Shanto, Rakib Ahsan Published: 2024-11-10Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 11 |
| Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks David Krueger, Dmitrii Krasheninnikov, Joe Kwon, Madeline Brumley Published: 2024-11-11Area: Representation AnalysisCitations: 14 Tags: ai-safety, empirical, representation-analysis | 2024-11-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (95%) | 14 |
| SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs Bj枚rn Deiseroth, Felix Friedrich, Kristian Kersting, Manuel Brack Published: 2024-11-11Area: Representation AnalysisCitations: 8 Tags: ai-safety, empirical, representation-analysis | 2024-11-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (99%) | 8 |
| Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset Golnoosh Farnadi, Jackie CK Cheung, Jonathan Cola莽o Carr, Khaoula Chehbouni Published: 2024-11-12Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 7 |
| Constrain Alignment with Sparse Autoencoders Chak Tou Leong, Hanqi Yan, Jun Wang, Linyi Yang Published: 2024-11-12Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2024-11-12 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 10 |
| Can sparse autoencoders be used to decompose and interpret steering vectors? Adam Mahdi, Harry Mayne, Yushi Yang Published: 2024-11-13Area: Representation AnalysisCitations: 15 Tags: ai-safety, empirical, representation-analysis | 2024-11-13 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 15 |
| Dynamic Rewarding with Prompt Optimization Enables Tuning-free Self-Alignment of Language Models Abdullah Ashfaq, Eric P. Xing, Somanshu Singla, Tianyang Liu Published: 2024-11-13Area: Alignment TrainingCitations: 12 Tags: ai-safety, alignment-training, empirical | 2024-11-13 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 12 |
| The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense Fangkai Jiao, Liqiang Nie, Mohan Kankanhalli, Yangyang Guo Published: 2024-11-13Area: Multimodal SafetyCitations: 19 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-13 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 19 |
| Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment Jinsheng Shi, Qinhong Lin, Yuang Cai, Yuyu Yuan Published: 2024-11-14Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-11-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 5 |
| Features that Make a Difference: Leveraging Gradients for Improved Dictionary Learning Bryce Hepner, David Wingate, Jared Wilson, Jeffrey Olmo Published: 2024-11-15Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 4 |
| Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations Eric Smith, Hongyuan Zhan, Javier Rando, Jianfeng Chi Published: 2024-11-15Area: Multimodal SafetyCitations: 93 Tags: ai-safety, empirical, multimodal-safety | 2024-11-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 93 |
| Mitigating Sycophancy in Decoder-Only Transformer Architectures: Synthetic Data Intervention Libo Wang Published: 2024-11-15Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-11-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |