Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Eeg-Defender: Defending against Jailbreak through Early Exit Generation of Large Language Models Chongwen Zhao, Kaizhu Huang, Zhihao Dou Published: 2024-08-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |
| SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering Hai Zhao, Yifei Yang, Zouying Cao Published: 2024-08-21Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-08-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 24 |
| Atoxia: Red-teaming Large Language Models with Target Toxic Answers Anningzhe Gao, Pengyu Cheng, Xiang Wan, Yuhao Du Published: 2024-08-27Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 5 |
| Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models Adel Bibi, Mohamed Elhoseiny, Philip H.S. Torr, Wenxuan Zhang Published: 2024-08-27Area: Alignment TrainingCitations: 24 Tags: ai-safety, alignment-training, empirical | 2024-08-27 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R2 (94%) | 24 |
| LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet Cristina Menghini, Hugh Zhang, Ian Steneker, Nathaniel Li Published: 2024-08-27Area: Adversarial RobustnessCitations: 118 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 118 |
| Understanding the Effectiveness of Coverage Criteria for Large Language Models: A Special Angle from Jailbreak Attacks Haoyu Wang, Kailong Wang, Ling Shi, Shide Zhou Published: 2024-08-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Legilimens: Practical and Unified Content Moderation for Large Language Model Services Jialin Wu, Jiangyi Deng, Jiayang Xu, Shengyuan Pang Published: 2024-08-28Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks Ethan Kosak-Hine, George Ingebretsen, Jason Zhang, Julius Broomfield Published: 2024-08-29Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | 14 |
| Forget to Flourish: Leveraging Machine-Unlearning on Pretrained Language Models for Privacy Leakage Jing Liu, Md Rafi Ur Rashid, Shagufta Mehnaz, Toshiaki Koike-Akino Published: 2024-08-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 13 |
| Safety Layers in Aligned Large Language Models Lan Zhang, Liuyi Yao, Shen Li, Yaliang Li Published: 2024-08-30Area: Mechanistic Interp.Citations: 88 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2024-08-30 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R3 (95%) | 88 |
| The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs Bocheng Chen, Guangjing Wang, Hanqing Guo, Qiben Yan Published: 2024-09-01Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (93%) | 10 |
| Conversational Complexity for Assessing Risk in Large Language Models John Burden, Jose Hernandez-Orallo, Manuel Cebrian Published: 2024-09-02Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-09-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 5 |
| Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-09-03Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-09-03 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 61 |
| From Yes-Men to Truth-Tellers: Addressing Sycophancy in Large Language Models with Pinpoint Tuning Binbin Lin, Deng Cai, Houqiang Li, Jieping Ye Published: 2024-09-03Area: Deception & FailureCitations: 44 Tags: ai-safety, deception-failure, empirical | 2024-09-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 44 |
| Unforgettable Generalization in Language Models Eric Zhang, Jacob Andreas, Leshem Choshen Published: 2024-09-03Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-09-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 4 |
| Evaluating Open-Source Sparse Autoencoders on Disentangling Factual Knowledge in GPT-2 Small Atticus Geiger, Maheep Chaudhary Published: 2024-09-05Area: Mechanistic Interp.Citations: 30 Tags: ai-safety, empirical, mechanistic-interp | 2024-09-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (97%) | 30 |
| Programming Refusal with Conditional Activation Steering Amit Dhurandhar, Bruce W. Lee, Erik Miehling, Inkit Padhi Published: 2024-09-06Area: Model EditingCitations: 87 Tags: ai-safety, empirical, model-editing | 2024-09-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 87 |
| Residual Stream Analysis with Multi-Layer SAEs Conor Houghton, Laurence Aitchison, Lucy Farnik, Tim Lawson Published: 2024-09-06Area: Mechanistic Interp.Citations: 12 Tags: ai-safety, empirical, mechanistic-interp | 2024-09-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 12 |
| Exploring Straightforward Conversational Red-Teaming Ateret Anaby-Tavor, Eitan Farchi, George Kour, Marcel Zalmanovici Published: 2024-09-07Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2024-09-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions Jiansheng Chen, Ruobing Xie, Xingwu Sun, Yudong Zhang Published: 2024-09-08Area: Multimodal SafetyCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-09-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | 9 |
| Unlearning or Concealment? A Critical Analysis and Evaluation Metrics for Unlearning in Diffusion Models Aakash Sen Sharma, Ankur A. Mali, Murari Mandal, Niladri Sarkar Published: 2024-09-09Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-09-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 9 |
| AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs Feng Liu, Jie Wen, Jizhong Han, Lijia Lv Published: 2024-09-11Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 7 |
| Representation Tuning Christopher M. Ackerman Published: 2024-09-11Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-09-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks Ahmed Imteaj, Md Zarif Hossain Published: 2024-09-11Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-09-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 14 |
| Alignment with Preference Optimization Is All You Need for LLM Safety Ahmed Alzubaidi, Ali Khalifa Almansoori, Hakim Hacid, Mohamed El Amine Seddik Published: 2024-09-12Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-09-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 5 |
| Optimal Ablation for Interpretability Lucas Janson, Maximilian Li Published: 2024-09-16Area: Mechanistic Interp.Citations: 14 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-09-16 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R4 (92%) | 14 |
| Jailbreaking Large Language Models with Symbolic Mathematics Emet Bethany, Juan Arturo Nolazco Flores, Mazal Bethany, Peyman Najafirad Published: 2024-09-17Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 10 |
| MEOW: MEMOry Supervised LLM Unlearning Via Inverted Facts Kexin Huang, Ruilin Luo, Tianle Gu, Yan Teng Published: 2024-09-18Area: Model EditingCitations: 17 Tags: ai-safety, empirical, model-editing | 2024-09-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 17 |
| Understanding Implosion in Text-to-Image Generative Models Ben Y. Zhao, Cathy Y. Li, Haitao Zheng, Shawn Shan Published: 2024-09-18Area: Multimodal SafetyCitations: 6 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-09-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R4 (96%) | 6 |
| Language Models Learn to Mislead Humans via RLHF Akbir Khan, Ethan Perez, He He, Jacob Steinhardt Published: 2024-09-19Area: Deception & FailureCitations: 86 Tags: ai-safety, deception-failure, empirical | 2024-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 86 |