Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Adaptive Activation Steering: A Tuning-Free LLM Truthfulness Improvement Method for Diverse Hallucinations Categories Junyi Gao, Liantao Ma, Tianlong Wang, Xianfeng Jiao Published: 2024-05-26Area: Model EditingCitations: 57 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | 57 |
| Large Scale Knowledge Washing Julian McAuley, Ruihan Wu, Xiusi Chen, Yu Wang Published: 2024-05-26Area: Model EditingCitations: 14 Tags: ai-safety, empirical, model-editing | 2024-05-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 14 |
| Medical MLLM Is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models Chengwei Pan, Hantao Zhang, Hao Wang, Jiawen Xi Published: 2024-05-26Area: Multimodal SafetyCitations: 15 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 15 |
| Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer Boyi Liu, Hongyi Guo, Jose Blanchet, Miao Lu Published: 2024-05-26Area: Alignment TrainingCitations: 90 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | 90 |
| Pruning for Robust Concept Erasing in Diffusion Models Chang Xu, Juan Cao, Tianyun Yang Published: 2024-05-26Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 25 |
| Cross-Modal Safety Alignment: Is textual unlearning all you need? Amit K. Roy-Chowdhury, Chengyu Song, Erfan Shayegani, M. Salman Asif Published: 2024-05-27Area: Multimodal SafetyCitations: 25 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-27 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 25 |
| Exploiting the Layered Intrinsic Dimensionality of Deep Models for Practical Adversarial Training Enes Altinisik, Hassan Sajjad, Husrev Taha Sencar, Safa Messaoud Published: 2024-05-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | 1 |
| From Neurons to Neutrons: A Case Study in Interpretability Mike Williams, Niklas Nolte, Ouail Kitouni, Sokratis Trifinopoulos Published: 2024-05-27Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-05-27 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 4 |
| Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models Duen Horng Chau, Matthew Hull, Pin-Yu Chen, ShengYun Peng Published: 2024-05-27Area: Safety EvaluationCitations: 51 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2024-05-27 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (94%) | 51 |
| Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin, Chun-Ying Huang Published: 2024-05-27Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, empirical | 2024-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 105 |
| A Theoretical Understanding of Self-Correction through In-context Alignment Stefanie Jegelka, Yifei Wang, Yisen Wang, Yuyang Wu Published: 2024-05-28Area: Alignment TrainingCitations: 56 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E6 / R4 (93%) | 56 |
| Exploiting LLM Quantization Jingxuan He, Kazuki Egashira, Mark Vero, Martin Vechev Published: 2024-05-28Area: Adversarial RobustnessCitations: 53 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 53 |
| Improved Generation of Adversarial Examples Against Safety-aligned LLMs Hao Chen, Qizhang Li, Wangmeng Zuo, Yiwen Guo Published: 2024-05-28Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 12 |
| Knowledge Circuits in Pretrained Transformers Huajun Chen, Mengru Wang, Ningyu Zhang, Shumin Deng Published: 2024-05-28Area: Mechanistic Interp.Citations: 44 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 44 |
| Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-05-28Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 67 |
| Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization Bochuan Cao, Fenglong Ma, Jinghui Chen, Lu Lin Published: 2024-05-28Area: Representation AnalysisCitations: 81 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2024-05-28 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 81 |
| White-box Multimodal Jailbreaks Against Large Vision-Language Models Chuanjun Ji, Guangnan Ye, Hanxu Zhou, Ruofan Wang Published: 2024-05-28Area: Multimodal SafetyCitations: 47 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 47 |
| AI Risk Management Should Incorporate Both Safety and Security Arvind Narayanan, Bo Li, Boyi Wei, Chaowei Xiao Published: 2024-05-29Area: Surveys & ReviewsCitations: 20 Tags: adversarial-robustness, ai-safety, position, surveys-reviews | 2024-05-29 | Surveys & Reviews | adversarial-robustness, ai-safety, position, surveys-reviews | E5 / R4 (97%) | 20 |
| Efficient Model-agnostic Alignment via Bayesian Persuasion Boyuan Chen, Fengshuo Bai, Mingzhi Wang, Yaodong Yang Published: 2024-05-29Area: Scalable OversightCitations: 10 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-05-29 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 10 |
| One-Shot Safety Alignment for Large Language Models via Optimal Dualization Dongsheng Ding, Edgar Dobriban, Hamed Hassani, Osbert Bastani Published: 2024-05-29Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, theoretical | 2024-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 18 |
| Stress-Testing Capability Elicitation With Password-Locked Models David Krueger, Dmitrii Krasheninnikov, Fabien Roger, Ryan Greenblatt Published: 2024-05-29Area: Safety EvaluationCitations: 26 Tags: ai-safety, empirical, safety-evaluation | 2024-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 26 |
| Voice Jailbreak Attacks Against GPT-4o Michael Backes, Xinyue Shen, Yang Zhang, Yixin Wu Published: 2024-05-29Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 30 |
| Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho, Xiangyu Qi Published: 2024-05-30Area: Adversarial RobustnessCitations: 36 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 36 |
| Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters Andy Zhou, Haibo Jin, Haohan Wang, Joe D. Menke Published: 2024-05-30Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 43 |
| Phantom: General Trigger Attacks on Retrieval Augmented Language Generation Alina Oprea, Christopher A. Choquette-Choo, Cristina Nita-Rotaru, Giorgio Severi Published: 2024-05-30Area: Adversarial RobustnessCitations: 45 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 45 |
| Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-05-31Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 24 |
| OR-Bench: An Over-Refusal Benchmark for Large Language Models Cho-Jui Hsieh, Ion Stoica, Justin Cui, Wei-Lin Chiang Published: 2024-05-31Area: Safety EvaluationCitations: 109 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-31 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 109 |
| Exploring Vulnerabilities and Protections in Large Language Models: A Survey Chenhui Hu, Frank Weizhen Liu Published: 2024-06-01Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, survey | 2024-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E8 / R5 (98%) | 12 |
| The Best of Both Worlds: Toward an Honest and Helpful Large Language Model Chujie Gao, Dongping Chen, Lichao Sun, Qihui Zhang Published: 2024-06-01Area: Deception & FailureCitations: 19 Tags: ai-safety, deception-failure, empirical | 2024-06-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 19 |
| BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling Cristina G芒rbacea, Lin Gui, Victor Veitch Published: 2024-06-02Area: Alignment TrainingCitations: 102 Tags: ai-safety, alignment-training, empirical | 2024-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 102 |