Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Enhancing LLM Safety via Constrained Direct Preference Optimization Xiaolin Sun, Zixuan Liu, Zizhan Zheng Published: 2024-03-04Area: Alignment TrainingCitations: 41 Tags: ai-safety, alignment-training, empirical | 2024-03-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 41 |
| Guardrail Baselines for Unlearning in LLMs Pratiksha Thaker, Virginia Smith, Yash Maurya Published: 2024-03-05Area: Model EditingCitations: 84 Tags: ai-safety, empirical, model-editing | 2024-03-05 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 84 |
| Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications Ben Nassi, Ron Bitton, Stav Cohen Published: 2024-03-05Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 43 |
| Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought Edward Rees, Ethan Perez, Hunar Batra, James Chua Published: 2024-03-08Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-03-08 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 25 |
| Latent Adversarial Training Dylan Hadfield-Menell, Lennart Schulze, Oam Patel, Stephen Casper Published: 2024-03-08Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 66 |
| Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation Hongning Wang, Jean-Fran莽ois Ton, Wei Shen, Xiaoying Zhang Published: 2024-03-08Area: Alignment TrainingCitations: 23 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 23 |
| Extending Activation Steering to Broad Skills and Multiple Behaviours Massimo Poesio, Nandi Schoots, Teun van der Weij Published: 2024-03-09Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-03-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | 26 |
| MACE: Mass Concept Erasure in Diffusion Models Adams Wai-Kin Kong, Leyang Li, Shilin Lu, Yanzhu Liu Published: 2024-03-10Area: Model EditingCitations: 232 Tags: ai-safety, empirical, model-editing | 2024-03-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 232 |
| Stealing Part of a Production Language Model A. Feder Cooper, Arthur Conmy, Daniel Paleka, David Rolnick Published: 2024-03-11Area: Adversarial RobustnessCitations: 147 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 147 |
| Exploring Safety Generalization Challenges of Large Language Models via Code Chang Gao, Jing Shao, Junchi Yan, Lizhuang Ma Published: 2024-03-12Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (97%) | 61 |
| Distract Large Language Models for Automatic Jailbreak Attack Guanhua Chen, Yan Yang, Yun Chen, Zeguan Xiao Published: 2024-03-13Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 46 |
| Ethos: Rectifying Language Models in Orthogonal Parameter Space Lei Gao, Murali Annavaram, Salman Avestimehr, Tingting Tang Published: 2024-03-13Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 20 |
| AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting Chaowei Xiao, Muhao Chen, Xiaogeng Liu, Yu Li Published: 2024-03-14Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 106 |
| Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision Chuang Gan, Longhui Yu, Sean Welleck, Weiyang Liu Published: 2024-03-14Area: Scalable OversightCitations: 103 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-03-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (95%) | 103 |
| Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation Dit-Yan Yeung, Hang Xu, James T. Kwok, Kai Chen Published: 2024-03-14Area: Multimodal SafetyCitations: 110 Tags: ai-safety, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 110 |
| Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models Hangyu Guo, Ji-Rong Wen, Kun Zhou, Wayne Xin Zhao Published: 2024-03-14Area: Multimodal SafetyCitations: 101 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 101 |
| Monotonic Representation of Numeric Properties in Language Models Benjamin Heinzerling, Kentaro Inui Published: 2024-03-15Area: Representation AnalysisCitations: 13 Tags: ai-safety, empirical, representation-analysis | 2024-03-15 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 13 |
| SelfIE: Self-Interpretation of Large Language Model Embeddings Carl Vondrick, Chengzhi Mao, Haozhe Chen Published: 2024-03-16Area: Representation AnalysisCitations: 51 Tags: ai-safety, empirical, representation-analysis | 2024-03-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (96%) | 51 |
| Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment Bowen Yu, Feifan Song, Fei Huang, Haiyang Yu Published: 2024-03-17Area: Alignment TrainingCitations: 25 Tags: ai-safety, alignment-training, empirical | 2024-03-17 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (94%) | 25 |
| Hiding and Recovering Knowledge in Text-to-Image Diffusion Models via Learnable Prompts Anh Bui, Dinh Phung, Khanh Doan, Paul Montague Published: 2024-03-18Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-03-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content Bo Li, Dawn Song, Ning Yu, Ruoxi Jia Published: 2024-03-19Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 67 |
| BadEdit: Backdooring Large Language Models by Model Editing Jian Zhang, Kangjie Chen, Shangqing Liu, Tianlin Li Published: 2024-03-20Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 104 |
| FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs Jingyun Zhang, Jinmin Li, Kuofeng Gao, Shu-tao Xia Published: 2024-03-20Area: Multimodal SafetyCitations: 12 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 12 |
| Testing the Limits of Jailbreaking Defenses with the Purple Problem Aditi Raghunathan, Suhas Kotha, Taeyoun Kim Published: 2024-03-20Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 8 |
| Detoxifying Large Language Models via Knowledge Editing Huajun Chen, Jindong Wang, Linyi Yang, Mengru Wang Published: 2024-03-21Area: Model EditingCitations: 93 Tags: ai-safety, empirical, model-editing | 2024-03-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 93 |
| On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial Francesco Salvi, Manoel Horta Ribeiro, Riccardo Gallotti, Robert West Published: 2024-03-21Area: Safety EvaluationCitations: 95 Tags: ai-safety, empirical, safety-evaluation | 2024-03-21 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 95 |
| Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms Michael Hanna, Sandro Pezzelle, Yonatan Belinkov Published: 2024-03-26Area: Mechanistic Interp.Citations: 90 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 90 |
| Optimization-based Prompt Injection Attack to LLM-as-a-Judge Jiawen Shi, Lichao Sun, Neil Zhenqiang Gong, Pan Zhou Published: 2024-03-26Area: Adversarial RobustnessCitations: 132 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 132 |
| Mechanisms of Non-Factual Hallucination in Language Models Jackie Chi Kit Cheung, Lei Yu, Meng Cao, Yue Dong Published: 2024-03-27Area: Mechanistic Interp.Citations: 38 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 38 |
| NL-ITI: Optimizing Probing and Intervention for Improvement of ITI Method Adam Cieslak, Adam Wiacek, Artur Janicki, Jakub Hoscilowicz Published: 2024-03-27Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-03-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 5 |