Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| GuardT2I: Defending Text-to-Image Models from Adversarial Prompts Jianyuan Zhong, Qiang Xu, Ruiyuan Gao, Xiao Yang Published: 2024-03-03Area: Adversarial RobustnessCitations: 51 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 51 |
| Enhancing LLM Safety via Constrained Direct Preference Optimization Xiaolin Sun, Zixuan Liu, Zizhan Zheng Published: 2024-03-04Area: Alignment TrainingCitations: 41 Tags: ai-safety, alignment-training, empirical | 2024-03-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 41 |
| Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking Anca Dragan, Cassidy Laidlaw, Shivam Singhal Published: 2024-03-05Area: Deception & FailureCitations: 26 Tags: ai-safety, deception-failure, theoretical | 2024-03-05 | Deception & Failure | ai-safety, deception-failure, theoretical | E6 / R4 (94%) | 26 |
| Guardrail Baselines for Unlearning in LLMs Pratiksha Thaker, Virginia Smith, Yash Maurya Published: 2024-03-05Area: Model EditingCitations: 84 Tags: ai-safety, empirical, model-editing | 2024-03-05 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 84 |
| Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications Ben Nassi, Ron Bitton, Stav Cohen Published: 2024-03-05Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 43 |
| InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM Agents Daniel Kang, Qiusi Zhan, Zhixiang Liang, Zifan Ying Published: 2024-03-05Area: Agent SafetyCitations: 251 Tags: agent-safety, ai-safety, benchmark | 2024-03-05 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (96%) | 251 |
| The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning Adam A. Hunt, Adam Khoja, Alexander Pan, Alexandr Wang Published: 2024-03-05Area: Safety EvaluationCitations: 341 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 341 |
| The Shutdown Problem: An AI Engineering Puzzle for Decision Theorists Elliott Thornley Published: 2024-03-07Area: Formal/TheoreticalCitations: 18 Tags: ai-safety, formaltheoretical, theoretical | 2024-03-07 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E4 / R3 (94%) | 18 |
| Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought Edward Rees, Ethan Perez, Hunar Batra, James Chua Published: 2024-03-08Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-03-08 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 25 |
| Latent Adversarial Training Dylan Hadfield-Menell, Lennart Schulze, Oam Patel, Stephen Casper Published: 2024-03-08Area: Adversarial RobustnessCitations: 66 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 66 |
| Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation Hongning Wang, Jean-Fran莽ois Ton, Wei Shen, Xiaoying Zhang Published: 2024-03-08Area: Alignment TrainingCitations: 23 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-08 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 23 |
| Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations Aashka Trivedi, Adriana Alvarado Garcia, Ambrish Rawat, Ateret Anaby-Tavor Published: 2024-03-09Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, tool | 2024-03-09 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (99%) | 15 |
| Extending Activation Steering to Broad Skills and Multiple Behaviours Massimo Poesio, Nandi Schoots, Teun van der Weij Published: 2024-03-09Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-03-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | 26 |
| MACE: Mass Concept Erasure in Diffusion Models Adams Wai-Kin Kong, Leyang Li, Shilin Lu, Yanzhu Liu Published: 2024-03-10Area: Model EditingCitations: 232 Tags: ai-safety, empirical, model-editing | 2024-03-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 232 |
| Can LLMs Separate Instructions From Data? And What Do We Even Mean By That? Christoph H. Lampert, Egor Zverev, Mario Fritz, Sahar Abdelnabi Published: 2024-03-11Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, benchmark | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E4 / R3 (96%) | 50 |
| Stealing Part of a Production Language Model A. Feder Cooper, Arthur Conmy, Daniel Paleka, David Rolnick Published: 2024-03-11Area: Adversarial RobustnessCitations: 147 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 147 |
| Exploring Safety Generalization Challenges of Large Language Models via Code Chang Gao, Jing Shao, Junchi Yan, Lizhuang Ma Published: 2024-03-12Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (97%) | 61 |
| pyvene: A Library for Understanding and Improving PyTorch Models via Interventions Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2024-03-12Area: Mechanistic Interp.Citations: 44 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2024-03-12 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 44 |
| Distract Large Language Models for Automatic Jailbreak Attack Guanhua Chen, Yan Yang, Yun Chen, Zeguan Xiao Published: 2024-03-13Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-03-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 46 |
| Ethos: Rectifying Language Models in Orthogonal Parameter Space Lei Gao, Murali Annavaram, Salman Avestimehr, Tingting Tang Published: 2024-03-13Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-03-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 20 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting Chaowei Xiao, Muhao Chen, Xiaogeng Liu, Yu Li Published: 2024-03-14Area: Multimodal SafetyCitations: 106 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | 106 |
| B-AVIBench: Toward Evaluating the Robustness of Large Vision-Language Model on Black-Box Adversarial Visual-Instructions Hao Zhang, Hong Liu, Kaipeng Zhang, Ping Luo Published: 2024-03-14Area: Multimodal SafetyCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (98%) | 28 |
| Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision Chuang Gan, Longhui Yu, Sean Welleck, Weiyang Liu Published: 2024-03-14Area: Scalable OversightCitations: 103 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-03-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (95%) | 103 |
| Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation Dit-Yan Yeung, Hang Xu, James T. Kwok, Kai Chen Published: 2024-03-14Area: Multimodal SafetyCitations: 110 Tags: ai-safety, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 110 |
| Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models Hangyu Guo, Ji-Rong Wen, Kun Zhou, Wayne Xin Zhao Published: 2024-03-14Area: Multimodal SafetyCitations: 101 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-03-14 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 101 |
| Monotonic Representation of Numeric Properties in Language Models Benjamin Heinzerling, Kentaro Inui Published: 2024-03-15Area: Representation AnalysisCitations: 13 Tags: ai-safety, empirical, representation-analysis | 2024-03-15 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 13 |
| Safety Cases: How to Justify the Safety of Advanced AI Systems David Krueger, Joshua Clymer, Nicholas Gabrieli, Thomas Larsen Published: 2024-03-15Area: Safety EvaluationCitations: 54 Tags: ai-safety, position, safety-evaluation | 2024-03-15 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (93%) | 54 |
| SelfIE: Self-Interpretation of Large Language Model Embeddings Carl Vondrick, Chengzhi Mao, Haozhe Chen Published: 2024-03-16Area: Representation AnalysisCitations: 51 Tags: ai-safety, empirical, representation-analysis | 2024-03-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (96%) | 51 |
| Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment Bowen Yu, Feifan Song, Fei Huang, Haiyang Yu Published: 2024-03-17Area: Alignment TrainingCitations: 25 Tags: ai-safety, alignment-training, empirical | 2024-03-17 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (94%) | 25 |