Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safety of Multimodal Large Language Models on Images and Text Chao Yang, Xin Liu, Yichen Zhu, Yunshi Lan Published: 2024-02-01Area: Multimodal SafetyCitations: 65 Tags: ai-safety, multimodal-safety, survey | 2024-02-01 | Multimodal Safety | ai-safety, multimodal-safety, survey | E7 / R3 (95%) | 65 |
| Prioritizing Safeguarding Over Autonomy: Risks of LLM Agents for Science Arman Cohan, Jian Tang, Kunlun Zhu, Mark Gerstein Published: 2024-02-06Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, survey | 2024-02-06 | Agent Safety | agent-safety, ai-safety, alignment-training, survey | E5 / R3 (95%) | 55 |
| A Roadmap to Pluralistic Alignment Andre Ye, Christopher Michael Rytting, Jared Moore, Jillian Fisher Published: 2024-02-07Area: Alignment TrainingCitations: 161 Tags: ai-safety, alignment-training, survey | 2024-02-07 | Alignment Training | ai-safety, alignment-training, survey | E5 / R3 (94%) | 161 |
| Rethinking Machine Unlearning for Large Language Models Chris Yuhao Liu, Hang Li, Jinghan Jia, Kush R. Varshney Published: 2024-02-13Area: Model EditingCitations: 227 Tags: ai-safety, alignment-training, model-editing, safety-evaluation, survey | 2024-02-13 | Model Editing | ai-safety, alignment-training, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 227 |
| Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey Chao Yang, Jing Shao, Yu Qiao, Zhanhui Zhou Published: 2024-02-14Area: Surveys & ReviewsCitations: 140 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-02-14 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (98%) | 140 |
| A Trembling House of Cards? Mapping Adversarial Attacks against Language Agents Boyuan Zheng, Chaowei Xiao, Huan Sun, Lingbo Mo Published: 2024-02-15Area: Agent SafetyCitations: 23 Tags: adversarial-robustness, agent-safety, ai-safety, survey | 2024-02-15 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, survey | E6 / R4 (97%) | 23 |
| Towards Uncovering How Large Language Model Works: An Explainability Perspective Fan Yang, Haiyan Zhao, Himabindu Lakkaraju, Mengnan Du Published: 2024-02-16Area: Surveys & ReviewsCitations: 26 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2024-02-16 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E5 / R3 (93%) | 26 |
| Generative AI Security: Challenges and Countermeasures Banghua Zhu, David Wagner, Jiantao Jiao, Norman Mu Published: 2024-02-20Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, survey | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 14 |
| Exploring Advanced Methodologies in Security Evaluation for LLMs Jiawei Zhang, Jun Huang, Qi Wang, Weihong Han Published: 2024-02-28Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, survey | 2024-02-28 | Safety Evaluation | ai-safety, safety-evaluation, survey | E6 / R3 (93%) | - |
| Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models Aman Chadha, Arijit Ghosh Chowdhury, Faysal Hossain Shezan, Md Mofijul Islam Published: 2024-03-03Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, survey | 2024-03-03 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (94%) | 47 |
| Machine Unlearning: Taxonomy, Metrics, Applications, Challenges, and Prospects Anmin Fu, Chunyi Zhou, Hui Chen, Na Li Published: 2024-03-13Area: Model EditingCitations: 36 Tags: adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | 2024-03-13 | Model Editing | adversarial-robustness, ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (95%) | 36 |
| Securing Large Language Models: Threats, Vulnerabilities and Responsible Practices CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-03-19Area: Surveys & ReviewsCitations: 49 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-03-19 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (98%) | 49 |
| Digital Forgetting in Large Language Models: A Survey of Unlearning Methods Alberto Blanco-Justicia, Benet Manzanares, David Sánchez, Guillem Collell Published: 2024-04-02Area: Model EditingCitations: 45 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-04-02 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (96%) | 45 |
| SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety Bertie Vidgen, Dirk Hovy, Fabio Pernisi, Paul Röttger Published: 2024-04-08Area: Surveys & ReviewsCitations: 69 Tags: ai-safety, survey, surveys-reviews | 2024-04-08 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (98%) | 69 |
| Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security Shaofeng Li, Yihe Fan, Yuxin Cao, Ziyao Liu Published: 2024-04-08Area: Multimodal SafetyCitations: 21 Tags: ai-safety, multimodal-safety, survey | 2024-04-08 | Multimodal Safety | ai-safety, multimodal-safety, survey | E6 / R3 (95%) | 21 |
| RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs Ameet Deshpande, Ashwin Kalyan, Bruno Castro da Silva, Karthik Narasimhan Published: 2024-04-12Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, survey | 2024-04-12 | Alignment Training | ai-safety, alignment-training, survey | E5 / R4 (95%) | 105 |
| Foundational Challenges in Assuring Alignment and Safety of Large Language Models Abulhair Saparov, Alan Chan, Aleksandar Petrov, Alexander Pan Published: 2024-04-15Area: Surveys & ReviewsCitations: 211 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-04-15 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (94%) | 211 |
| Holistic Safety and Responsibility Evaluations of Advanced AI Models Allan Dafoe, Christina Butterfield, Dawn Bloxwich, Iason Gabriel Published: 2024-04-22Area: Safety EvaluationCitations: 17 Tags: ai-safety, safety-evaluation, survey | 2024-04-22 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 17 |
| Mechanistic Interpretability for AI Safety — A Review Efstratios Gavves, Leonard Bereska Published: 2024-04-22Area: Surveys & ReviewsCitations: 335 Tags: ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | 2024-04-22 | Surveys & Reviews | ai-safety, interpretability, safety-evaluation, survey, surveys-reviews | E5 / R3 (93%) | 335 |
| How to Use and Interpret Activation Patching Neel Nanda, Stefan Heimersheim Published: 2024-04-23Area: Mechanistic Interp.Citations: 109 Tags: ai-safety, interpretability, mechanistic-interp, survey | 2024-04-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, survey | E6 / R4 (95%) | 109 |
| A Primer on the Inner Workings of Transformer-based Language Models Arianna Bisazza, Gabriele Sarti, Javier Ferrando, Marta R. Costa-jussà Published: 2024-04-30Area: Surveys & ReviewsCitations: 80 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-04-30 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E7 / R4 (95%) | 80 |
| Exploring Vulnerabilities and Protections in Large Language Models: A Survey Chenhui Hu, Frank Weizhen Liu Published: 2024-06-01Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, survey | 2024-06-01 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E8 / R5 (98%) | 12 |
| Safeguarding Large Language Models: A Survey Changshun Wu, Gaojie Jin, Jie Meng, Jinwei Hu Published: 2024-06-03Area: Surveys & ReviewsCitations: 82 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-06-03 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 82 |
| AI Agents Under Threat: A Survey of Key Security Challenges and Future Pathways Changzhou Han, Junwu Xiong, Sheng Wen, Wanlun Ma Published: 2024-06-04Area: Agent SafetyCitations: 152 Tags: agent-safety, ai-safety, survey | 2024-06-04 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (94%) | 152 |
| A Survey of Recent Backdoor Attacks and Defenses in Large Language Models Fengjun Pan, Jie Fu, Leilei Gan, Luu Anh Tuan Published: 2024-06-10Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, survey | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (96%) | 32 |
| Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey Bo Liu, Dayong Ye, Ming Ding, Philip S. Yu Published: 2024-06-12Area: Surveys & ReviewsCitations: 20 Tags: ai-safety, survey, surveys-reviews | 2024-06-12 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R3 (97%) | 20 |
| A Survey on Human Preference Learning for Large Language Models Juntao Li, Kehai Chen, Liqiang Nie, Min Zhang Published: 2024-06-17Area: Surveys & ReviewsCitations: 16 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-06-17 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 16 |
| Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data Beth Goldberg, Iason Gabriel, Nahema Marchal, Rachel Xu Published: 2024-06-19Area: Safety EvaluationCitations: 37 Tags: ai-safety, safety-evaluation, survey | 2024-06-19 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (96%) | 37 |
| From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking Siyuan Wang, Zhihao Fan, Zhongyu Wei, Zhuohan Long Published: 2024-06-21Area: Surveys & ReviewsCitations: 22 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E7 / R4 (95%) | 22 |
| AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies Andy Zhou, Bo Li, Dawn Song, Kevin Klyman Published: 2024-06-25Area: Surveys & ReviewsCitations: 48 Tags: ai-safety, survey, surveys-reviews | 2024-06-25 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E8 / R4 (99%) | 48 |