Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Survey on the Honesty of Large Language Models Cheng Yang, Chufan Shi, Deng Cai, Jie Zhou Published: 2024-09-27Area: Surveys & ReviewsCitations: 18 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2024-09-27 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R4 (94%) | 18 |
| Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-09-26Area: Surveys & ReviewsCitations: 82 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-09-26 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E5 / R3 (95%) | 82 |
| Attack Atlas: A Practitioner's Perspective on Challenges and Pitfalls in Red Teaming GenAI Ambrish Rawat, Beat Buesser, Elizabeth M. Daly, Erik Miehling Published: 2024-09-23Area: Safety EvaluationCitations: 14 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2024-09-23 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (95%) | 14 |
| Mapping Technical Safety Research at AI Companies: A literature review and incentives analysis Oliver Guest, Oscar Delaney, Zoe Williams Published: 2024-09-12Area: Surveys & ReviewsCitations: 3 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-09-12 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E6 / R3 (94%) | 3 |
| Securing Large Language Models: Addressing Bias, Misinformation, and Prompt Attacks Benji Peng, Junyu Liu, Keyu Chen, Ming Li Published: 2024-09-12Area: Surveys & ReviewsCitations: 31 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-09-12 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (94%) | 31 |
| Recent Advances in Attack and Defense Approaches of Large Language Models Jianbin Jiao, Jing Cui, Junge Zhang, Shuchang Zhou Published: 2024-09-05Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, survey | 2024-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (95%) | 9 |
| Multilevel Interpretability Of Artificial Neural Networks: Leveraging Framework And Methods From Neuroscience Anna Ivanova, Chole Li, Danyal Akarca, George Ogden Published: 2024-08-22Area: Surveys & ReviewsCitations: 7 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-08-22 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E5 / R4 (95%) | 7 |
| The Cognitive Revolution in Interpretability: From Explaining Behavior to Interpreting Representations and Algorithms Adam Davies, Ashkan Khakzar Published: 2024-08-11Area: Surveys & ReviewsCitations: 14 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-08-11 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E6 / R4 (95%) | 14 |
| Attacks and Defenses for Generative Diffusion Models: A Comprehensive Survey Long Bao Le, Luan Ba Dang, Vu Tuan Truong Published: 2024-08-06Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, survey | 2024-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E8 / R4 (99%) | 48 |
| Towards AI-Safety-by-Design: A Taxonomy of Runtime Guardrails in Foundation Model based Systems Dehai Zhao, Liming Zhu, Md Shamsujjoha, Qinghua Lu Published: 2024-08-05Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, survey | 2024-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (97%) | 12 |
| The Quest for the Right Mediator: A History, Survey, and Theoretical Grounding of Causal Interpretability Aaron Mueller, Arnab Sen Sharma, Aruna Sankaranarayanan, Can Rager Published: 2024-08-02Area: Surveys & ReviewsCitations: 3 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-08-02 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E5 / R3 (95%) | 3 |
| Can LLMs be Fooled? Investigating Vulnerabilities in LLMs CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-07-30Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, survey | 2024-07-30 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 9 |
| Machine Unlearning in Generative AI: A Survey Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-07-30Area: Model EditingCitations: 47 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-07-30 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E7 / R3 (95%) | 47 |
| The Emerged Security and Privacy of LLM Agent: A Survey with Case Studies Bo Liu, Dayong Ye, Feng He, Philip S. Yu Published: 2024-07-28Area: Surveys & ReviewsCitations: 85 Tags: ai-safety, survey, surveys-reviews | 2024-07-28 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R4 (94%) | 85 |
| The Art of Refusal: A Survey of Abstention in Large Language Models Bill Howe, Bingbing Wen, Chenjun Xu, Jihan Yao Published: 2024-07-25Area: Surveys & ReviewsCitations: 55 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-07-25 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 55 |
| Operationalizing a Threat Model for Red-Teaming Large Language Models Anu Pradhan, Apurv Verma, David Rabinowitz, John Doucette Published: 2024-07-20Area: Safety EvaluationCitations: 42 Tags: ai-safety, safety-evaluation, survey | 2024-07-20 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (97%) | 42 |
| Relational Composition in Neural Networks: A Survey and Call to Action Fernanda B. Vi茅gas, Martin Wattenberg Published: 2024-07-19Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, mechanistic-interp, survey | 2024-07-19 | Mechanistic Interp. | ai-safety, mechanistic-interp, survey | E6 / R3 (91%) | 19 |
| A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends Daizong Liu, Mingyu Yang, Pan Zhou, Wei Hu Published: 2024-07-10Area: Multimodal SafetyCitations: 81 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2024-07-10 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E7 / R5 (96%) | 81 |
| AI Safety in Generative AI Large Language Models: A Survey Chen Wang, Jaymari Chua, Lina Yao, Shiyi Yang Published: 2024-07-06Area: Surveys & ReviewsCitations: 38 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-07-06 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R3 (95%) | 38 |
| Jailbreak Attacks and Defenses Against Large Language Models: A Survey Jiaxing Song, Ke Xu, Qi Li, Sibo Yi Published: 2024-07-05Area: Surveys & ReviewsCitations: 220 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-07-05 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E8 / R4 (98%) | 220 |
| A Practical Review of Mechanistic Interpretability for Transformer-Based Language Models Abulhair Saparov, Daking Rai, Shi Feng, Yilun Zhou Published: 2024-07-02Area: Surveys & ReviewsCitations: 91 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-07-02 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E5 / R3 (95%) | 91 |
| JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models Chonghan Chen, Haibo Jin, Haohan Wang, Jun Zhuang Published: 2024-06-26Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, survey | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (97%) | 61 |
| AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies Andy Zhou, Bo Li, Dawn Song, Kevin Klyman Published: 2024-06-25Area: Surveys & ReviewsCitations: 48 Tags: ai-safety, survey, surveys-reviews | 2024-06-25 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E8 / R4 (99%) | 48 |
| From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking Siyuan Wang, Zhihao Fan, Zhongyu Wei, Zhuohan Long Published: 2024-06-21Area: Surveys & ReviewsCitations: 22 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E7 / R4 (95%) | 22 |
| Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data Beth Goldberg, Iason Gabriel, Nahema Marchal, Rachel Xu Published: 2024-06-19Area: Safety EvaluationCitations: 37 Tags: ai-safety, safety-evaluation, survey | 2024-06-19 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (96%) | 37 |
| A Survey on Human Preference Learning for Large Language Models Juntao Li, Kehai Chen, Liqiang Nie, Min Zhang Published: 2024-06-17Area: Surveys & ReviewsCitations: 16 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-06-17 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 16 |
| Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey Bo Liu, Dayong Ye, Ming Ding, Philip S. Yu Published: 2024-06-12Area: Surveys & ReviewsCitations: 20 Tags: ai-safety, survey, surveys-reviews | 2024-06-12 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R3 (97%) | 20 |
| A Survey of Recent Backdoor Attacks and Defenses in Large Language Models Fengjun Pan, Jie Fu, Leilei Gan, Luu Anh Tuan Published: 2024-06-10Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, survey | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (96%) | 32 |
| AI Agents Under Threat: A Survey of Key Security Challenges and Future Pathways Changzhou Han, Junwu Xiong, Sheng Wen, Wanlun Ma Published: 2024-06-04Area: Agent SafetyCitations: 152 Tags: agent-safety, ai-safety, survey | 2024-06-04 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (94%) | 152 |
| Safeguarding Large Language Models: A Survey Changshun Wu, Gaojie Jin, Jie Meng, Jinwei Hu Published: 2024-06-03Area: Surveys & ReviewsCitations: 82 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-06-03 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 82 |