Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AI Safety vs. AI Security: Demystifying the Distinction and Boundaries Huan Sun, Ness Shroff, Zhiqiang Lin Published: 2025-06-21Area: Surveys & ReviewsCitations: 2 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E5 / R4 (95%) | 2 |
| From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem Datao You, Hongsong Zhu, Peipei Liu, Tiehan Cui Published: 2025-06-18Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, survey | 2025-06-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R4 (98%) | 7 |
| SoK: Evaluating Jailbreak Guardrails for Large Language Models Daoyuan Wu, Shuai Wang, Wenxuan Wang, Xunguang Wang Published: 2025-06-12Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, survey | 2025-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E4 / R2 (98%) | 6 |
| Multi-level Value Alignment in Agentic AI Systems: Survey and Perspectives Chuan Qin, Feimin Zhong, Han Wu, Hengshu Zhu Published: 2025-06-11Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-06-11 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E5 / R3 (93%) | 5 |
| SoK: Machine Unlearning for Large Language Models Charu C. Aggarwal, Hui Liu, Jie Ren, Yingqian Cui Published: 2025-06-10Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-06-10 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R3 (96%) | 5 |
| Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions Dacao Zhang, Guangyi Lv, Kui Yu, Kun Zhang Published: 2025-06-08Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2025-06-08 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 1 |
| A Systematic Review of Poisoning Attacks Against Large Language Models Edward W. Staley, Joshua Carney, Marie Chau, Nathan Drenkow Published: 2025-06-06Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, survey | 2025-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E4 / R3 (95%) | 6 |
| The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs Chaozhuo Li, Feiran Huang, Jiameng Qiu, Litian Zhang Published: 2025-06-06Area: Safety EvaluationCitations: 23 Tags: ai-safety, safety-evaluation, survey | 2025-06-06 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 23 |
| Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety Aeree Cho, Duen Horng Chau, Grace C. Kim, Mansi Phute Published: 2025-06-05Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, survey, surveys-reviews | 2025-06-05 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (95%) | 5 |
| Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS Charu C. Aggarwal, Han Xu, Hui Liu, Juanhui Li Published: 2025-06-02Area: Agent SafetyCitations: 5 Tags: agent-safety, ai-safety, survey | 2025-06-02 | Agent Safety | agent-safety, ai-safety, survey | E4 / R3 (95%) | 5 |
| The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It Beyza Ermis, Julia Kreutzer, Marzieh Fadaee, Stephen H. Bach Published: 2025-05-30Area: Surveys & ReviewsCitations: 10 Tags: ai-safety, survey, surveys-reviews | 2025-05-30 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (97%) | 10 |
| Bridging Distribution Shift and AI Safety: Conceptual and Methodological Synergies Chenruo Liu, Kenan Tang, Qi Lei, Yao Qin Published: 2025-05-28Area: Surveys & ReviewsCitations: 1 Tags: ai-safety, survey, surveys-reviews | 2025-05-28 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R3 (95%) | 1 |
| The Multilingual Divide and Its Impact on Global AI Safety Aakanksha, Ahmet 脺st眉n, Aidan Peppin, Alice Schoenauer Sebag Published: 2025-05-27Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, survey | 2025-05-27 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 4 |
| Erasing Concepts, Steering Generations: A Comprehensive Survey of Concept Suppression Ping Liu, Yiwei Xie, Zheng Zhang Published: 2025-05-26Area: Surveys & ReviewsCitations: 3 Tags: ai-safety, survey, surveys-reviews | 2025-05-26 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E5 / R3 (95%) | 3 |
| Security Concerns for Large Language Models: A Survey Benjamin C. M. Fung, Miles Q. Li Published: 2025-05-24Area: Surveys & ReviewsCitations: 29 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2025-05-24 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E5 / R3 (94%) | 29 |
| Forewarned is Forearmed: A Survey on Large Language Model-based Agents in Autonomous Cyberattacks Conghao Zhou, Dusit Niyato, Jiani Fan, Jiawen Kang Published: 2025-05-19Area: Agent SafetyCitations: 14 Tags: agent-safety, ai-safety, survey | 2025-05-19 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (93%) | 14 |
| A Survey of Attacks on Large Language Models Keshab K. Parhi, Wenrui Xu Published: 2025-05-18Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, survey | 2025-05-18 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R3 (95%) | 10 |
| A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron? Ada Chen, Jen-tse Huang, Jingyu Xiao, Junyuan Zhang Published: 2025-05-16Area: Agent SafetyCitations: 15 Tags: agent-safety, ai-safety, survey | 2025-05-16 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (95%) | 15 |
| Adversarial Attacks in Multimodal Systems: A Practitioner's Survey Aman Raj, Ankit Shetgaonkar, Dipen Pradhan, Lakshit Arora Published: 2025-05-06Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2025-05-06 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E6 / R3 (94%) | 2 |
| A Survey on Progress in LLM Alignment from the Perspective of Reward Design Jian Yang, Mark Dras, Miaomiao Ji, Shoujin Wang Published: 2025-05-05Area: Surveys & ReviewsCitations: 10 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2025-05-05 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (95%) | 10 |
| Open Challenges in Multi-Agent Security: Towards Secure Systems of Interacting AI Agents Christian Schroeder de Witt Published: 2025-05-04Area: Agent SafetyCitations: 38 Tags: agent-safety, ai-safety, survey | 2025-05-04 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (94%) | 38 |
| Attack and defense techniques in large language models: A survey and new perspectives Hefeng Chen, Kang Chen, Kangkang Li, Xingwang Huang Published: 2025-05-02Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, survey | 2025-05-02 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E7 / R4 (95%) | 5 |
| LLM Security: Vulnerabilities, Attacks, Defenses, and Countermeasures Fernando Berzal, Francisco Aguilera-Mart铆nez Published: 2025-05-02Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, survey | 2025-05-02 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (95%) | 13 |
| AI Awareness Haoyuan Shi, Rongwu Xu, Wei Xu, Xiaojian Li Published: 2025-04-25Area: Surveys & ReviewsCitations: 4 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-04-25 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E6 / R5 (97%) | 4 |
| Safety in Large Reasoning Models: A Survey Baolong Bi, Bryan Hooi, Cheng Wang, Duzhen Zhang Published: 2025-04-24Area: Surveys & ReviewsCitations: 53 Tags: ai-safety, survey, surveys-reviews | 2025-04-24 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E6 / R3 (95%) | 53 |
| A Domain-Based Taxonomy of Jailbreak Vulnerabilities in Large Language Models Andr茅s Herrera-Poyatos, Carlos Pel谩ez-Gonz谩lez, Cristina Zuheros, David Herrera-Poyatos Published: 2025-04-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, survey | 2025-04-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, survey | E6 / R4 (96%) | 1 |
| Towards Trustworthy GUI Agents: A Survey Ninghao Liu, Wenhao Yu, Wenhu Chen, Wenlin Yao Published: 2025-03-30Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, survey | 2025-03-30 | Agent Safety | agent-safety, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 19 |
| Data Poisoning in Deep Learning: A Survey Di Gao, Ou Wu, Pengfei Jiao, Pinlong Zhao Published: 2025-03-27Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, survey | 2025-03-27 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (95%) | 15 |
| Survey of Adversarial Robustness in Multimodal Large Language Models Chengze Jiang, Jie Gui, Minjing Dong, Zhuangzhuang Wang Published: 2025-03-18Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2025-03-18 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E5 / R3 (95%) | 11 |
| A Survey on Trustworthy LLM Agents: Threats and Countermeasures Bo An, Fanci Meng, Junyuan Mao, Kun Wang Published: 2025-03-12Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, survey | 2025-03-12 | Agent Safety | agent-safety, ai-safety, survey | E5 / R4 (95%) | 55 |