Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment Meiyin Meng, Zaixi Zhang Published: 2025-09-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R5 (98%) | - |
| Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding Hyukhun Koh, Kyomin Jung, Seongho Joo Published: 2025-09-13Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 2 |
| Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential Aarav Khanna, Charankumar Akiri, Harrison Simpson, Kshitiz Aryal Published: 2025-09-12Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E10 / R3 (95%) | 4 |
| X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates Haon Park, Hyunjun Kim, Junwoo Ha, Sangyoon Yu Published: 2025-09-10Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Transferable Direct Prompt Injection via Activation-Guided MCMC Sampling Hao Zhang, Jing Wang, Minghui Li, Shengshan Hu Published: 2025-09-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Guangdong Bai, Shuai Yuan, Wang Kailong, Yuxi Li Published: 2025-09-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security Bing Qin, Fenglei Fan, Jiawei Cao, Sendong Zhao Published: 2025-09-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 1 |
| AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs Debdeep Sanyal, Manodeep Ray, Murari Mandal Published: 2025-09-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints Matthew Dressman, Natalie Isak, Waris Gill Published: 2025-09-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models Mohammad Zandsalimy, Shanu Sushmita, Youjia Zheng Published: 2025-09-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain Amin Bigdeli, Amira Ghenai, Charles L. A. Clarke, Shakiba Amirshahi Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize Cheng Wang, Muhao Chen, Qin Liu, Zeming Wei Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 2 |
| NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models Bowen Shi, Chuhan Zhang, Dazhen Deng, Shouling Ji Published: 2025-09-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, tool | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | - |
| CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention Chenhan Yuan, Fei Huang, Junyang Lin, Tsung-Yi Ho Published: 2025-09-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | 3 |
| Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions Chang Liu, Cheng Wei, Fengxiang Wang, Hui Xue Published: 2025-09-01Area: Safety EvaluationCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-01 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 7 |
| Unraveling LLM Jailbreaks Through Safety Knowledge Neurons Chongwen Zhao, Kaizhu Huang Published: 2025-09-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Gaojie Jin, Jianhong Wang, Sihao Wu, Wei Huang Published: 2025-08-30Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| The Resurgence of GCG Adversarial Attacks on Large Language Models Huizhen Shu, Peikang Hu, Xuying Li, Yuting Tan Published: 2025-08-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | 1 |
| JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring Chao Shen, Chenhao Lin, Junjie Chu, Michael Backes Published: 2025-08-28Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-08-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 4 |
| Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Qian Wang Published: 2025-08-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh Published: 2025-08-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Publish to Perish: Prompt Injection Attacks on LLM-Assisted Peer Review Giovanni Apruzzese, Matteo Gioele Collu, Mauro Conti, Roberto Confalonieri Published: 2025-08-28Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 2 |
| Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning Chongyang Gao, Jie Zhang, Lixu Wang, Peizhuo Lv Published: 2025-08-28Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 5 |
| Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning Kuan Li, Shuai Wang, Yanbo Dai, Zhenlan Ji Published: 2025-08-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks Danding Wang, Guang Yang, Juan Cao, Qiang Sheng Published: 2025-08-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 3 |
| IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement Guanxu Chen, Ruicheng Yin, Xiaoqing Zheng, Xuanjing Huang Published: 2025-08-27Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Safety Alignment Should Be Made More Than Just A Few Attention Heads Chao Huang, Chuang Zhang, Juwei Yue, Quangang Li Published: 2025-08-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills David Noever Published: 2025-08-27Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-08-27 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (93%) | - |
| An Investigation on Group Query Hallucination Attacks Kehao Miao, Xiaolong Jin Published: 2025-08-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| On Surjectivity of Neural Networks: Can you elicit any behavior from your model? Haozhe Jiang, Nika Haghtalab Published: 2025-08-26Area: Formal/TheoreticalCitations: 3 Tags: adversarial-robustness, ai-safety, formaltheoretical, theoretical | 2025-08-26 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, theoretical | E6 / R3 (95%) | 3 |