Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality Chaowei Xiao, Nanxi Li, Zhengyue Zhao Published: 2025-08-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-26 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (97%) | - |
| Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models Jinwen Tang, Qiming Guo, Xingran Huang Published: 2025-08-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 1 |
| Speculative Safety-Aware Decoding Shengyu Zhu, Xuekang Wang, Xueqi Cheng Published: 2025-08-25Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience Baosheng Wang, Bin Ji, Feilong Bao, Jianfeng Zhang Published: 2025-08-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Risk Assessment and Security Analysis of Large Language Models Dongyang Lyu, Xiaoqi Li, Xiaoyan Zhang Published: 2025-08-24Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 7 |
| POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization Gaojie Jin, Ronghui Mu, Tianjin Huang, Xiaowei Huang Published: 2025-08-23Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks Ethan Perez, Henry Sleight, Jack Youstra, Mohammed Mahfoud Published: 2025-08-23Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark | 2025-08-23 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 7 |
| ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts C茅line Hudelot, Darpan Aswal Published: 2025-08-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| HAMSA: Hijacking Aligned Compact Models via Stealthy Automation Alexey Krylov, Azidine Guezzaz, Dmitrii Korzh, Elena V. Tutubalina Published: 2025-08-22Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models Bill Byrne, Guangyu Yang, Jingbiao Mei, Jinghong Chen Published: 2025-08-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks Jianbing Ni, Qi Li, Rongxing Lu, Xiangman Li Published: 2025-08-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-08-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent Mao Nishino, Sajib Biswas, Samuel Jacob Chacko, Xiuwen Liu Published: 2025-08-20Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| CCFC: Core & Core-Full-Core Dual-Track Defense for LLM Jailbreak Protection Debarghya Mukherjee, Haoyu Wang, Ioannis Ch. Paschalidis, Jiaming Hu Published: 2025-08-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | - |
| CIA+TA Risk Assessment for AI Reasoning Vulnerabilities Yuksel Aydin Published: 2025-08-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models Haoyang Chen, Jianhao Chen, Jianjie Huang, Mayi Xu Published: 2025-08-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position Jun Luo, Xurui Song, Zhixin Xie Published: 2025-08-17Area: Alignment TrainingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 6 |
| Invitation Is All You Need! Promptware Attacks Against LLM-Powered Assistants in Production Are Practical and Dangerous Ben Nassi, Or Yair, Stav Cohen Published: 2025-08-16Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| Mitigating Jailbreaks with Intent-Aware LLMs Erik Cambria, Ranjan Satapathy, Wei Jie Yeo Published: 2025-08-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 1 |
| Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions Jiahao Zhang, Xuyang Guo, Zekai Huang, Zhao Song Published: 2025-08-16Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts Chiyu Zhang, Jiafei Wu, Liming Fang, Lu Zhou Published: 2025-08-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation Huizhen Shu, Mengqiu Tian, Qirui Wang, Xuying Li Published: 2025-08-14Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Multi-Turn Jailbreaks Are Simpler Than They Seem Anna-Katharina Dick, Diogo Cruz, Fei Xie, Jaeha Lee Published: 2025-08-11Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 6 |
| Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity Bernhard Kainz, Jingyuan Zhang, Mengyun Qiao, Shuyuan Zhang Published: 2025-08-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Ivan Zhang Published: 2025-08-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| Many-Turn Jailbreaking Faisal Ladhak, Hyokun Yun, Linda Ruth Petzold, Liqiang Xiao Published: 2025-08-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 1 |
| Who's the Evil Twin? Differential Auditing for Undesired Behavior Greta Kintzley, Ishwar Balappanawar, Ronan Azimi-Mancel, Satvik Golechha Published: 2025-08-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering Chengwei Pan, Hongning Wang, Minlie Huang, QingLin Zhang Published: 2025-08-07Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (95%) | 3 |
| Prompt Injection Vulnerability of Consensus Generating Applications in Digital Democracy Cesar A Hidalgo, Cl茅ment Contet, Jairo Gudi帽o, Umberto Grandi Published: 2025-08-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |