Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 991-1000 of 1000+ papers (page 34 of 34)路 116 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Simple Mechanistic Explanations for Out-Of-Context Reasoning Atticus Wang, Joshua Engels, Neel Nanda, Oliver Clive-Griffin Published: 2025-07-10Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2025-07-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 3 |
| An attention-aware GNN-based input defender against multi-turn jailbreak on LLMs Bowei He, Huiling Zhen, Kecheng Huang, Lihao Yin Published: 2025-07-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks Stephen Obadinma, Xiaodan Zhu Published: 2025-07-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms Ines Belhadj, Jihene Bennaceur, Ramzi Guesmi, Tarek Gasmi Published: 2025-07-08Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, empirical | 2025-07-08 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Can Interpretation Predict Behavior on Unseen Data? David Alvarez-Melis, Jenny Kaufmann, Martin Wattenberg, Naomi Saphra Published: 2025-07-08Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-08 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (92%) | 5 |
| CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations Jianhao Chen, Mayi Xu, Tieyun Qian, Xiaohu Li Published: 2025-07-08Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation Haoyu Wang, Kailong Wang, Ling Shi, Shuai Yuan Published: 2025-07-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 1 |
| TuneShield: Mitigating Toxicity in Conversational AI while Fine-tuning on Untrusted Data Aravind Cheruvu, Bimal Viswanath, Daphne Yao, Murtuza Jadliwala Published: 2025-07-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World Lun Wang, Rajiv Mathews, Soheil Feizi, Vinu Sankar Sadasivan Published: 2025-07-07Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Interpretable Reward Modeling with Active Concept Bottlenecks Julia E. Vogt, Katarzyna Kobalczyk, Mihaela van der Schaar, Sonia Laguna Published: 2025-07-07Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models Jing Shao, Lijun Li, Pengyu Zhu, Yuan Xiong Published: 2025-07-07Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 5 |
| Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message Li Qian, Wei Duan Published: 2025-07-07Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E4 / R3 (95%) | - |
| Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs Pin-Yu Chen, Tsung-Yi Ho, Xiaomeng Hu Published: 2025-07-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning Charles Fleming, Mahavir Dabas, Ming Jin, Ruoxi Jia Published: 2025-07-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-07-06 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 4 |
| Mass-Scale Analysis of In-the-Wild Conversations Reveals Complexity Bounds on LLM Jailbreaking Aldan Creo, Manuel Cebrian, Raul Castro Fernandez Published: 2025-07-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs Leo Schwinn, Sophie Xhonneux, Stephan G眉nnemann, Yan Scholten Published: 2025-07-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 2 |
| Re-Emergent Misalignment: How Narrow Fine-Tuning Erodes Safety Alignment in LLMs Jeremiah Giordani Published: 2025-07-04Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-04 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| Adversarial Manipulation of Reasoning Models using Internal Representations Andy Arditi, Benjamin Etheridge, Kureha Yamaguchi Published: 2025-07-03Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| LLM Hypnosis: Exploiting User Feedback for Unauthorized Knowledge Injection to All Users Almog Hilel, Idan Shenfeld, Jacob Andreas, Leshem Choshen Published: 2025-07-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks Arman Zharmagambetov, Chuan Guo, David Wagner, Sizhe Chen Published: 2025-07-03Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 31 |
| PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage Dmitrii Usynin, Krishna Kanth Nakka, Xuebing Zhou, Xue Jiang Published: 2025-07-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 2 |
| Transformers Don't Need LayerNorm at Inference Time: Scaling LayerNorm Removal to GPT-2 XL and the Implications for Mechanistic Interpretability Galvin Khara, Joachim Schaeffer, Luca Baroni, Marat Subkhankulov Published: 2025-07-03Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 4 |
| ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks Aishan Liu, Dacheng Tao, Siyuan Liang, Zhiyao Ren Published: 2025-07-02Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| MGC: A Compiler Framework Exploiting Compositional Blindness in Aligned LLMs for Malware Generation Guangyu Shen, Lu Yan, Shengwei An, Xiangyu Zhang Published: 2025-07-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | - |
| Probing and Steering Evaluation Awareness of Language Models Carlo Leonardo Attubato, Felix Hofst盲tter, Jord Nguyen, Khiem Hoang Published: 2025-07-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-02 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (93%) | 8 |
| SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism Beitao Chen, Heng Tao Shen, Jingkuan Song, Lianli Gao Published: 2025-07-02Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (98%) | 3 |
| Discourse Heuristics For Paradoxically Moral Self-Correction Guangliang Liu, Kristen Marie Johnson, Xitong Zhang, Zimo Qi Published: 2025-07-01Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| Enhancing LLM Agent Safety via Causal Influence Prompting Dongyoon Hahm, June Suk Choi, Kimin Lee, Sungsoo Ahn Published: 2025-07-01Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2025-07-01 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (99%) | 1 |
| 'For Argument's Sake, Show Me How to Harm Myself!': Jailbreaking LLMs in Suicide and Self-Harm Contexts Annika M Schoene, Cansu Canca Published: 2025-07-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | - |
| Reasoning as an Adaptive Defense for Safety Aditi Raghunathan, Aviral Kumar, Fahim Tajwar, Taeyoun Kim Published: 2025-07-01Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 12 |