Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Defending Against Prompt Injection with DataFilter Basel Alomair, David Wagner, Raghad Alkhudair, Sizhe Chen Published: 2025-10-22Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| LLM Unlearning with LLM Beliefs Bo Han, Fengpeng Li, Jiantao Zhou, Jun Liu Published: 2025-10-22Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-22 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (96%) | 2 |
| Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention Gustavo Penha, Hugues Bouchard, Jos茅 Luis Redondo Garc铆a, J Rosser Published: 2025-10-22Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-22 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |
| Subliminal Corruption: Mechanisms, Thresholds, and Interpretability Reya Vir, Sarvesh Bhatnagar Published: 2025-10-22Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical, interpretability | 2025-10-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, interpretability | E5 / R3 (95%) | 1 |
| ActivationReasoning: Logical Reasoning in Latent Activation Spaces Antonia W眉st, Felix Friedrich, Hikaru Shindo, Kristian Kersting Published: 2025-10-21Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-21 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R5 (97%) | 1 |
| Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability Artur Zolkowski, David Lindner, Erik Jenner, Florian Tram猫r Published: 2025-10-21Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-10-21 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (93%) | 3 |
| DePass: Unified Feature Attributing by Simple Decomposed Forward Pass Biqing Qi, Bowen Zhou, Che Jiang, Kai Tian Published: 2025-10-21Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-10-21 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | - |
| Extracting alignment data in open models Chawin Sitawarin, Christopher A. Choquette-Choo, Federico Barbero, Ilia Shumailov Published: 2025-10-21Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-21 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 3 |
| HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models Daniel Takabi, Eduardo Blanco, Javad Rafiei Asl, Mohammad Ghasemigol Published: 2025-10-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |
| Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation Giovanni De Muri, Mark Vero, Martin Vechev, Robin Staab Published: 2025-10-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Rectifying Shortcut Behaviors in Preference-based Reward Learning Aidong Zhang, Guangtao Zheng, Wenqian Ye Published: 2025-10-21Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Agentic Reinforcement Learning for Search is Unsafe Adam Mahdi, Andrew Lee, Shreyansh Padarha, Yushi Yang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth Andrew Estornell, Bo Li, David D. Baek, Jiawei Zhang Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Breaking and Fixing Defenses Against Control-Flow Hijacking in Multi-Agent Systems Harold Triedman, Justin Wagle, Rishi Jha, Vitaly Shmatikov Published: 2025-10-20Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-10-20 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (98%) | 2 |
| CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks Hao Li, Xu Zhang, Zhichao Lu Published: 2025-10-20Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-10-20 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models Amir Houmansadr, Dezhi Hong, Megan Ganji, Mingxian Wang Published: 2025-10-20Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-20 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs Chao Deng, Chong Long, Di Jin, Duqing Wang Published: 2025-10-20Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-20 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Multimodal Safety Is Asymmetric: Cross-Modal Exploits Unlock Black-Box MLLMs Jailbreaks Ao Liu, Beibei Li, Shouling Ji, Xinkai Wang Published: 2025-10-20Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 1 |
| PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits Diptanshu Purwar, Madhav Aggarwal, Neeladri Bhuiya Published: 2025-10-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering Hui Xiong, Jianze Li, Li Liu, Weilin Lin Published: 2025-10-20Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-10-20 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLMs Micah Carroll, Nikolaus Howe Published: 2025-10-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting Chenchen Tan, Cunjian Chen, Hui Zhang, Longxiang Gao Published: 2025-10-20Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-20 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 1 |
| Black-box Optimization of LLM Outputs by Asking for Directions Florian Tram猫r, Jie Zhang, Jue Hong, Meng Ding Published: 2025-10-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (97%) | 2 |
| BreakFun: Jailbreaking LLMs via Schema Exploitation Amirkia Rafiei Oskooei, Mehmet S. Aktas Published: 2025-10-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Finding Manifolds With Bilinear Autoencoders Thomas Dooms, Ward Gauderis Published: 2025-10-19Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R2 (94%) | 2 |
| Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning Bingqi Shang, Bingquan Shen, Sijia Liu, Yihua Zhang Published: 2025-10-19Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| Hierarchical Federated Unlearning for Large Language Models Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2025-10-19Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-19 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | - |
| Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization Masahiro Kaneko, Timothy Baldwin, Zeerak Talat Published: 2025-10-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 2 |
| Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety Benjamin Plaut, Khanh Nguyen, Ponnurangam Kumaraguru, Vamshi Krishna Bonagiri Published: 2025-10-18Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-10-18 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries Huanlong Zhong, Jialin Wu, Jiangyi Deng, Jie Zhang Published: 2025-10-18Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-10-18 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | - |