Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks Alina Oprea, Brian Grinstead, Christoph Kerschbaumer, Cristina Nita-Rotaru Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Reinforcement Learning with Backtracking Feedback Bilgehan Sel, Dingcheng Li, Lukas Rutishauser, Ming Jin Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Robust Policy Optimization to Prevent Catastrophic Forgetting Adel Javanmard, George Pappas, Hamed Hassani, Mahdi Sabbaghi Published: 2026-02-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs Hai Huang, Michael Backes, Mingjie Li, Yage Zhang Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Stateless Yet Not Forgetful: Implicit Memory as a Hidden Channel in LLMs Ahmed Salem, Andrew Paverd, Sahar Abdelnabi Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |
| Stress-Testing Alignment Audits With Prompt-Level Strategic Deception Ben Marlin, David Lindner, Oliver Daniels, Perusha Moodley Published: 2026-02-09Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-02-09 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| Efficient and Adaptable Detection of Malicious LLM Prompts via Bootstrap Aggregation Marco Canini, Shayan Ali Hassan, Tao Ni, Zafar Ayyub Qazi Published: 2026-02-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Emergent Misalignment is Easy, Narrow Misalignment is Hard Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2026-02-08Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-08 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Robustness of Vision Language Models Against Split-Image Harmful Input Attacks Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Shagufta Mehnaz, Vishnu Asutosh Dasu Published: 2026-02-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection Guanglong Sun, Hang Su, Jun Zhu, Liyuan Wang Published: 2026-02-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-08 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models Adriano Koshiyama, Kleyton Da Costa, Seonglae Cho, Zekun Wu Published: 2026-02-08Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-08 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (94%) | - |
| AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management Chaowei Xiao, Hao Li, Ning Zhang, Ruoyao Wen Published: 2026-02-07Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-02-07 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| Controllable Value Alignment in Large Language Models through Neuron-Level Editing Fengbin Zhu, Jilong Liu, Junwei Li, Le Wu Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery Bangwei Guo, Difei Gu, Dimitris Metaxas, Gerasimos Chatzoudis Published: 2026-02-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2026-02-07 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R4 (94%) | - |
| Reverse-Engineering Model Editing on Language Models Minrui Luo, Tianxing He, Yu Wang, Zhili Chen Published: 2026-02-07Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control Jilong Liu, Junfeng Fang, Le Wu, Richang Hong Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2026-02-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-07 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Agentic Uncertainty Reveals Agentic Overconfidence Gb猫tondji Dovonon, Jean Kaddour, Leo Richter, Matt J. Kusner Published: 2026-02-06Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2026-02-06 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention A. V. Subramanyam, Himanshu Singh, Mohan Kankanhalli, Ziwei Xu Published: 2026-02-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| Endogenous Resistance to Activation Steering in Language Models Alex McKenzie, Diogo de Lucena, Judd Rosenblatt, Keenan Pepper Published: 2026-02-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Extended to Reality: Prompt Injection in 3D Environments Ying Chen, Zhuoheng Li Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Is Gradient Ascent Really Necessary? Memorize to Forget for Machine Unlearning Bo Han, Qizhou Wang, Shanshan Ye, Tongliang Liu Published: 2026-02-06Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2026-02-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 4 |
| Learning a Generative Meta-Model of LLM Activations Alec Radford, Grace Luo, Jacob Steinhardt, Jiahai Feng Published: 2026-02-06Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | - |
| Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Qian Wang Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |
| Rare Event Analysis of Large Language Models Dominic C. Rose, Edward Gillman, Jake McAllister Dorman, Jamie F. Mair Published: 2026-02-06Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks Chenliang Xu, Jialin Song, Jianfeng Gao, Mingqian Feng Published: 2026-02-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| ShallowJail: Steering Jailbreaks against Large Language Models Hanyu Pei, Shang Liu, Zeyan Liu Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (97%) | - |
| TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking Mengyu Wang, Minda Zhao, Ruizhi Qian, Sung-Hoon Yoon Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |