Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior Asaf Shabtai, David Mimran, Denis Klimov, Gerard Levinov Published: 2026-01-15Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2026-01-15 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (96%) | 2 |
| Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay Hao Li, Hao Wang, Lei Sha, Rui Li Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (96%) | - |
| Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing Daling Wang, Ming Wang, Shi Feng, Xiaocui Yang Published: 2026-01-15Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (95%) | - |
| ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack Chaowei Xiao, G. Edward Suh, Hao Li, Ning Zhang Published: 2026-01-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Representation-Aware Unlearning via Activation Signatures: From Suppression to Knowledge-Signature Erasure Farig Sadeque, Jareen Tasneem Khondaker, K. M. Shadman Wadith, Md. Rezaur Rahman Bhuiyan Published: 2026-01-15Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 1 |
| The Straight and Narrow: Do LLMs Possess an Internal Moral Path? Hongfei Lin, Jingjie Zeng, Liang Yang, Luoming Hu Published: 2026-01-15Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2026-01-15 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback Jing Shao, Lijun Li, Peiyang Liu, Shikun Zhang Published: 2026-01-15Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2026-01-15 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Understanding and Preserving Safety in Fine-Tuned LLMs Dan Li, Jiachen Ma, Jian Liu, Jian Lou Published: 2026-01-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning Fengbin Zhu, Lei Chen, Meng Wang, Naixin Zhai Published: 2026-01-14Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (99%) | 1 |
| STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models Gaoxiang Cong, Jingjing Zhou, Liang Li, Li Su Published: 2026-01-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders Archie Chaudhury, Shikhar Shiromani, Sri Pranav Kunda Published: 2026-01-14Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-14 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | - |
| Too Helpful to Be Safe: User-Mediated Attacks on Planning and Web-Use Agents Carsten Rudolph, Fengchao Chen, Tingmin Wu, Van Nguyen Published: 2026-01-14Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2026-01-14 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (93%) | 2 |
| Toward Understanding Unlearning Difficulty: A Mechanistic Perspective and Circuit-Guided Difficulty Metric Chirag Agarwal, Hadi Amiri, Jiali Cheng, Ziheng Chen Published: 2026-01-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment Geng Yuan, Lingzi Hong, Ninghao Liu, Ningxi Cheng Published: 2026-01-13Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning Tony Cristofano Published: 2026-01-13Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2026-01-13 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 1 |
| YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation Abdelaziz Bounhar, Guokan Shang, Hadi Abdine, Michalis Vazirgiannis Published: 2026-01-13Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2026-01-13 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (98%) | - |
| AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations Michael J. Clark Published: 2026-01-12Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-12 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | - |
| Defenses Against Prompt Attacks Learn Surface Heuristics Chaowei Xiao, Charith Peris, Chenxiao Yu, Hao Li Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | - |
| MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP Ruiqi Li, Xiang-Yang Li, Yunhao Yao, Zhiqiang Wang Published: 2026-01-12Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 1 |
| Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety Can Jin, Dimitris N. Metaxas, Hongwu Peng, Jiahui Zhao Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| Safe-FedLLM: Delving into the Safety of Federated Large Language Models Mingxiang Tao, Wenxuan Tu, Xiangyan Tang, Xue Yang Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment Dandan Guo, Haozhong Wang, He Zhao, Hongyuan Zha Published: 2026-01-12Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| SCALPEL: Selective Capability Ablation via Low-rank Parameter Editing for Large Language Model Interpretability Analysis Xufeng Duan, Zhenguang G. Cai, Zihao Fu Published: 2026-01-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2026-01-12 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (97%) | - |
| SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations Mohammed Aqib Abdullah, Mohammed Himayath Ali, Mohammed Mudassir Uddin, Shahnawaz Alam Published: 2026-01-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems Ergute Bao, Hongyan Chang, Ting Yu, Xinjian Luo Published: 2026-01-11Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| When Should We Introduce Safety Interventions During Pretraining? Alexander Robey, Dylan Sam, J. Zico Kolter, Pratyush Maini Published: 2026-01-11Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-11 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (92%) | - |
| Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity Chi Zhang, Hongjun An, Jiangan Chen, Jiawei Shao Published: 2026-01-10Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-10 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| SafeGPT: Preventing Data Leakage and Unethical Outputs in Enterprise LLM Use Luoxi Tang, Pratyush Desai, Yuqiao Meng, Zhaohan Xi Published: 2026-01-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning Daqing He, Jiamou Liu, Jincheng An, Pengtao Kou Published: 2026-01-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models Jun Wang, Ruishi He, Songze Li, Xiaojun Jia Published: 2026-01-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |