Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability Jun Sakuma, Shojiro Yamabe Published: 2025-10-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed Isha Gupta, Joshua Kazdan, Ken Ziyu Liu, Rylan Schaeffer Published: 2025-10-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack Jaewoo Kang, Jungwoo Park, Yein Park Published: 2025-09-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Beyond Linear Probes: Dynamic Safety Monitoring for Language Models Adel Bibi, Fazl Barez, Ioannis Patras, James Oldfield Published: 2025-09-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 3 |
| CHAI: Command Hijacking against embodied AI Alvaro A Cardenas, Cihang Xie, Diego Ortiz, Haoqin Tu Published: 2025-09-30Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-09-30 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| DecepChain: Inducing Deceptive Reasoning in Large Language Models Han Wang, Haoyu Li, Huan Zhang, Wei Shen Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (98%) | 1 |
| Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning Hong kyu Lee, Li Xiong, Ruixuan Liu Published: 2025-09-30Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models Belal Abuhaija, Jiaqi Wang, Kaizhu Huang, Qinjian Zhao Published: 2025-09-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | - |
| Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions Dongha Lim, Jihoon Tack, Jinwoo Shin, Junbeom Kim Published: 2025-09-30Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-30 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents Chao Shang, Devang Kulshreshtha, Hang Su, Jianfeng He Published: 2025-09-30Area: Agent SafetyCitations: 2 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-09-30 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (94%) | 2 |
| STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models Jie Li, Jing Shao, Lijun Li, Shaoxiong Guo Published: 2025-09-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |
| Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning Arash Marioriyad, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban, Nima Alighardashi Published: 2025-09-30Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-09-30 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (97%) | 1 |
| Binary Sparse Coding for Interpretability Lucia Quirke, Nora Belrose, Stepan Shabalin Published: 2025-09-29Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-09-29 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R4 (92%) | 1 |
| DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models Jiaheng Zhang, Kun Wang, Qingsong Wen, Yitong Zhang Published: 2025-09-29Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | 3 |
| Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents Boxuan Zhang, Jiaxuan Guo, Jing Shao, Yi Yu Published: 2025-09-29Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment Dongrui Liu, Guibin Zhang, Huahui Yi, Jian Zhao Published: 2025-09-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models Guoan Wan, Huandong Wang, Junyao Gao, Tao Jiang Published: 2025-09-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| SecInfer: Preventing Prompt Injection via Inference-time Scaling Jinyuan Jia, Neil Zhenqiang Gong, Yanting Wang, Yupei Liu Published: 2025-09-29Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 3 |
| Stable Forgetting: Bounded Parameter-Efficient Unlearning in LLMs Arpit Garg, Hemanth Saratchandran, Ravi Garg, Simon Lucey Published: 2025-09-29Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Takedown: How It's Done in Modern Coding Agent Exploits Donghyeon Kim, Eunkyu Lee, Insu Yun, Wonyoung Kim Published: 2025-09-29Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (93%) | 2 |
| Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection Hoang Phan, Qi Lei, Victor Li Published: 2025-09-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention Dongbai Li, Hang Su, Jingwen Yang, Jun Zhu Published: 2025-09-29Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 2 |
| Understanding the Dilemma of Unlearning for Large Language Models Chao Zhang, Cheng Hong, Han Qiu, Haoting Qian Published: 2025-09-29Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-09-29 | Model Editing | ai-safety, empirical, model-editing | E8 / R3 (93%) | 3 |
| VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models Mansi Phute, Ravikumar Balakrishnan Published: 2025-09-29Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-09-29 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Discovering Transformer Circuits via a Hybrid Attribution and Pruning Framework Amrithaa Ashok Kumar, Hao Gu, Jayvart Sharma, Ryan Lagasse Published: 2025-09-28Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (97%) | 2 |
| Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement Anyi Wang, Dong Shu, Ninghao Liu, Xuansheng Wu Published: 2025-09-28Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 1 |
| Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning Daqing He, Jiamou Liu, Liehuang Zhu, Meng Li Published: 2025-09-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Hedonic Neurons: A Mechanistic Mapping of Latent Coalitions in Transformer MLPs Atharva Nijasure, James Allan, Tanya Chowdhury, Yair Zick Published: 2025-09-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-09-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | - |
| Measuring Sparse Autoencoder Feature Sensitivity Claire Tian, Katherine Tian, Nathan Hu Published: 2025-09-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-09-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration Chi Zhang, Huilin Zhou, Jian Zhao, Linghe Kong Published: 2025-09-28Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-09-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R6 (96%) | 3 |