Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B Ali Hassan, Gulshan Saleem, Muhammad Imran Zaman, Nisar Ahmed Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics Changsheng Wang, Chongyu Fan, Sijia Liu, Soumyadeep Pal Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | - |
| On the Convergence of Moral Self-Correction in Large Language Models Bochuan Cao, Guangliang Liu, Haitao Mao, Kristen Marie Johnson Published: 2025-10-08Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing Anthony Hughes, N. Asokan, Nikolaos Aletras, Ning Ma Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples Alexandra Souly, Burak Hasircioglu, Carlos Mougan, Chris Hicks Published: 2025-10-08Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 24 |
| Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts Alessandra Russo, Christos Ziakas, Nicholas Loo, Nishita Jain Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | - |
| SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models Gongli Xi, Hao Wu, Huahui Yi, Kang Li Published: 2025-10-08Area: Multimodal SafetyCitations: 3 Tags: ai-safety, empirical, multimodal-safety | 2025-10-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback Amin Karbasi, Battista Biggio, Giorgio Piras, Kamil臈 Luko拧i奴t臈 Published: 2025-10-07Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Refusal Falls Off a Cliff: How Safety Alignment Fails in Reasoning? Chak Tou Leong, Jaehong Yoon, Jinjin Gu, Linyi Yang Published: 2025-10-07Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-07 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 2 |
| Semantic Regexes: Auto-Interpreting LLM Features with a Structured Language Angie Boggust, Arvind Satyanarayan, Dominik Moritz, Donghao Ren Published: 2025-10-07Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna Published: 2025-10-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Adapting Insider Risk mitigations for Agentic Misalignment: an empirical study Francesca Gomez Published: 2025-10-06Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-06 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails Cihang Xie, Huaxiu Yao, Jiaqi Liu, Kaiwen Xiong Published: 2025-10-06Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-06 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R4 (95%) | 1 |
| Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning Bin Liang, Haoyuan Sun, Houde Liu, Jianxiang He Published: 2025-10-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 2 |
| Imperceptible Jailbreaking against Large Language Models Chao Du, Kuofeng Gao, Shu-Tao Xia, Tianyu Pang Published: 2025-10-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 1 |
| Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks? Abhay Puri, Alexandre Lacoste, Gabriel Huang, Graham W. Taylor Published: 2025-10-06Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (96%) | 3 |
| Inoculation Prompting: Instructing LLMs to misbehave at train-time improves test-time alignment Alex Mallen, Aram Ebtekar, Ariana Azarbal, Christine Ye Published: 2025-10-06Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts Daniel W. Peterson, Dan Roth, Eunsuk Kang, Marianne Menglin Liu Published: 2025-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Kamalika Chaudhuri Published: 2025-10-06Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 8 |
| Activation Steering with a Feedback Controller Dung V. Nguyen, Hieu M. Vu, Lei Zhang, Nhi Y. Pham Published: 2025-10-05Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Agentic Misalignment: How LLMs Could Be Insider Threats Aengus Lynch, Benjamin Wright, Caleb Larson, Ethan Perez Published: 2025-10-05Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-05 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents Bin Xiao, Dong Wang, Xiangyu He, Yanjie Li Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (98%) | 1 |
| From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs Guangyu Shen, Hanxi Guo, Siyuan Cheng, Xiangyu Zhang Published: 2025-10-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | - |
| Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time Anders Woodruff, Arun Jose, Daniel Tan, David Demitri Africa Published: 2025-10-05Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 7 |
| LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions Jwala Dhamala, Ousmane Dia, Rahul Gupta, Samuel Yeh Published: 2025-10-05Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2025-10-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (98%) | 4 |
| MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering Chenlu Ding, Fan Zhang, Jiancan Wu, Leheng Sheng Published: 2025-10-05Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-10-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 3 |
| SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models Jie Zhang, Kunsheng Tang, Nenghai Yu, Peigui Qi Published: 2025-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods Bryan Hooi, Haoran Li, Yangqiu Song, Yuan Sui Published: 2025-10-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders Benyou Wang, Difan Zou, Xu Wang, Yan Hu Published: 2025-10-04Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-04 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E7 / R4 (97%) | 2 |
| How Catastrophic is Your LLM? Certifying Risk in Conversation Chengxiao Wang, Gagandeep Singh, Isha Chaudhary, Qian Hu Published: 2025-10-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |