Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models Jos茅 Hern谩ndez-Orallo, Peter Romero, Sipeng Chen, Stephen Fitz Published: 2025-09-19Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-09-19 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E8 / R4 (97%) | 1 |
| Reward Hacking Mitigation using Verifiable Composite Rewards Mirza Farhan Bin Tarek, Rahmatollah Beheshti Published: 2025-09-19Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | 3 |
| SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-09-19Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models Akira Ito, Masanori Yamada, Takayuki Miura, Tomoya Yamashita Published: 2025-09-19Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 1 |
| Stress Testing Deliberative Alignment for Anti-Scheming Training Alexander Meinke, Alex Lloyd, Amelia Glaese, Andrei Matveiakin Published: 2025-09-19Area: Deception & FailureCitations: 26 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-09-19 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (94%) | 26 |
| Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection Chandru Venkataraman, Francois Kawala, Frank Chu, Haocheng Bian Published: 2025-09-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction Duohe Ma, Tianyun Liu, Tingwen Liu, Yingjie Zhang Published: 2025-09-18Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Evil Vizier: Vulnerabilities of LLM-Integrated XR Systems Erfan Shayegani, Jiasi Chen, Nael Abu-Ghazaleh, Sophie Chen Published: 2025-09-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| LLM Jailbreak Detection for (Almost) Free! Guorui Chen, Jindong Gu, Philip Torr, Xiaojun Jia Published: 2025-09-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 5 |
| Reveal and Release: Iterative LLM Unlearning with Self-generated Data Hongyi Wen, Linxi Xie, Shengjie Wang, Shichang Ke Published: 2025-09-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Semantic Representation Attack against Aligned Large Language Models Jianhong Pan, Jiawei Lian, Lap-Pui Chau, Lefan Wang Published: 2025-09-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 1 |
| Scrub It Out! Erasing Sensitive Memorization in Code Language Models via Machine Unlearning David Lo, Di Wang, Hai Jin, Hongyu Zhang Published: 2025-09-17Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-09-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks Akif Islam, Jungpil Shin, M. F. Mridha, Mohd Ruhul Ameen Published: 2025-09-16Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models Xiang Zheng, Xingjun Ma, Yunhan Zhao Published: 2025-09-16Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R5 (97%) | - |
| RepIt: Representing Isolated Targets to Steer Language Models Chenguang Wang, Dawn Song, Nathan W. Henry, Nicholas Crispino Published: 2025-09-16Area: Representation AnalysisCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-09-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 4 |
| The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features Clement Neo, Ilija Lichkovski, Jeremias Ferrao, Matthijs van der Lende Published: 2025-09-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-09-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | - |
| Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content Arkaitz Zubiaga, Shaz Furniturewala Published: 2025-09-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-09-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E6 / R3 (96%) | - |
| Collapse of Irrelevant Representations (CIR) Ensures Robust and Non-Disruptive LLM Unlearning Filip Sondej, Yushi Yang Published: 2025-09-15Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| NeuroStrike: Neuron-Level Attacks on Aligned LLMs Ahmad-Reza Sadeghi, Lichao Wu, Maximilian Thang, Mohamadreza Rostami Published: 2025-09-15Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time Jinghui Chen, Lu Lin, Weitong Zhang, Yifan Lan Published: 2025-09-15Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-09-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check Bo Han, Chentao Cao, Hang Li, Xiaojun Xu Published: 2025-09-15Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models Chi Zhang, Jian Zhao, Shujuan Liu, Tianle Zhang Published: 2025-09-15Area: Multimodal SafetyCitations: 3 Tags: ai-safety, empirical, multimodal-safety | 2025-09-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (96%) | 3 |
| A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment Meiyin Meng, Zaixi Zhang Published: 2025-09-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R5 (98%) | - |
| Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding Hyukhun Koh, Kyomin Jung, Seongho Joo Published: 2025-09-13Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 2 |
| Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs Benjamin Weinstein-Raun, Jeffrey Ladish, Jeremy Schlatter Published: 2025-09-13Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-13 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R4 (95%) | 2 |
| Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework Hanyu Zhang, Han Zheng, Hui Xue, Jialing Tao Published: 2025-09-11Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (97%) | 1 |
| Steering MoE LLMs via Expert (De)Activation Ali Modarressi, Franck Dernoncourt, Hanieh Deilamsalehy, Hinrich Sch眉tze Published: 2025-09-11Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-09-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 7 |
| Evaluation Awareness Scales Predictably in Open-Weights Large Language Models Ashwinee Panda, Ian Su, Julia Tan, Kevin Zhu Published: 2025-09-10Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-10 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Too Helpful, Too Harmless, Too Honest or Just Right? Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-10Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-09-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (96%) | 5 |
| X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates Haon Park, Hyunjun Kim, Junwoo Ha, Sangyoon Yu Published: 2025-09-10Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |