Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safety Alignment of LMs via Non-cooperative Games Anselm Paulus, Arman Zharmagambetov, Brandon Amos, Ilia Kulikov Published: 2025-12-23Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models Hongru Wei, Linzhi Chen, Yang Sun, Yuqi Chen Published: 2025-12-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| DREAM: Dynamic Red-teaming across Environments for AI Models Jiawei Du, Junyu Huang, Liming Lu, Shuchao Pang Published: 2025-12-22Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation Hengrui Jia, Jonas Guan, Taoran Li, Varun Chandrasekaran Published: 2025-12-22Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-22 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R4 (93%) | - |
| Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models Chenwei Liang, Chen Yang, Hao Yan, Jiayi Gu Published: 2025-12-21Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R2 (94%) | 1 |
| MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking Jianyi Zhang, Shizhao Liu, Zhen Li, Ziyin Zhou Published: 2025-12-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | - |
| Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation Xi Lin, Zehao Liu Published: 2025-12-20Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Adversarial Robustness of Vision in Open Foundation Models Jonathan Fox, Pavlos Papadopoulos, William J Buchanan Published: 2025-12-19Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-19 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (97%) | - |
| AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens Hongliang Liu, Tung-Ling Li, Yuhao Wu Published: 2025-12-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Consistency-Aware Editing for Entity-level Unlearning in Language Models Jeff Z. Pan, Jiye Liang, Ru Li, V铆ctor Guti茅rrez-Basulto Published: 2025-12-19Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | - |
| ContextLeak: Auditing Leakage in Private In-Context Learning Methods Jacob Choi, Robin Jia, Sai Praneeth Karimireddy, Shuying Cao Published: 2025-12-18Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-12-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Feature-Selective Representation Misdirection for Machine Unlearning Huaming Chen, Kim-Kwang Raymond Choo, Linghan Huang, Taozhao Chen Published: 2025-12-18Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-12-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models Abhinav Aggarwal, Akash Bharadwaj, Ankit Jain, David Zhang Published: 2025-12-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-12-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E5 / R3 (95%) | - |
| Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics David Montero, Iker Garc铆a-Ferrero, Roman Orus Published: 2025-12-18Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Activation Oracles: Training and Evaluating LLMs as General-Purpose Activation Explainers Adam Karvonen, Arnab Sen Sharma, Clement Dumas, Daniel Wen Published: 2025-12-17Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 2 |
| From Isolation to Entanglement: When Do Interpretability Methods Identify and Disentangle Known Concepts? Aaron Mueller, Andrew Lee, Dhanya Sridhar, Ekdeep Singh Lubana Published: 2025-12-17Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (94%) | 1 |
| Predictive Concept Decoders: Training Scalable End-to-End Interpretability Assistants Dami Choi, Daniel D. Johnson, Jacob Steinhardt, Sarah Schwettmann Published: 2025-12-17Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-17 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | 3 |
| SALVE: Sparse Autoencoder-Latent Vector Editing for Mechanistic Control of Neural Networks Vegard Flovik Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-17 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (96%) | - |
| The Deleuzian Representation Hypothesis Cl茅ment Cornet, Herv茅 Le Borgne, Romaric Besan莽on Published: 2025-12-17Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-12-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R4 (95%) | - |
| Unveiling the Attribute Misbinding Threat in Identity-Preserving Models Baoying Chen, Jianquan Yang, Jishen Zeng, Junming Fu Published: 2025-12-17Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-12-17 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda D. Nardi, F. Giarrusso, F. Pierucci, M. Bracale Syrnikov Published: 2025-12-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, interpretability | 2025-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, interpretability | E5 / R3 (97%) | 1 |
| Internal Reasoning vs. External Control: A Thermodynamic Analysis of Sycophancy in Large Language Models Edward Y. Chang Published: 2025-12-16Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-16 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space Pengfei Wang, Xingfu Zhou Published: 2025-12-16Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2 |
| Async Control: Stress-testing Asynchronous Control Measures for LLM Agents Alan Cooney, Arathi Mani, Asa Cooper Stickland, Charlie Griffin Published: 2025-12-15Area: Agent SafetyCitations: 1 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-12-15 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation Richard J. Young Published: 2025-12-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-15 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 2 |
| Explainable Reinforcement Learning from Human Feedback to Improve Alignment Hangfan Zhang, Minghui Zhu, Shicheng Liu, Siyuan Xu Published: 2025-12-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models TK Lee Published: 2025-12-15Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-15 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (92%) | - |
| Superposition as Lossy Compression: Measure with Sparse Autoencoders and Connect to Adversarial Vulnerability Efstratios Gavves, Leonard Bereska, Reza Samavi, Zoe Tzifa-Kratira Published: 2025-12-15Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-12-15 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 1 |
| One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs Jun Sakuma, Yixin Tan, Zhe Yu Published: 2025-12-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | - |
| Learning to Extract Context for Context-Aware LLM Inference Alessandro Sordoni, Lucas Caccia, Marc-Alexandre C么t茅, Matheus Pereira Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |