Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization Dongyi Liu, Han Xiao, Jia Li, Nuo Chen Published: 2025-12-12Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors Alex Serrano, Luke Bailey, Max McGuinness, Scott Emmons Published: 2025-12-12Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-12-12 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 1 |
| Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs Jianbin Jiao, Jing Cui, Junge Zhang, Yufei Han Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring Hao Li, Ning Zhang, Peichun Hua, Shanghao Shi Published: 2025-12-12Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-12 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Robust MLLM Unlearning via Visual Knowledge Distillation Gang Hua, Guangyu He, Haichang Gao, Haoxuan Ji Published: 2025-12-12Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | - |
| Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously Andrew Adiletta, Berk Sunar, Kathryn Adiletta, Kemal Derya Published: 2025-12-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior Erik Larsen Published: 2025-12-12Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Challenges of Evaluating LLM Safety for User Welfare Ingmar Weber, Mahalakshmi Raveenthiran, Manon Kempermann, Sai Suresh Macharla Vasu Published: 2025-12-11Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-12-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| Interpretable and Steerable Concept Bottleneck Sparse Autoencoders Akshay Kulkarni, Kowshik Thopalli, Shusen Liu, Tsui-Wei Weng Published: 2025-12-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R4 (96%) | - |
| Multi-Granular Node Pruning for Circuit Discovery A.B. Siddique, Hammad Rizwan, Hassan Sajjad, Muhammad Umair Haider Published: 2025-12-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | - |
| Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders Dianyun Wang, Huijia Wu, Huining Li, Jiaming Lyu Published: 2025-12-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs Ruimin Sun, Sohely Jahan Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models Abhishek Satyam, Junaid Farooq, Juntao Chen, Ke Chen Published: 2025-12-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment Guangkai Jiang, Siavash H. Khajavai, Xinru Liu, Zixuan Liu Published: 2025-12-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning Adel Bibi, Bernard Ghanem, Hani Itani, Hasan Abed Al Kader Hammoud Published: 2025-12-10Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs Jiangyi Deng, Qianhao Miao, Wenyuan Xu, Yanjiao Chen Published: 2025-12-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 1 |
| HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate Shenzhe Zhu Published: 2025-12-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders Aidong Zhang, Bohan Liu, Guangzhi Xiong, Sanchit Sinha Published: 2025-12-09Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | - |
| Depth-Wise Activation Steering for Honest Language Models Gracjan G贸ral, Marysia Winkels, Steven Basart Published: 2025-12-08Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 1 |
| Investigating Training and Generalization in Faithful Self-Explanations of Large Language Models Hitomi Yanaka, Masaru Isonuma, Tomoki Doi Published: 2025-12-08Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-12-08 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (97%) | - |
| LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples Hanning Chen, Mohsen Imani, Wenjun Huang, Yang Ni Published: 2025-12-08Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 3 |
| Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning Hanning Chen, Mohsen Imani, Wenjun Huang, Yang Ni Published: 2025-12-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-12-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 2 |
| Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models Richard Young Published: 2025-12-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| SAVE: Sparse Autoencoder-Driven Visual Information Enhancement for Mitigating Object Hallucination Jisoo Mok, Sangha Park, Seungryong Yoo, Sungroh Yoon Published: 2025-12-08Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-12-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models Chaochao Lu, Fenghua Weng, Wenjie Wang, Wenqi Shao Published: 2025-12-08Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-12-08 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Training LLMs for Honesty via Confessions Amelia Glaese, Boaz Barak, Gabriel Wu, Jasmine Wang Published: 2025-12-08Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-12-08 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards Fuli Feng, Moxin Li, Ouxiang Li, Wentao Shi Published: 2025-12-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | - |
| Cognitive Control Architecture (CCA): A Lifecycle Supervision Framework for Robustly Aligned AI Agents Mingjie Tang, Tianze Hu, Zaiye Chen, Zhibo Liang Published: 2025-12-07Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-12-07 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (96%) | - |
| GSAE: Graph-Regularized Sparse Autoencoders for Robust LLM Safety Steering Federico Cinus, Jehyeok Yeon, Luca Luceri, Yifan Wu Published: 2025-12-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Mechanistic Interpretability of GPT-2: Lexical and Contextual Layers in Sentiment Analysis Amartya Hatua Published: 2025-12-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |