Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models Fadi Hassan, Hicham Eddoubi, Umar Faruk Abdullahi Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (98%) | - |
| Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models Aarush Rathore, Aditya Nagarsekar, Anish Sathyanarayanan Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (93%) | - |
| Inference-time Unlearning Using Conformal Prediction Amr Ahmed, Aranyak Mehta, Avinava Dubey, David Wang Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning Himabindu Lakkaraju, Shan Chen, Zidi Xiong Published: 2026-02-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-03 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | - |
| Phantom Transfer: Data-level Defences are Insufficient Against Data Poisoning Anandmayi Bhongade, Andrew Draganov, Mary Phuong, Tolga H. Dur Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures Albert No, Hyesoo Hong, Sangyeon Yoon, Wonje Jeung Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | - |
| Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility Gang Xu, Hongjie Jiang, Mengxuan Wang, Ming Li Published: 2026-02-03Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Semantic-level Backdoor Attack against Text-to-Image Diffusion Models Cheng Huang, Hongqiao Chen, Tianxin Chen, Wenbo Jiang Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models Chen Xiong, Ching-Yun Ko, Pin-Yu Chen, Tsung-Yi Ho Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | - |
| The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers Amanda Minnich, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-03Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| UnHype: CLIP-Guided Hypernetworks for Dynamic LoRA Unlearning Maciej Zieba, Maksym Petrenko, Piotr W贸jcik, Przemys艂aw Spurek Published: 2026-02-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (98%) | - |
| Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking Junshan Zhang, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2026-02-02Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2026-02-02 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (97%) | - |
| AGT-AO: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality Bifan Wei, Huan Liu, Jun Liu, Lingling Zhang Published: 2026-02-02Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (96%) | - |
| Alignment-Aware Model Adaptation via Feedback-Guided Optimization Aditya Chinchure, Gaurav Bhatt, Jiawei Zhou, Leonid Sigal Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | - |
| A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior Adam Mahdi, Dewi Gould, Harry Mayne, Justin Singh Kang Published: 2026-02-02Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-02 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (96%) | - |
| CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment Junyuan Hong, Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R4 (93%) | - |
| David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning Samuel Nellessen, Tal Kachman Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| EvoMU: Evolutionary Machine Unlearning Paul Swoboda, Pawel Batorski Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, empirical, model-editing | E6 / R5 (98%) | - |
| Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs Cheng-Kuang Wu, Yen-Shan Chen, Yun-Nung Chen, Zhi Rui Tam Published: 2026-02-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| From Directions to Regions: Decomposing Activations in Language Models via Local Geometry Atticus Geiger, Mor Geva, Omri Fahn, Or Shafran Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | - |
| Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron Binghao Wang, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety Chaochao Lu, Han Qi, Qiaosheng Zhang, Tianhang Zheng Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (94%) | - |
| Mechanistic Indicators of Steering Effectiveness in Large Language Models Flora Salim, Hao Xue, Mehdi Jafari Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (93%) | - |
| RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse Cheng Long, Kwok-Yan Lam, Mingrui Liu, Sixiao Zhang Published: 2026-02-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Reward-free Alignment for Conflicting Objectives Peter L. Chen, Tianyi Lin, Xiaopeng Li, Xi Chen Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (97%) | - |
| Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment Byeonghu Na, HeeSun Bae, Hyungho Na, Il-Chul Moon Published: 2026-02-02Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models Jiaqian Li, Kuan-Hao Huang, Yanshu Li Published: 2026-02-02Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-02 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| There Is More to Refusal in Large Language Models than a Single Direction Faaiz Joad, Husrev Taha Sencar, Majd Hawasly, Nadir Durrani Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| Building Better Deception Probes Using Targeted Instruction Pairs Devina Jain, Joseph Bloom, Satvik Golechha, Shivam Arora Published: 2026-02-01Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | - |
| How Does Unfaithful Reasoning Emerge from Autoregressive Training? A Study of Synthetic Experiments Amr Alazali, Fuxin Wang, Yiqiao Zhong Published: 2026-02-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | - |