Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Multilingual Amnesia: On the Transferability of Unlearning in Multilingual LLMs Aditi Khandelwal, Alireza Dehghanpour Farashah, Golnoosh Farnadi, Marylou Fauchard Published: 2026-01-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Safety Not Found (404): Hidden Risks of LLM-Based Robotics Decision Making Jaeyoon Seo, Jean Oh, Jihie Kim, Jua Han Published: 2026-01-09Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-01-09 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (98%) | - |
| AM3Safety: Towards Data Efficient Alignment of Multi-modal Multi-turn Safety for MLLMs Chengkun Cai, Chi-Min Chan, Han Zhu, Haoran Li Published: 2026-01-08Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-08 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks Alek Dimitriev, Alex Silverstein, Alwin Peng, Andrew Persic Published: 2026-01-08Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 6 |
| Mechanisms of Prompt-Induced Hallucination in Vision-Language Models Carsten Eickhoff, Dana Arad, Kyle Mahowald, Michal Golovanevsky Published: 2026-01-08Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2026-01-08 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models Badhan Chandra Das, Joaquin Molto, Md Tasnim Jawad, M. Hadi Amini Published: 2026-01-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation Dazhen Deng, Huawei Zheng, Sen Yang, Shouling Ji Published: 2026-01-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| When Models Manipulate Manifolds: The Geometry of a Counting Task Adam Pearce, Chris Olah, Emmanuel Ameisen, Isaac Kauvar Published: 2026-01-08Area: Mechanistic Interp.Citations: 12 Tags: ai-safety, empirical, mechanistic-interp | 2026-01-08 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 12 |
| ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification Gaotang Li, Hanghang Tong, Philip Li, Tianxin Wei Published: 2026-01-07Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning Haibo Hu, Minxin Du, Peizhao Hu, Qingqing Ye Published: 2026-01-07Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-07 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| Generalization to Political Beliefs from Fine-Tuning on Sports Team Preferences Owen Terry Published: 2026-01-07Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2026-01-07 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (93%) | - |
| HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense Haoyu Li, Jianhua Li, Jun Wu, Siyuan Li Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R5 (96%) | - |
| How Does the Thinking Step Influence Model Safety? An Entropy-based Safety Reminder for LRMs Hyundong Jin, Su-Hyeon Kim, Yejin Lee, Yo-Sub Han Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models Gary Geunbae Lee, San Kim Published: 2026-01-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis Chenfu Bao, Du Su, Guoqiu Wang, Jinchang Hou Published: 2026-01-07Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | - |
| Shadow Unlearning: A Neuro-Semantic Approach to Fidelity-Preserving Faceless Forgetting in LLMs Ashok Urlana, Bala Mallikarjunarao Garlapati, Dinesh Srivasthav P, Ponnurangam Kumaraguru Published: 2026-01-07Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules Bing Qin, Di Wu, Mingzhe Li, Xin Lu Published: 2026-01-07Area: Alignment TrainingCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-07 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (99%) | 1 |
| What Matters For Safety Alignment? Hui-Ling Zhen, Lihao Yin, Mingxuan Yuan, Xianzhi Yu Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (93%) | - |
| Adversarial Contrastive Learning for LLM Quantization Attacks Dinghong Song, Dong Li, Hai Wan, Pengfei Su Published: 2026-01-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models Qin Hu, Xiangdong Hu, Xiaojun Jia, Yangyang Jiang Published: 2026-01-06Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-06 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | - |
| Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks Florian Bernard, Frank R. Schmidt, Zhakshylyk Nurlanov Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification Baosheng Wang, Bin Ji, Jie Yu, Shasha Li Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Learning to Diagnose and Correct Moral Errors: Towards Enhancing Moral Sensitivity in Large Language Models Bocheng Chen, Guangliang Liu, Han Zi, Kristen Johnson Published: 2026-01-06Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Maximizing Local Entropy Where It Matters: Prefix-Aware Localized LLM Unlearning Binbin Zheng, Fei Shen, Long Bai, Naixin Zhai Published: 2026-01-06Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2026-01-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders Qi Su, Ruikang Zhang, Shuo Wang Published: 2026-01-06Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning Ahmed Y. Radwan, Azib Farooq, Shaina Raza, Sindhuja Chaduvula Published: 2026-01-06Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Rendering Data Unlearnable by Exploiting LLM Alignment Mechanisms Jun Sun, Ruihan Zhang Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | - |
| The Anatomy of Conversational Scams: A Topic-Based Red Teaming Analysis of Multi-Turn Interactions in LLMs Haoming Tang, Siying Hu, Xiangzhe Yuan, Zhenhao Zhang Published: 2026-01-06Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2026-01-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | - |
| TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering Scott Thornton Published: 2026-01-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Understanding Reward Hacking in Text-to-Image Reinforcement Learning Cho-Jui Hsieh, Hengguang Zhou, Kuei-Chun Kao, Yunqi Hong Published: 2026-01-06Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2026-01-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 1 |