Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| PolySAE: Modeling Feature Interactions in Sparse Autoencoders via Polynomial Decoding Andreas D. Demou, James Oldfield, Mihalis Nicolaou, Panagiotis Koromilas Published: 2026-02-01Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models Amit LeVi, Avi Mendelson, Chaim Baskin, Elad Hirshel Published: 2026-02-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models Christopher Leckie, Hanxun Huang, Kaiyuan Cui, Sarah Erfani Published: 2026-02-01Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| A Causal Perspective for Enhancing Jailbreak Attack and Defense Haozhe Feng, Hui Xue, Jialing Tao, Jiexi Liu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| BLOCK-EM: Preventing Emergent Misalignment by Blocking Causal Features Guannan Qu, Muhammed Ustaomeroglu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R2 (95%) | - |
| Evolving Interpretable Constitutions for Multi-Agent Coordination Alice Saito, Hershraj Niranjani, Phan Xuan Tan, Rayan Yessou Published: 2026-01-31Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-01-31 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (93%) | - |
| Self-Guard: Defending Large Reasoning Models via Enhanced Self-Reflection An Zhang, Chenhang Cui, Gelei Deng, Jingjun Xu Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Sparsity-Aware Unlearning for Large Language Models Chuang Hu, Jiawei Jiang, Jingling Yuan, Ke Xu Published: 2026-01-31Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-31 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | - |
| Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models Dongwon Lee, Jiaxi Yang, Shicheng Liu, Yuchen Yang Published: 2026-01-31Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2026-01-31 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Text is All You Need for Vision-Language Model Jailbreaking Cho-Jui Hsieh, Tianle Zheng, Yihang Chen, Youyuan Jiang Published: 2026-01-31Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Towards Interpretable Hallucination Analysis and Mitigation in LVLMs via Contrastive Neuron Steering Cheng Deng, Chenghao Xu, Fen Fang, Guangtao Lyu Published: 2026-01-31Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2026-01-31 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| Unifying Adversarial Robustness and Training Across Text Scoring Models Hosna Oyarhoseini, Jimmy Lin, Manveer Singh Tamber Published: 2026-01-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (94%) | - |
| A Fragile Guardrail: Diffusion LLM's Safety Blessing and Its Failure Mode Adel Bibi, Eric Sommerlade, Jialin Yu, Junchi Yu Published: 2026-01-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning Abhishek Mishra, Deepesh Suranjandass, Donnie Winkelmann, Mugilan Arulvanan Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | - |
| Beyond Activation Patterns: A Weight-Based Out-of-Context Explanation of Sparse Autoencoder Features Yiting Liu, Zhi-Hong Deng Published: 2026-01-30Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (95%) | - |
| Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures Jie Zhang, Nenghai Yu, Qiu Han, Tianwei Zhang Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Efficient and accurate steering of Large Language Models through attention-guided feature learning Adityanarayanan Radhakrishnan, Ashia Wilson, Parmida Davarmanesh Published: 2026-01-30Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-30 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | - |
| Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models Charles Westphal, Fernando E. Rosas, Keivan Navaie Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| Language Model Circuits Are Sparse in the Neuron Basis Aryaman Arora, Jacob Steinhardt, Sarah Schwettmann, Zhengxuan Wu Published: 2026-01-30Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2026-01-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 1 |
| No More, No Less: Least-Privilege Language Models Dominykas Seputis, Mihaela van der Schaar, Patrikas Vanagas, Paulius Rauba Published: 2026-01-30Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-30 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| RAudit: A Blind Auditing Protocol for Large Language Model Reasoning Edward Y. Chang, Longling Geng Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (96%) | - |
| Real-Time Aligned Reward Model beyond Semantics Deqing Wang, Fuzhen Zhuang, Hongyan Xie, Jianbin Zheng Published: 2026-01-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2026-01-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Safer Policy Compliance with Dynamic Epistemic Fallback Harish Tayyar Madabushi, Joseph Marvin Imperial Published: 2026-01-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| The Alignment Curse: Cross-Modality Jailbreak Transfer in Omni-Models Adel Bibi, Aoxi Liu, Junchi Yu, Philip Torr Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2026-01-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (92%) | - |
| The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity? Alexander H盲gele, Aryo Pradipta Gema, Ethan Perez, Henry Sleight Published: 2026-01-30Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-01-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | - |
| Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities Dinh Mai Phuong, Hoang Thanh-Tung, Le-Minh Nguyen, Naoya Inoue Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | - |
| DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | - |
| Factored Causal Representation Learning for Robust Reward Modeling in RLHF Biwei Huang, Fan Feng, Lei Xu, Lin Qu Published: 2026-01-29Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-29 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| FIT: Defying Catastrophic Forgetting in Continual LLM Unlearning Cheng Hong, Haibo Hu, Kun Fang, Minxin Du Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | - |
| From Logits to Latents: Contrastive Representation Shaping for LLM Unlearning Haoran Tang, Rajiv Khanna Published: 2026-01-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |