Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning Adam Karvonen, Caden Juang, Helena Casademunt, Neel Nanda Published: 2025-07-22Area: Model EditingCitations: 13 Tags: ai-safety, alignment-training, empirical, interpretability, model-editing | 2025-07-22 | Model Editing | ai-safety, alignment-training, empirical, interpretability, model-editing | E6 / R3 (93%) | 13 |
| Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning Boheng Li, Junjie Wang, Leyi Qi, Renjie Gu Published: 2025-07-22Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-07-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 6 |
| Does More Inference-Time Compute Really Help Robustness? Chawin Sitawarin, Chong Xiang, Jiachen T. Wang, Prateek Mittal Published: 2025-07-21Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | 3 |
| PromptArmor: Simple yet Effective Prompt Injection Defenses Basel Alomair, Dawn Song, Haonan Wang, Hend Alzahrani Published: 2025-07-21Area: Adversarial RobustnessCitations: 44 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 44 |
| AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning An Zhang, Leheng Sheng, Xiang Wang, XiuYu Zhang Published: 2025-07-20Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-07-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 5 |
| Subliminal Learning: Language models transmit behavioral traits via hidden signals in data Alex Cloud, Anna Sztyber-Betley, Jacob Hilton, James Chua Published: 2025-07-20Area: Deception & FailureCitations: 35 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R4 (96%) | 35 |
| GIFT: Gradient-aware Immunization of diffusion models against malicious Fine-Tuning with safe concepts retention Amro Abdalla, Bogdan Raita, Dan DeGenaro, Ismail Shaheen Published: 2025-07-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 1 |
| Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models Maithili Joshi, Palash Nandi, Tanmoy Chakraborty Published: 2025-07-18Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-18 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | - |
| Insights into a radiology-specialised multimodal large language model with sparse autoencoders Anton Schwaighofer, Daniel Coelho de Castro, Felix Meissen, Javier Alvarez-Valle Published: 2025-07-17Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-07-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (96%) | 1 |
| Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers Biyu Zhou, Fuqing Zhu, Jizhong Han, Liang Lin Published: 2025-07-17Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |
| Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models Stephen H. Bach, Yik Siu Chan, Zheng-Xin Yong Published: 2025-07-16Area: Safety EvaluationCitations: 9 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-07-16 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 9 |
| LLMs Encode Harmfulness and Refusal Separately David Bau, Jiachen Zhao, Jing Huang, Weiyan Shi Published: 2025-07-16Area: Representation AnalysisCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R4 (94%) | 10 |
| Minimalist Concept Erasure in Generative Models Ashkan Khakzar, Er Jin, Johannes Stegmaier, Kenji Kawaguchi Published: 2025-07-16Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2025-07-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 5 |
| Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities Michael Backes, Yang Zhang, Yiting Qu Published: 2025-07-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-15 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (98%) | 1 |
| Internal Value Alignment in Large Language Models through Controlled Value Vector Activation Defu Lian, Haoran Jin, Meng Li, Minlie Huang Published: 2025-07-15Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | 3 |
| Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility Adam Gleave, Brendan Murphy, Dillon Bowen, Julius Broomfield Published: 2025-07-15Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 8 |
| Scaling laws for activation steering with Llama 2 models and refusal mechanisms Ayse Arslan, Clark Benham, Ivory Yang, Jasmine Xinze Li Published: 2025-07-15Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (94%) | 1 |
| The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs Chaochao Lu, Conghui He, Dongrui Liu, Haoyun Xu Published: 2025-07-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| What Should LLMs Forget? Quantifying Personal Data in LLMs for Right-to-Be-Forgotten Requests Dimitri Staufer Published: 2025-07-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning Chaowei Xiao, Marco Pavone, Somesh Jha, Yingzi Ma Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| PLA: Prompt Learning Attack against Text-to-Image Generative Models Bin Xiao, Xinqi Lyu, Yanjie Li, Yihao Liu Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training Pengfei Du Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | E5 / R3 (95%) | 2 |
| Compressed Computation: Dense Circuits in a Toy Model of the Universal-AND Problem Adam Newgas Published: 2025-07-13Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-07-13 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | - |
| Evaluating SAE interpretability without explanations Gon莽alo Paulo, Nora Belrose Published: 2025-07-11Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 1 |
| One Token to Fool LLM-as-a-Judge Dian Yu, Dong Yu, Haitao Mi, Haolin Liu Published: 2025-07-11Area: Deception & FailureCitations: 34 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-07-11 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (98%) | 34 |
| SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems Chakkrit Tantithamthavorn, Michael Fu, Rui Yang, Wenliang Shan Published: 2025-07-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 2 |
| The Non-Linear Representation Dilemma: Is Causal Abstraction Enough for Mechanistic Interpretability? Denis Sutter, Julian Minder, Thomas Hofmann, Tiago Pimentel Published: 2025-07-11Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 11 |
| Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Chen Luo, Fali Wang, Hui Liu, Jingying Zeng Published: 2025-07-10Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| Defending Against Prompt Injection With a Few DefensiveTokens Chawin Sitawarin, David Wagner, Nicholas Carlini, Sizhe Chen Published: 2025-07-10Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 21 |
| May I have your Attention? Breaking Fine-Tuning based Prompt Injection Defenses using Architecture-Aware Attacks Andrey Labunets, Earlence Fernandes, Nishit V. Pandya, Sicun Gao Published: 2025-07-10Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R4 (95%) | 6 |