Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models Anshuman Chhabra, Hadi Askari, Muhao Chen, Shahriar Kabir Nahin Published: 2025-10-04Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 1 |
| A Granular Study of Safety Pretraining under Model Abliteration Bernt Schiele, Jonas Jakubassa, Margret Keuper, Priyam Dey Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs Jun Luo, Xurui Song, Zhixin Xie Published: 2025-10-03Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| External Data Extraction Attacks against Retrieval-Augmented Large Language Models Boheng Li, Dacheng Tao, Leyi Qi, Shuo Shao Published: 2025-10-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 1 |
| Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs Fatmazohra Rezkellah, Ramzi Dakhmouche Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain Abhay Puri, Alexandre Drouin, Alexandre Lacoste, Chandra Kiran Reddy Evuru Published: 2025-10-03Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2025-10-03 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (95%) | 1 |
| Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders Charibeth Cheng, Kriz Tahimic Published: 2025-10-03Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-03 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | - |
| NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks Daniel Takabi, Eduardo Blanco, Javad Rafiei Asl, Mohammad Ghasemigol Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 2 |
| Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks Ramayya Krishnan, Rema Padman, Yubo Li Published: 2025-10-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Untargeted Jailbreak Attack Di Wang, Kedong Xiu, Kui Ren, Tianhang Zheng Published: 2025-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 2 |
| Bypassing Prompt Guards in Production with Controlled-Release Prompting Jaiden Fairoze, Keewoo Lee, Mingyuan Wang, Sanjam Garg Published: 2025-10-02Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (98%) | 1 |
| Dynamic Target Attack Churui Zeng, Di Wang, Kedong Xiu, Kui Ren Published: 2025-10-02Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| InvThink: Towards AI Safety via Inverse Reasoning Chunjong Park, Cynthia Breazeal, Daniel McDuff, Eugene Park Published: 2025-10-02Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-10-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (94%) | 1 |
| Machine Learning for Detection and Analysis of Novel LLM Jailbreaks Aditya Pramar, John Hawkins, Rodney Beard, Rohitash Chandra Published: 2025-10-02Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (94%) | 1 |
| RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents Bo Li, Chengquan Guo, Chulin Xie, Dawn Song Published: 2025-10-02Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-10-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (95%) | 4 |
| ToolTweak: An Attack on Tool Selection in LLM-based Agents Adel Bibi, Alasdair Paren, Eric Sommerlade, Jialin Yu Published: 2025-10-02Area: Agent SafetyCitations: 5 Tags: agent-safety, ai-safety, empirical | 2025-10-02 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 5 |
| Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks Afshin Oroojlooy, Alan Ritter, Dan Roth, Miguel Ballesteros Published: 2025-10-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| UpSafe掳C: Upcycling for Controllable Safety in Large Language Models Hongtao Xie, Kun Yang, Lingyun Yu, Shiwen Cui Published: 2025-10-02Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (93%) | - |
| AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features Mohammad Mahdi Khalili, Xudong Zhu, Zhihui Zhu Published: 2025-10-01Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |
| Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning Changsheng Wang, Chongyu Fan, Jinghan Jia, Sijia Liu Published: 2025-10-01Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Feature Identification via the Empirical NTK Jennifer Lin Published: 2025-10-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 2 |
| Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach Bo Li, Xiangfang Li, Yu Wang Published: 2025-10-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort Barbara Plank, He He, Nitish Joshi, Rico Angell Published: 2025-10-01Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 1 |
| KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning Hao Chen, Jindong Wang, Kai Qiu, Marios Savvides Published: 2025-10-01Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-01 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (94%) | - |
| Large Reasoning Models Learn Better Alignment from Flawed Thinking Duen Horng Chau, Eric Smith, Haozhu Wang, Hongyuan Zhan Published: 2025-10-01Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Mechanistic Interpretability as Statistical Estimation: A Variance Analysis of EAP-IG Fran莽ois Portet, Maxime M茅loux, Maxime Peyrard Published: 2025-10-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | 2 |
| Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours Corina S. Pasareanu, Rui Abreu, Rui Melo Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense Dongcheng Zhao, Feifei Zhao, Guobin Shen, Haibo Tong Published: 2025-10-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards Jonathan Chang, Prithviraj Ammanabrolu, Yiran Shen, Yu Xia Published: 2025-10-01Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-01 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (97%) | 3 |
| Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence Cinoo Lee, Dan Jurafsky, Dyllan Han, Myra Cheng Published: 2025-10-01Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-10-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 12 |