Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs Kuofeng Gao, Shu-Tao Xia, Tao Dai, Tao Yu Published: 2025-11-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| A Self-Improving Architecture for Dynamic Safety in Large Language Models Tyler Slater Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (99%) | - |
| Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment Peijie Sun, Peng Zhang Published: 2025-11-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework Kuofeng Gao, Shu-Tao Xia, Tao Dai, Yang Bai Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | - |
| MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs Chaochao Lu, Guangze Ye, Kaicheng Shen, Liang He Published: 2025-11-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives Chloe Li, Daniel Tan, Mary Phuong Published: 2025-11-10Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-11-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R2 (94%) | 6 |
| When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs Jian Li, Kaifeng Lyu, Ruinian Chang, Shaowen Wang Published: 2025-11-10Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-11-10 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | - |
| Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits Ashwinee Panda, Dev Patel, Diekola Raimi, Gabriel Grand Published: 2025-11-09Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-11-09 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (97%) | 1 |
| EASE: Practical and Efficient Safety Alignment for Small Language Models An Wang, Guoli Wang, Haonan Shi, Tu Ouyang Published: 2025-11-09Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs Hang Su, Jiawei Chen, Shuyuan Liu, Xiao Yang Published: 2025-11-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | - |
| MONICA: Real-Time Monitoring and Calibration of Chain-of-Thought Sycophancy in Large Reasoning Models Di Wang, Hongming Wang, Jingyu Hu, Shu Yang Published: 2025-11-09Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2025-11-09 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 6 |
| SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization Xiangliang Zhang, Xiangqi Wang, Yue Huang Published: 2025-11-09Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 1 |
| Catching Contamination Before Generation: Spectral Kill Switches for Agents Valentin No毛l Published: 2025-11-08Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-11-08 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | - |
| DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning Chris Yuhao Liu, Jinlong Pang, Quan Liu, Wei Wei Published: 2025-11-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-11-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| APP: Accelerated Path Patching with Task-Specific Pruning Carsten Eickhoff, Frauke Andersen, Ruochen Zhang, William Rudman Published: 2025-11-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder Kaidi Xu, Song Wang, Tianlong Chen, Zhen Tan Published: 2025-11-07Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-11-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Leak@k: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding Hadi Reisizadeh, Jiajun Ruan, Mingyi Hong, Sijia Liu Published: 2025-11-07Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-07 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 1 |
| Steering Language Models with Weight Arithmetic Constanza Fierro, Fabien Roger Published: 2025-11-07Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-11-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 2 |
| Addressing divergent representations from causal interventions on neural networks Alexa R. Tartaglini, Christopher Potts, Satchel Grant, Simon Jerome Han Published: 2025-11-06Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-11-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (96%) | - |
| REMIND: Input Loss Landscapes Reveal Residual Memorization in Post-Unlearning LLMs Avi Mendelson, Liran Cohen, Yaniv Nemcovesky Published: 2025-11-06Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Jailbreaking in the Haystack Aditi Raghunathan, Alexander Robey, Chen Henry Wu, Rishi Rajesh Shah Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (98%) | 2 |
| Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs Aina Sui, Yize Liu, Yunyun Hou Published: 2025-11-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| STARS: Segment-level Token Alignment with Rejection Sampling in Large Language Models Mikhail Kuznetsov, Mohammad Areeb, Mohammad Atif Quamar, Muslum Ozgur Ozmen Published: 2025-11-05Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-05 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| An Automated Framework for Strategy Discovery, Retrieval, and Evolution in LLM Jailbreak Attacks Guisheng Fan, Hengrun Zhang, Huiqun Yu, Kan Ling Published: 2025-11-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Evaluating Control Protocols for Untrusted AI Agents Buck Shlegeris, Chloe Loughridge, Henry Sleight, Joe Benton Published: 2025-11-04Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2025-11-04 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (94%) | 1 |
| On The Dangers of Poisoned LLMs In Security Automation Even Eilertsen, Patrick Karlsen Published: 2025-11-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (93%) | - |
| Optimizing AI Agent Attacks With Synthetic Data Avery Griffin, Chloe Loughridge, Joe Benton, Jon Kutasov Published: 2025-11-04Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-11-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 3 |
| The Realignment Problem: When Right becomes Wrong in LLMs Aakash Sen Sharma, Debdeep Sanyal, Murari Mandal, Shirish Karande Published: 2025-11-04Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges Hamin Koo, Jaehyung Kim, Minseon Kim Published: 2025-11-03Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 1 |
| Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI Evan Hubinger, Henning Bartsch, Nathan Lambert, Sharan Maiya Published: 2025-11-03Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-11-03 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 3 |