Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework Aakriti Shah, Thai Le Published: 2025-10-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-29 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| A Pragmatic Way to Measure Chain-of-Thought Monitorability David K. Elson, Rohin Shah, Roland S. Zimmermann, Scott Emmons Published: 2025-10-28Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| Automatically Finding Rule-Based Neurons in OthelloGPT Adam Karvonen, Aditya Singh, Can Rager, Srujananjali Medicherla Published: 2025-10-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-10-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | - |
| AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts Huashan Chen, Lin Wang, Wanqian Zhang, Weiping Wang Published: 2025-10-28Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Can Aha Moments Be Fake? Identifying True and Decorative Thinking Steps in Chain-of-Thought Dawn Song, Jiachen Zhao, Weiyan Shi, Yiyou Sun Published: 2025-10-28Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-10-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 2 |
| Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers Rabin Adhikari Published: 2025-10-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-10-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| SafeEditor: Unified MLLM for Efficient Post-hoc T2I Safety Editing Jiahao Luo, Juntao Dai, Qiufan Pang, Ruiyang Zhang Published: 2025-10-28Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-10-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability Bo Li, Chaowei Xiao, Minzhou Pan, Peiyang Xu Published: 2025-10-28Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-10-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R4 (97%) | 1 |
| Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) Alon Albalak, Liwei Jiang, Maarten Sap, Margaret Li Published: 2025-10-27Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2025-10-27 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (98%) | 20 |
| PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization Di Wang, Huanyi Xie, Liangyu Wang, Lijie Hu Published: 2025-10-27Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 2 |
| Probing Knowledge Holes in Unlearned LLMs Charles Fleming, Hoang Anh Just, Ming Jin, Myeongseob Ko Published: 2025-10-27Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-27 | Model Editing | ai-safety, empirical, model-editing | E7 / R5 (94%) | - |
| QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents Dongdong She, Kaikai Zhang, Mingyu Luo, Ping Chen Published: 2025-10-27Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Retracing the Past: LLMs Emit Training Data When They Get Lost Adam Nguyen, Charles Fleming, Ming Jin, Myeongseob Ko Published: 2025-10-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts Samaksh Bhargav, Zining Zhu Published: 2025-10-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Semantic Surgery: Zero-Shot Concept Erasure in Diffusion Models Chengyu Liu, Jingwen Ye, Lexiang Xiong, Yan Liu Published: 2025-10-26Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-10-26 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 1 |
| Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs Chenxue Yang, Jinzhe Liu, Junshu Sun, Shufan Shen Published: 2025-10-25Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 2 |
| Label Smoothing Improves Gradient Ascent in LLM Unlearning Hao Zheng, Jiaheng Wei, Ling Li, Zhijie Deng Published: 2025-10-25Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-25 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 2 |
| Mapping Faithful Reasoning in Language Models Andreas Damianou, Jiazheng Li, Jos茅 Luis Redondo Garc铆a, J Rosser Published: 2025-10-25Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 2 |
| Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency Michael Backes, Mingjie Li, Yang Zhang, Yukun Jiang Published: 2025-10-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Adversarial D茅j脿 Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks Charith Peris, Jiachen T. Wang, Mahavir Dabas, Ming Jin Published: 2025-10-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 1 |
| Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses Kar Wai Fok, Vrizlynn L.L. Thing, Xingwei Zhong Published: 2025-10-24Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | - |
| Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference Aidan Li, Rob Brekelmans, Roger Grosse, Stephen Zhao Published: 2025-10-24Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-24 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning Cheng Long, Kwok Yan Lam, Mingrui Liu, Sixiao Zhang Published: 2025-10-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 1 |
| Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models Alexander Robey, Andrej Risteski, Avi Schwarzschild, Frauke Kreuter Published: 2025-10-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Weak-to-Strong Generalization under Distribution Shifts Jan Sobotka, Maria Brbi膰, Myeongho Jeon, Suhwan Choi Published: 2025-10-24Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-24 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R4 (94%) | - |
| Ask a Strong LLM Judge when Your Reward Model is Uncertain Changlong Yu, Haoming Jiang, Hyokun Yun, Ilgee Hong Published: 2025-10-23Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-10-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations Divyanshu Kumar, Nitin Aravind Birur, Prashanth Harshangi, Sahil Agarwal Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| SAID: Empowering Large Language Models with Self-Activating Internal Defense Chao Huang, Jiawen Zhang, Jie Wen, Mu Li Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training Stephen H. Bach, Zheng-Xin Yong Published: 2025-10-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-23 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection Bo Han, Gang Niu, James Cheng, Masashi Sugiyama Published: 2025-10-23Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-23 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | - |