Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Transferable Direct Prompt Injection via Activation-Guided MCMC Sampling Hao Zhang, Jing Wang, Minghui Li, Shengshan Hu Published: 2025-09-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint Bing Qin, Fenglei Fan, Jiawei Cao, Kai He Published: 2025-09-08Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-09-08 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 4 |
| Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift Guangdong Bai, Shuai Yuan, Wang Kailong, Yuxi Li Published: 2025-09-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| From Noise to Narrative: Tracing the Origins of Hallucinations in Transformers Danilo Bzdok, Jack Stanley, Luca Scimeca, Praneet Suresh Published: 2025-09-08Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-08 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| Mind Your Server: A Systematic Study of Parasitic Toolchain Attacks on the MCP Ecosystem Libo Chen, Qinsheng Hou, Shenghong Li, Shuli Zhao Published: 2025-09-08Area: Agent SafetyCitations: 6 Tags: agent-safety, ai-safety, empirical | 2025-09-08 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | 6 |
| MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security Bing Qin, Fenglei Fan, Jiawei Cao, Sendong Zhao Published: 2025-09-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 1 |
| Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal Amir Abdullah, Erik Cambria, Nirmalendu Prakash, Ranjan Satapathy Published: 2025-09-07Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-07 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 4 |
| Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy Published: 2025-09-07Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-09-07 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs Debdeep Sanyal, Manodeep Ray, Murari Mandal Published: 2025-09-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints Matthew Dressman, Natalie Isak, Waris Gill Published: 2025-09-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain Amin Bigdeli, Amira Ghenai, Charles L. A. Clarke, Shakiba Amirshahi Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 2 |
| False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize Cheng Wang, Muhao Chen, Qin Liu, Zeming Wei Published: 2025-09-04Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 2 |
| Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions Faruk Alpay Lightcap, Taylan Alpay Published: 2025-09-04Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 1 |
| MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors Bo Jin, Jingya Wang, Meng Han, Xin Tong Published: 2025-09-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Can LLMs Lie? Investigation beyond Hallucination Deepak Pathak, Haoran Huan, Mengning Wu, Mihir Prabhudesai Published: 2025-09-03Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, interpretability | 2025-09-03 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (94%) | 1 |
| PersonaTeaming: Exploring How Introducing Personas Can Improve Automated AI Red-Teaming Akshita Jha, Ken Holstein, Lauren Wilcox, Leon A Gatys Published: 2025-09-03Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2025-09-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 5 |
| Preserving Bilinear Weight Spectra with a Signed and Shrunk Quadratic Activation Function Jason Abohwo, Thomas Mosen Published: 2025-09-02Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-09-02 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (99%) | - |
| Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs Francesco Croce, Matthias Hein, Maximilian M眉ller, Naman Deep Singh Published: 2025-09-02Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-09-02 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 4 |
| CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention Chenhan Yuan, Fei Huang, Junyang Lin, Tsung-Yi Ho Published: 2025-09-01Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (97%) | 3 |
| Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity Anuj Sharma, Ibne Farabi Shihab, Sanjeda Akter Published: 2025-09-01Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Unraveling LLM Jailbreaks Through Safety Knowledge Neurons Chongwen Zhao, Kaizhu Huang Published: 2025-09-01Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Superposition in Graph Neural Networks Han Xuanyuan, Lukas Pertl, Pietro Li貌 Published: 2025-08-31Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-08-31 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (95%) | 1 |
| Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Gaojie Jin, Jianhong Wang, Sihao Wu, Wei Huang Published: 2025-08-30Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Mechanistic Interpretability for Steering Vision-Language-Action Models Bear H盲on, Claire Tomlin, Ian Chuang, Kaylene Stocking Published: 2025-08-30Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-30 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | 3 |
| The Resurgence of GCG Adversarial Attacks on Large Language Models Huizhen Shu, Peikang Hu, Xuying Li, Yuting Tan Published: 2025-08-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | 1 |
| When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment Hainiu Xu, Hanqi Yan, Shu Yang, Siya Qi Published: 2025-08-30Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Distribution-Aware Feature Selection for SAEs Alice Rigg, Amirali Abdullah, Michael Lan, Narmeen Oozeer Published: 2025-08-29Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-08-29 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | - |
| Improving Fisher Information Estimation and Efficiency for LoRA-based LLM Unlearning Buru Chang, Eunwon Kim, Junsuk Choe, Yejin Kim Published: 2025-08-29Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-08-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (98%) | 3 |
| Standard vs. Modular Sampling: Best Practices for Reliable LLM Unlearning Lucia Passaro, Praveen Bushipaka, Tommaso Cucinotta Published: 2025-08-29Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-29 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | - |
| Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification Li Wang, Ning Yu, Shanqing Guo, Xiangtao Meng Published: 2025-08-28Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-08-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (93%) | - |