Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| GEP: A GCG-Based method for extracting personally identifiable information from chatbots built on small language models Jieli Zhu, Vi Ngoc-Nha Tran Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b Nils Durner Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| Preemptive Detection and Steering of LLM Misalignment via Latent Reachability Sathwik Karnik, Somil Bansal Published: 2025-09-25Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 3 |
| RLCracker: Exposing the Vulnerability of LLM Watermarks with Adaptive RL Attacks Hanbo Huang, Hao Zheng, Lin Liu, Shiyu Liang Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs Daniel Vennemeyer, Phan Anh Duong, Tianyu Jiang, Tiffany Zhan Published: 2025-09-25Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-25 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization Chongyang Gao, Kaize Ding, Ren Wang, Wenhan Wu Published: 2025-09-24Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-24 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R3 (95%) | - |
| bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs Aiying Li, An Zhang, Jiancan Wu, Junkang Wu Published: 2025-09-24Area: Deception & FailureCitations: - Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2025-09-24 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E4 / R3 (94%) | - |
| Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing Aishan Liu, Dacheng Tao, Siyuan Liang, Xianglong Liu Published: 2025-09-24Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-09-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models Chao Du, Jie Li, Tianyu Pang, Xingjun Ma Published: 2025-09-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 1 |
| JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation Md Jueal Mia, M. Hadi Amini Published: 2025-09-24Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (97%) | - |
| LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation Huizhen Shu, Xuying Li, Zhuo Li Published: 2025-09-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models Enguang Liu, Haotian Zhu, Jisheng Dang, Liming Lu Published: 2025-09-24Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-09-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Anecdoctoring: Automated Red-Teaming Across Language and Place Alejandro Cuevas, Bharat Kumar Nayak, Dan Vann, Madeleine I. G. Daepp Published: 2025-09-23Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Cyclic Ablation: Testing Concept Localization against Functional Regeneration in AI Eduard Kapelko Published: 2025-09-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-09-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| LLMZ+: Contextual Prompt Whitelist Principles for Agentic LLMs Andy Perkins, Charlotte Crowell, Noorbakhsh Amiri Golilarz, Raj Patel Published: 2025-09-23Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| SAEmnesia: Erasing Concepts in Diffusion Models with Supervised Sparse Autoencoders Alan Perotti, Enrico Cassano, Marco Grangetto, Marco Nurisso Published: 2025-09-23Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 1 |
| Steering Multimodal Large Language Models Decoding for Context-Aware Safety Guangyao Dou, Meng Jiang, Radha Poovendran, Xiangchi Yuan Published: 2025-09-23Area: Multimodal SafetyCitations: 2 Tags: ai-safety, empirical, multimodal-safety | 2025-09-23 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 2 |
| The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind Aniket Sharma, Caleb DeLeeuw, Gaurav Chawla, Vanessa Dietze Published: 2025-09-23Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-09-23 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 2 |
| Who is In Charge? Dissecting Role Conflicts in Instruction Following Siqi Zeng Published: 2025-09-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-09-23 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R4 (92%) | - |
| Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge Hui Dou, Kaibin Wang, Ning Xu, Yiwen Zhang Published: 2025-09-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models Katharina Simbeck, Mariam Mahran Published: 2025-09-22Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, interpretability, representation-analysis | 2025-09-22 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (95%) | 2 |
| DecipherGuard: Understanding and Deciphering Jailbreak Prompts for a Safer Deployment of Intelligent Software Systems Chakkrit Tantithamthavorn, Chetan Arora, Gunel Gulmammadova, Joey Chua Published: 2025-09-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Evolution of Concepts in Language Model Pre-Training Jiaxing Wu, Wentao Shu, Xipeng Qiu, Xuyang Ge Published: 2025-09-21Area: Training DynamicsCitations: 2 Tags: ai-safety, empirical, training-dynamics | 2025-09-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (94%) | 2 |
| LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization Bihao Zhan, Jie Zhou, Junsong Li, Liang He Published: 2025-09-21Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models Jun Jiang, Kejiang Chen, Meng Tong, Nenghai Yu Published: 2025-09-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 1 |
| Challenging the Evaluator: LLM Sycophancy Under User Rebuttal Daniel Khashabi, Sungwon Kim Published: 2025-09-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| DISCO: Disentangled Communication Steering for Large Language Models Aria Masoomi, Jennifer Dy, Masih Eskandar, Max Torop Published: 2025-09-20Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-09-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 1 |
| Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories Chandan K Reddy, Lifu Huang, Ming Jin, Mohammad Beigi Published: 2025-09-20Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 3 |
| Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets Masanori Yamada, Takayuki Miura, Tomoharu Iwata, Tomoya Yamashita Published: 2025-09-19Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-19 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 1 |
| Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots Amir M. Rahmani, Chenhan Lyu, Pengfei Zhang, Yutong Song Published: 2025-09-19Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-09-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |